Qwen3.5-35B-A3B (Qwen)
4-bit MLX 量化,Apple Silicon 本地运行文本生成
~39GB 8-bit许可 可商用任务 文本生成最近核对 2026-07-22
- 格式
- 8-bit
- 文件
- ~33GB
- 运行内存
- ~39GB–50GB
- 运行时
- MLX_LM
- 下载
- 720
仅 safetensors · 无 pickle 加载风险
快速上手示例
mlx_lm.generate --model mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit --prompt 'Explain quantum computing.' --max-tokens 200 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
Qwen3.5-35B-A3B 在同体量模型中表现最佳,能在消费级 GPU 上本地运行且产出可媲美 Claude Sonnet 的结果,但实际编码可靠性仍不及旗舰闭源模型,且默认推理参数较差,需要精心调校系统提示词和采样参数才能发挥。
- 消费级 GPU 本地运行 35B 参数模型
- 262K 输入上下文窗口,适合长文档和大代码库
- 推理能力在本地模型中表现良好
- 每百万 token 成本比 Qwen3 Max 便宜约 2.4 倍,性价比突出
- 在 GPQA、LiveCodeBench v6、t2-bench 上超越 Qwen3 Max
- 支持工具调用(tool use)
- 支持流式取消(stream cancellation)
- 实际编码任务中不如 Claude Sonnet 可靠,跑分不等于实战
- 默认推理参数(temperature/top-p/top-k/penalties)很差,必须按官方建议调整
- 初次使用容易觉得表现不佳,需要精心打磨系统提示词才能发挥
- API 端吞吐量仅 36 tok/s,不及 Qwen3 Coder Next 的 70 tok/s
- 输出上限 82K tokens,不及 Qwen3 Coder Next 的 262K
- 不要指望它在实际任务中挑战旗舰模型
- 基准/排行Qwen3 Max vs Qwen3.5-35B-A3B: Benchmarks, Pricing & Which Is Better in 2026
- 社区实测Benchmarked Qwen 3.5-35B and GPT-oss-20b locally against 13 API models using real world work. GPT-oss beat Qwen by 12.5 points.
- 独立评测Qwen3 Coder Next vs Qwen3.5-35B-A3B - AI Model Comparison | OpenRouter
- 独立评测A 35B Model beats Claude Sonnet 4.5? (Qwen 3.5 35B Test)
可信度公开6项基准对比,Capability Score 77.42,超统一4-bit 0.5分
完整规格
下载动量
30天下载 720 → 631