模型 / Qwen3.5-35B-A3B (Qwen)

Qwen3.5-35B-A3B (Qwen)

4-bit MLX 量化,Apple Silicon 本地运行文本生成

作者 mlx-community

~39GB 8-bit许可 可商用任务 文本生成最近核对 2026-07-22
格式
8-bit
文件
~33GB
运行内存
~39GB–50GB
运行时
MLX_LM
下载
720

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

mlx_lm.generate --model mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit --prompt 'Explain quantum computing.' --max-tokens 200

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
为Apple Silicon优化的混合精度量化版Qwen3.5-35B-A3B,5分钟即可本地运行,基准略优于均匀4bit。适合Mac用户快速部署。
对位
对位 Qwen2.5-3B
适合
Apple Silicon 本地大模型推理 / 敏感层 8-bit 保精度的代码/指令任务
不适合
显存<16GB 设备运行受限

独立证据与社区反馈

4 个独立来源最近验证 2026-07-22

Qwen3.5-35B-A3B 在同体量模型中表现最佳,能在消费级 GPU 上本地运行且产出可媲美 Claude Sonnet 的结果,但实际编码可靠性仍不及旗舰闭源模型,且默认推理参数较差,需要精心调校系统提示词和采样参数才能发挥。

  • 消费级 GPU 本地运行 35B 参数模型
  • 262K 输入上下文窗口,适合长文档和大代码库
  • 推理能力在本地模型中表现良好
  • 每百万 token 成本比 Qwen3 Max 便宜约 2.4 倍,性价比突出
  • 在 GPQA、LiveCodeBench v6、t2-bench 上超越 Qwen3 Max
  • 支持工具调用(tool use)
  • 支持流式取消(stream cancellation)
  • 实际编码任务中不如 Claude Sonnet 可靠,跑分不等于实战
  • 默认推理参数(temperature/top-p/top-k/penalties)很差,必须按官方建议调整
  • 初次使用容易觉得表现不佳,需要精心打磨系统提示词才能发挥
  • API 端吞吐量仅 36 tok/s,不及 Qwen3 Coder Next 的 70 tok/s
  • 输出上限 82K tokens,不及 Qwen3 Coder Next 的 262K
  • 不要指望它在实际任务中挑战旗舰模型

可信度公开6项基准对比,Capability Score 77.42,超统一4-bit 0.5分

完整规格

规模
35B (3B 激活) · 128k · 下载 ~33GB · 显存最低 ~39GB · 推荐 ~50GB · 8-bit(估算)
授权
apache-2.0 · 可商用
框架
mlx
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 720 → 631

观测时间线