Qwen 3.8 27B 26 倍本地速度, $0.99/M token

发布时间:2026-09-04 16:01  浏览量:1

9月 3 号, Cerebras 把 Qwen 3.8 27B 放到了公共推理端点。HN 头条挂了 1 天, 526 分, 167 条评论。速度 1500 tokens/秒, 9月 3 号之前是 0。

模型: Qwen 3.8 27B, 27B 参数, dense 多模态, 输入支持图像。上下文 64k 免费, 128k 付费。最大输出 32k 免费, 40k 付费。Reasoning 默认 high, 设 reasoning_effort 为 none 关闭。

价格: 每百万 token, 输入 $0.99, 输出 $1.49。免费用户限速: 5 请求/分钟, 30K 未缓存 token/分钟, 90K 总 token/分钟, 每日 100 万 token, 单请求 2 张图。Developer 用户: 300 请求/分钟, 150K 未缓存, 450K 总, 单请求 10 张图。

端点: Chat Completions (`/v1/chat/completions`), Completions (`/v1/completions`)。

能力: 图像输入, Reasoning, Streaming, Sampling Controls, Structured Outputs, Tool Calling, Parallel Tool Calling, Prompt Caching。

Cerebras 公开端点跑的是原始未剪枝权重, 选择性 weight-only quantization 只在存储时生效, 权重存为 partial 16-bit / 8-bit / 4-bit。质量敏感层存全精度, 动态反量化, 运算在 high precision 下进行。激活、attention、kv cache 保持全精度。

Cerebras 跑 REAP 剪枝研究, 剪枝模型在 Hugging Face 上,不上 API。

Qwen 3.8 系列

8月 2 号, 阿里 Qwen 团队发了 Qwen3.8-Max, 2.4 万亿参数, 95B 激活。Qwen 系列首款开源的 Max 级模型, 权重下周开源。

Qwen3.8-Max 在 `oh-my-cli` 项目上跑了 16 天自主编码, 仓库累积 265 commits, 127 PRs, 151 issues。仓库地址 `qwen-code-dev-bot/oh-my-cli`。视频里: Qwen3.8-Max 把 GitHub Issue 当任务队列, 状态机走 ready → leased → active, 实现完成后触发 E2E 测试和 CI 检查, PR 通过后合并。每次更新触发 Build, Unit Test, E2E, Desktop Lifecycle 校验, 异常状态回到对应 issue/PR 重做。

Qwen3.8-Max 复现论文: 拿 2026 年的 LLM 推理数据选择论文 ( arxiv 2605.22389 ) 当输入, 5 天自主写 7600 行代码, 1100+ 动作, 33 轮 GPU 训练。前 37 小时从零搭管道, 复现六 6 个主要结论, AIME24 上选择方法比随机选 +7.7%。之后在原方法上改进。

跑 1500 tokens/秒意味着什么

Qwen 3.8 27B: 27B 参数 dense, 1500 tokens/秒, $0.99/M input, $1.49/M output。

同规模本地推理: Qwen 3.8 27B 在 Reddit 上跑 ~74 t/s, SSD + 多 token 预测 (MTP)。Cerebras 比本地快 20 倍。

GPT OSS 120B 在 Cerebras 同一端点: ~3000 tokens/秒。Qwen 3.8 27B 速度是它的一半, 参数是它的 22%。

价格比较: GPT-5.6 Sol 在 OpenAI API: $5/M input, $15/M output。Qwen 3.8 27B 在 Cerebras: $0.99/M input, $1.49/M output。输入便宜 80%, 输出便宜 90%。

7 月 7 月 阿里 Qwen 团队发布 Qwen 3.5 多 token 预测研究, 跑 16K 上下文, 推理速度 4 倍。Qwen 3.8 27B 受益。

对开发者

本地 27B 跑 coding agent: Qwen 3.8 27B + SSD + MTP 74 t/s, 适合 1k token 上下文小任务。Cerebras 1500 t/s 适合 32k 上下文 agentic 工作流, 仓库分析, 多文件编辑。

限速: 免费 90K tokens/分钟, 1M/天。开发者 450K tokens/分钟, 每天无限量。

1 跑 16 天自主编码的仓库: Qwen 3.8-Max, 走 QwenCloud API 调用, $X/M, Qwen 团队公告。下周权重开源。

对行业

Cerebras 9月 3 号接入 Qwen 3.8 27B 是 Cerebras 第一次托管中国模型。Cerebras 之前主要跑 Llama 和 OpenAI GPT OSS。Qwen 3.8-Max 走 QwenCloud。

美国 GPU 厂商托管中国开源模型 + 1500 tokens/秒速度: 这条线 Cerebras 接住了。

中国头部开源 (Qwen-Max 系列) 在海外推理基础设施上跑, 价格低于 OpenAI 5x- 6x。

10 天前 (8月 22 号), Cerebras 跑 GPT OSS 120B, 3000 t/s。Qwen 3.8 27B 上线 1 天后, Cerebras 模型目录 2 个, 都在 1500 t/s 以上。

数据点

- Qwen 3.8 27B: 1500 tokens/秒, $0.99/$1.49 per M, 27B 参数 dense

- GPT OSS 120B (Cerebras 同端点): 3000 tokens/秒

- GPT-5.6 Sol (OpenAI): $5/$15 per M

- Qwen3.8-Max: 2.4T 参数 (95B 激活), 16 天自主编码 265 commits

- Cerebras REAP 剪枝研究: Hugging Face 上, 不上 API

- Qwen 3.5 MTP 研究: 16K 上下文, 4x 推理加速

价格 + 速度 + 开源权重: Qwen 3.8 27B 在 Cerebras 上, 适合 编程 agent 长上下文, 9月 3 号起。