ashuai

ashuai

V2EX member #9636, joined on 2011-06-20 15:29:52 +08:00
Today's activity rank 5685
Per ashuai's settings, the topics list is hidden
Deals info, including closed deals, is not hidden
ashuai's recent replies
13h 31m ago
Replied to a topic by baweikami 程序员 deepseek harness 交流
我让 dsh 按他自己的 cordis 模式用 rust 写了个 local harness ,连本地模型走一些轻量任务

https://github.com/ashuai/localai/
好看,追更
15h 54m ago
Replied to a topic by 1258 程序员 qwen3.8 27B 被低估了
同一台 mac sudio 上用 mlx 跑的俩模型,在 mac mini 上用 dsh 评估。35b moe 还是太神了

---

# Qwen3.6-35b vs Qwen3.8-27B-4bit 全方位对比

**测试环境**:本地 oMLX(192.168.0.5:9870),真实 localai 模板(工具提示词/评分准则/审计模板),enable_thinking 关闭,共 **19 个用例 + 3 组补充测试**,两个模型同一 prompt 各跑一遍。

## 一、性能(决定性差异)

| 指标 | 35b | 3.8 | 结论 |
|---|---|---|---|
| 19 用例平均延迟 | **1.35s** | 3.47s | 35b 快 **2.5x** |
| 审计重任务(546 token 输入) | 4.8~5.7s | 10.6~14.1s | 35b 快 **2.5~3x** |
| 全程最慢单次 | 5.96s | 13.23s | 35b 无一次比 3.8 慢 |

prompt 缓存两个模型都没命中(cached_tokens=0),无缓存红利差异——**3.8 的慢是纯生成速度问题**(27B-4bit 在本机 oMLX 上内核效率不如 35b)。

## 二、功能质量

| 维度 | 35b | 3.8 | 胜负 |
|---|---|---|---|
| 中文对话(4 例) | 幽默更出彩("薛定谔的结论") | 比喻更生活化(餐馆点菜) | 平手~35b 微胜 |
| JSON 微调用(4 例) | 全过,字段正确 | 全过,字段正确 | **平手** |
| 评分(2 例) | S 级识别准确 | S 级识别准确 | **平手** |
| 全量审计 | memory 密度高、低价值句丢得干净 | critical 更贴近原文、memory 偏简 | 平手~35b 微胜 |
| 推理/代码(3 例) | 全对(斐波那契+复杂度/数学/找规律) | 全对 | **平手** |
| 指令遵循 | 完美 3 行格式 | 完美 3 行格式 | **平手** |
| 压缩记忆使用(3 例) | 正确取用 critical/memory | 正确取用 | **平手** |

## 三、工具回路(唯一的实质质量差异)

| 用例 | 35b | 3.8 |
|---|---|---|
| 列目录 | `/fs ls .` ✓ | `/fs ls .` ✓ |
| 读文件 | `/fs cat src/main.rs` ✓ | `/fs cat src/main.rs` ✓ |
| 当前目录 | **`/fs pwd` ✗(无效命令,正确是 `/pwd`)** | 直接回答(系统环境里有 cwd,合理) |
| 看插件 | **`/fs ls plugins/ 2>/dev/null \|\| ... \|\| /fs find ...` ✗ 编造不存在的 `/fs find` + shell 语法** | `/fs ls .` ✓ 干净 |

**35b 的 CLI/shell 知识更广,但会"超纲编命令"**;3.8 严格守工具词表。不过 35b 的错误在工具回路里是**可恢复的**(无效命令会返回 usage 文案,模型下一轮会纠正),代价只是多一轮调用(~1-2s)。

## 四、结论:推荐 **35b 继续做 default**

| 决策权重 | 理由 |
|---|---|
| **速度(最关键)** | 本地壳的体验核心就是响应快。2.5~3x 差距是决定性的,且无法靠提示词弥补 |
| 工具纪律(35b 短板) | **可修复**:base prompt 加一句"只能使用系统列出的命令,禁止发明子命令(如 /fs find)"即可;3.8 的优势代价是慢 2.5 倍 |
| 其余维度 | 全部平手,不构成翻盘理由 |

**给 35b 的补丁建议**(如果你采纳,我可以顺手加到 `CHAT_SYSTEM`):
> "工具命令只允许使用系统列出的:fs ls/cat/write/edit/stat/log 、run 、pwd 、mode 。禁止发明不存在的子命令或混入 shell 语法(`2>/dev/null`、`||`、管道等)。"

**备选方案**:如果你想留 3.8 做某些场景(比如它 critical 更贴近原文),可以让 memory 插件的审计/评分用 3.8 、chat 主对话用 35b——但按现在 2.5 倍延迟差距,审计任务用 3.8 会让记忆压缩明显变慢,我不推荐。

---
1 day ago
Replied to a topic by 1258 程序员 qwen3.8 27B 被低估了
35b 怎么还不发
1 day ago
Replied to a topic by justmiho Local LLM local.ai 接力是干嘛呀?
不知道,接了再说 https://local.ai/ashuai/invite
4 days ago
Replied to a topic by Livid Local LLM local.ai
求解锁,谢谢你 https://local.ai/ashuai/invite
Jul 25
Replied to a topic by ipcsh OpenAI 吃瓜 openai gpt 全网 503
为啥我中转站的还能正常使用,等于他是假的 gpt ?
什么时候开始 qoder 是 100%用 qwen 写的,我就信 qwen 站起来了
java 生态一般不搞 all in one 吧,微服务的话,一个个换就行了,其实就是想不想的问题
本地的 qwen 和 gemma 已经可以干活了,工具么,自己写一下
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1009 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 11ms · UTC 19:12 · PVG 03:12 · LAX 12:12 · JFK 15:12
♥ Do have faith in what you're doing.