MaskerPRC
V2EX  ›  Claude

fable 5.1 用了一天,顺手整理下这次发布的关键信息

  •  
  •   MaskerPRC · 4 days ago · 1192 views

    昨天 Anthropic 发了 fable 5.1 ,没怎么铺垫就直接上了 API 。我手头有些日常脚本跑在 API 上,就顺手试了一天,把官方信息和我自己的感受整理一下,给还在观望的朋友省点翻文档的时间。

    先说官方数据(省得大家去翻 changelog ):

    • Terminal-Bench-Science 52.6%,上一代是 24.7%,接近翻倍。这提升幅度说实话有点夸张,我自己还没在专业场景里复现到这个程度
    • 缓存读取价格降了 75%。对我们这种跑长对话、反复带大上下文的用法,这个比模型本身的提升更实惠
    • 官方说 Agent 类任务的总成本最高能省 45%,来源就是缓存降价加上减少无效轮次
    • API id 是 claude-fable-5-1 ,价格表上没动标准定价

    我实际用下来的几点观察:

    1. 最明显的感受是废话少了,让它改代码它就改代码,输出里那些"好的,我来帮你……"之类的客套明显少了,token 消耗肉眼可见地降
    2. 长上下文下找东西比上代准。我扔了一个几千行的旧项目让它定位配置项,一次性命中,上代要来回确认两三次
    3. 缓存这个事情要自己会用,prompt 结构乱的话省钱效果会打折

    另外这次还同步发了个叫 Mythos 5.1 的,和 fable 5.1 同权重,但只开放给审核/评测机构做对齐研究,普通用户拿不到,大家看到的 benchmark 数字里有一部分就是它跑的。

    总结:如果你已经在用 API 跑 agent 类任务,值得切过去试试,成本大概率是降的;纯聊天用途提升感知不大。有别的使用场景的欢迎交流,我这边也就跑了一天,样本量有限,拍砖随意。

    2 replies    2026-09-04 13:31:19 +08:00
    VeryZero
        1
    VeryZero  
       3 days ago
    几千行的项目定位一个配置还不能一次命中,这是认真的吗?
    MaskerPRC
        2
    MaskerPRC  
    OP
       3 days ago
    这里是我表述不严谨,抱歉。实际情况是那个项目我自己写过一部分,对结构有先验,知道配置大概在哪一层,模型实际是返了一次确认路径才命中的,不是纯靠模型一次到位。拿这个当「长上下文能力提升」的证据确实夸大了,样本就一天,大家参考时打个折扣看。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   918 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 26ms · UTC 20:22 · PVG 04:22 · LAX 13:22 · JFK 16:22
    ♥ Do have faith in what you're doing.