wdhwg001

wdhwg001

V2EX member #66832, joined on 2014-07-02 20:47:58 +08:00
Today's activity rank 2403
Per wdhwg001's settings, the topics list is hidden
Deals info, including closed deals, is not hidden
wdhwg001's recent replies
@sampeng 不是特化训练,是泛化不够。它的训练语料大量来自于 Claude Code ,以至于你让它背诵一些已经不存在的 Schema ,它如数家珍。很可能是 RLHF 在 Claude Code 里训练任务完成所需的 Token 总数,然后训成了特化,因为 Claude Code 会还原 cwd 。

任何第三方 Harness 都要尽可能地去还原原生行为,包括名字、schema 、各种提醒,否则数不尽的坑在面前。
难道要趁此机会欣赏自己的鸡巴吗?
@BestEicky 这是原本的内置功能被全局禁用,灰度恢复。
@KJH subagents 可以锁到 Opus 的
@guin Opus 3 时代老号就算 IP 全球来回跳,时区在中国,聊天用中文,都没问题。
@BestEicky

8 tasks (3 done, 1 in progress, 4 open)
◼ 当前任务 1
◻ 后续任务 2
◻ 后续任务 3
◻ 后续任务 4
◻ 后续任务 5
… +3 completed

这个东西。
@windliang 其实当时明眼人都知道偷了 Cursor Rules 里的可选规则,但是 Cursor 没想着拿它造生态。
5 days ago
Replied to a topic by bxxwcl 程序员 我是不是太学生思维了
@chenyongchanggg 板着脸认真说事情的时候可能会有点过拟合吧…就隐约带一点 AI 味道,但是是真人没毛病嗯
Aug 31
Replied to a topic by bxxwcl 程序员 我是不是太学生思维了
@Jinmu24 没啥求教的,我觉得也不需要上一个 ADR ,在该 Reflection 的点提醒,然后 Reflection 结果持久化,去调优 Reflection 就行了,没啥必要去翻倍 usage 审查,事实上 LLM 对于自己犯的错误非常敏感,这是 RLHF 的核心部分。

狠狠摔一跤就是指,你要让它去犯错和挣扎,而不是要让它去预先怀疑。因为怀疑是普适性的,它会怀疑每一件事,导致任务完成时间拉长,而如果让它对着怀疑去 reflection ,它不会有把 finding 记录下来的东西,你给它套上一个 sidecar LLM 也没用,如果不踩坑,两者大概率都不响,因为 base model bias 摆在那里,两个模型之间会倾向于认同彼此,你要让它响才行。

提高怀疑本身也是很难建立平衡和 metrics 的,而 Reflection 思路则容易很多,很多时候开发任务是需要人来做这个 reasoning 的,任务完成时间是刚需,而提高怀疑的代价清晰,收益不确切,预测收益困难,策略只能是全用上,就像越来越依赖 xhigh 一样。
Aug 30
Replied to a topic by bxxwcl 程序员 我是不是太学生思维了
@Jinmu24 我的评价:

它的驱动力不成立,或者说我的看法相反:我觉得 LLM 应该狠狠摔一跤或者在 HITL 里站直了挨骂,然后它学会的东西会被积累以降低后续的任务完成时间。你的驱动力是抬高怀疑,这增加的额外消耗是普遍的,而错误本身不是。
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2835 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 11ms · UTC 06:32 · PVG 14:32 · LAX 23:32 · JFK 02:32
♥ Do have faith in what you're doing.