罗福莉:龙虾成本黑洞显现,要更高token效率的Agent框架
小米吧
全部回复
仅看楼主
吧务
level 16
♤Aki♤ 楼主
两天前,Anthropic 停止允许第三方工具层(harnesses)使用 Claude 订阅服务——这并不令人意外。三天前,MiMo 推出了其“代币计划”(Token Plan)——这是一项我投入了大量精力去打磨的设计,也是我认为在计算资源分配与智能体工具层开发方面,一次旨在做到“正本清源”的严肃尝试。将这两件事结合起来看,我有以下几点思考:
1. Claude Code 的订阅服务是一套设计精妙的系统,旨在实现计算资源的均衡分配。我推测——这套系统目前并不盈利,甚至可能处于亏损状态;除非其 API 服务的利润率高达 10 到 20 倍(对此我深表怀疑)。虽然我无法精确计算因第三方工具层接入而造成的具体亏损额,但我曾近距离审视过 OpenClaw 的上下文管理机制——其表现可谓糟糕透顶。在处理单次用户查询时,它会触发一连串低价值的工具调用,且每一次调用都作为独立的 API 请求发出,并携带极长的上下文窗口(通常超过 10 万个代币/tokens);这种做法即便在命中缓存的情况下依然造成巨大浪费,而在极端情况下,甚至会推高其他用户查询的缓存未命中率。最终,单次用户查询所实际产生的 API 请求数量,往往是 Claude Code 官方框架下的数倍之多。若按 API 计费标准折算,其真实成本恐怕已高达订阅费用的数十倍。这已不仅仅是“差距”,简直就是一个深不见底的“鸿沟”。
2. 像 OpenClaw 或 OpenCode 这类第三方工具层,依然可以通过 API 接口调用 Claude 服务——只不过它们无法再继续“搭便车”,免费享用订阅服务的资源了。短期来看,这些智能体用户将不得不承受阵痛,因为其使用成本极易飙升数十倍。然而,正是这种成本压力,将倒逼这些工具层去优化其上下文管理机制,最大化提示词缓存(Prompt Cache)的命中率以实现已处理上下文的复用,从而杜绝代币资源的无谓消耗。这种“阵痛”最终将转化为工程实践中的严谨与规范。
3. 我在此呼吁各大大型语言模型(LLM)厂商:在尚未摸索出一套既能提供编程辅助服务、又能避免巨额亏损的定价模式之前,切勿盲目地陷入“价格战”的恶性竞争。以极低廉的价格出售代币,同时又对第三方工具层大开方便之门——这种做法表面上看似能取悦用户,实则是一个巨大的陷阱——而这正是 Anthropic 刚刚才从中抽身而出的那个陷阱。更深层次的问题在于:如果用户将宝贵的精力虚耗在低劣的智能体工具层、极不稳定且响应迟缓的推理服务,以及为了削减成本而被降质的模型之上,最终却发现自己依然无法高效地完成任何工作——那么,无论对于用户体验的提升,还是对于用户留存率的维系而言,这都绝非一个良性的发展循环。 4. 关于 MiMo Token 方案——该方案支持第三方代理框架(Agent Harness),并按 Token 配额进行计费;其逻辑与 Claude 最新推出的“额外用量套餐”如出一辙。因为我们追求的是长期、稳定地交付高质量的模型与服务,而非诱导用户一时冲动付费,随后便弃之不顾。
从宏观视角来看:全球的算力供给已无法跟上各类代理应用所产生的 Token 需求。真正的出路并非单纯地降低 Token 单价,而是实现“协同演进”——即通过“更具 Token 效率的代理框架”与“更强大、更高效的模型”相结合来实现。Anthropic 的这一举措——无论其初衷如何——正推动着整个生态系统(无论是开源还是闭源)朝着这一方向迈进。这或许是一件好事。毕竟,Agent 时代并不属于那些一味“烧算力”的玩家,而是属于那些懂得“智慧用算力”的玩家。
2026年04月06日 07点04分 1
吧务
level 14
Udd
[太开心][太开心][太开心][太开心]
2026年04月06日 11点04分 2
1