算力账单开始反向决定产品路线
当推理成本进入季度财报,产品路线就不再只由能力决定。
本页目录
几家公司的季度电话会里,「推理成本」第一次被单独拿出来讲。这件事的意义不在于数字,而在于它进了被公开追问的清单。
一旦某项成本需要向投资人解释,它就会开始反向塑造产品:哪些功能默认开启、哪些留给付费档、哪些干脆砍掉。
三个可观察的信号
- 免费档的功能开始「静默降级」——不是砍掉,而是把默认模型换小;
- 「思考时间」被做成了可控参数,因为它直接对应账单;
- 一些演示效果很好但调用链很长的功能,悄悄下线了。
真正的分水岭不是谁更便宜,而是谁能把成本结构讲清楚。讲不清楚的那个,路线会被账单牵着走。
把上下文窗口写进价目表
一家厂商这周把定价页改了:不再按「输入 / 输出」两栏,而是按上下文长度分档,短上下文的单价明显更低。
表面上是涨价,实际是在告诉用户别把所有东西都塞进去。
长上下文的成本结构和短上下文不同,之前统一计价等于让短任务补贴长任务。分档之后,选择「只放进相关的部分」第一次有了明确的经济动机。
值得留意的是这对产品设计的影响:RAG、摘要、检索这些「少放一点」的技术,重新变得划算。过去一两年大家把它们当成效果妥协,现在它们同时是成本优化。
新模型不再比参数,开始比「什么时候不说话」
这一周有三家发布了新模型,发布会上的关键词却出奇一致:不是更聪明,而是更少的干预。参数规模、跑分榜单都退到了第二屏,第一屏讲的是「它什么时候不说话」。
从能力上限到行为下限
过去两年的发布逻辑是加能力:更长的上下文、更多的模态、更高的榜单分数。这套逻辑的问题是,用户很快会发现能力上限不决定体验,行为下限才决定体验——模型在不确定的时候会不会硬答,在无关的时候会不会插话。
这周的三个发布都在这条线上做文章:
- 一家把「主动澄清」变成了默认行为:信息不足时先问一句,而不是先猜一个答案;
- 一家把工具调用的门槛提高,宁可少调一次,也不要调错一次;
- 一家干脆在评测集里加了「不该回答的问题」,把沉默当作可量化的能力。
把「不做什么」写进评测集,意味着它变成了可比较的指标。
—— 本期的观察
这对使用者意味着什么
直观的变化是交互变慢了:会多一次确认、多一句追问。对习惯了一步到位的人来说,这是退步。
但对真正在做事的人来说,返工的成本远高于确认的成本。一个会问清楚的模型,可以放心交给它更长的任务链。
// 能力上限与行为下限是两条不同的曲线
type Release = { capability: number; restraint: number };
// 榜单只反映前一条,体验由后一条决定
const usable = (r: Release) => r.capability > 7 && r.restraint > 6;
接下来盯什么
「会问问题」很容易被做成新的表演:每件事都追问一遍,用户会立刻厌烦。真正的分水岭是澄清的准确率——它能不能只在真正需要的时候问。
下一期我们会盯一下这些模型的澄清率数据,看它是被调优出来的,还是被规则硬编码的。
评论
由 GitHub Discussions 驱动
正在载入评论…