递归自我改进
随着大模型参数量越来越大,scaling law 逐渐失效。如果第一曲线是训练数据,那么第二曲线就是使用数据 —— 每一次 agent 的调用,都会抬高它们自己的能力。
斜率而非起点
绝大多数 AI 产品的改进发生在版本之间:攒数据、重训、发版。在这条链路里,用户只是被改进的对象。我们把它搬进了产品内部,让改进发生在使用之中,闭环在用户手里合上。我们相信,起点不重要,斜率最重要。
两条曲线
版本式改进台阶
攒数据 → 重训 → 发版。台阶状上升,斜率由团队产能决定。用户越多,标注与推理越贵,改进反而更慢。
递归式改进复利
使用即改进。连续上升,斜率由使用量决定。用户越多,校正信号越密,曲线越陡。成本方向和改进方向第一次一致。
六器成环
依职能列位,按序流转;末而复始,终则有始,环环相扣,生生不息。
感知
把现实变成信号。会议、阅读、课堂、对话四类场景共用一个入口,转写、说话人分离、声纹识别在同一层完成。场景不同,进入系统的形式相同。
- 01
感知
把现实变成信号。会议、阅读、课堂、对话四类场景共用一个入口,转写、说话人分离、声纹识别在同一层完成。场景不同,进入系统的形式相同。
- 02
记忆
让信号跨越时间。所有来源写进同一套记忆,重复的不会堆积,删掉的会真正消失。
- 03
推断
从记忆里长出关于一个人的判断:关心什么、擅长什么、正在往哪走。判断与记忆分离存放,所以记忆一变,判断可以整体重算。
- 04
校正
让判断可以被推翻。确认、纠正、忽略、主动新增,四种动作直接改写下一次推断。这是环能闭合的地方,也是最容易被省略的地方。
- 05
迁移
让一处的改进在别处生效。理解引擎与画像网络被多条产品线共用,一个场景里学到的东西不会锁死在那个场景里。没有这一层,就只有四条互不相干的浅曲线。
- 06
契约
让新场景接入的成本趋近于零。一次定义,多端自动生成。我们的工业化管线是可复用的,新的产品就是架构上的分支。
闭环成立的三个必要条件
HOVER 任一条,看环还闭不闭得上
- 01
可观测:有迹可循
每一条判断都必须能指回产生它的原始记录,包括具体会议、文章、音频、视频等。可以查到来源,就可以更好地进化与纠偏。
- 02
可干预:亡羊补牢
现在大多数 AI 画像都是「只读」的,能不能让用户改,这是天壤之别。用户每纠偏一次,就是免费标了一条高质量数据。Agent 在人环中的自进化是其最好的学习方式。
- 03
可复用:一花独放不是春
AI 时代我们不做单产品的公司。如果技术改进只能原地踏步,那四条产品线就是各玩各的。大家共用同一套底层理解,一个场景里修好的 bug、积累的经验,是可以触类旁通的。维度之门真正的复利来自这里。
三条同时成立,环才闭得上。缺任何一条,「自进化」就只是一个形容词。
RSI 阶梯
我们认为 L3 是故事的技术分水岭,一年之内,人会从维度之门的回路中 90% 的 Agent 学习场景退出。
- L0已跑通
留痕
系统留下你的痕迹,且痕迹可检索、可引用、可删除。
- L1已跑通
校正
你能推翻系统的判断,推翻会立即生效并且持久。
- L2已跑通
迁移
一个场景里的改进,自动成为另一个场景的起点。
- L3在建
自举
系统从使用信号里自己提炼改进策略,不再依赖人工重训与发版。
- L4蓝图
自主
系统自己决定下一步该学什么、该问你什么,开始为自己的成长设定目标。
蓝图站在能交付的工程上
压测实录
智谱 GLM 前 Infra 实际业务负责人之一领衔工程建构,上亿并发、万卡集群的真实工程能力上限
- 289
- 个业务规则单测
- 56
- 条断言的端到端闭环测试
- 2000+
- req/s 常规接口吞吐
- 2.28s
- 追播延迟 p95
- 0%
- 压测错误率
并发能力买不来
从接入层、流媒体分发到推理调度,全栈集群自建,零依赖公有云 PaaS。接入层无状态,容量随节点线性扩展,扩容即加机器,无需改架构,更无需等待云厂商配额审批。
曲线的成本方向是向下的
两个方向同时压成本:底座复用让新增场景的边际研发成本递减;整套基础设施自建、不依赖公有云 PaaS,让推理与带宽的边际成本可控。
我们总会选择长期主义的道路:我们的成本曲线只会逐渐下降