AI领域悬而未决的拷问:自动化到底去哪了?

自动化的全新时代已经到来。你感受到了吗?头部 AI 企业显然对此深信不疑,但普通人或许毫无体会。
难得新闻平淡的一天,让我们有时间仔细琢磨 OpenAI 周二晚间重磅公告的意义:其尚未发布的新模型,在数百道数学与计算机科学重大难题上取得突破,甚至直接解出部分难题。对于我们这些日常不用钻研代数的普通人而言,这到底意味着什么?
我们很难把这些重大技术成果,和那些只为维持 AI 融资热度的商业宣传区分开来。我注意到,尽管周二这则消息堪称里程碑,但与此同时有报道称 OpenAI 正在洽谈融资、筹备 300 亿美元 IPO;而一周前,它那场万众瞩目的开发者日,外界评价更像是追赶对手。与此同时,最新的 AI 热点 —— 面向普通用户的 AI 智能体,开始遭遇阻碍:大量网站打算封禁 AI 爬虫。而且宏观统计数据上,暂时看不出 AI 提升全社会生产力的迹象。
这一轮 AI 淘金热,萦绕着一个核心问题:企业该如何把模型惊人的原始智能,转化成实实在在、可验证的业务价值?
前不久,我在旧金山滨水区一座幽暗的礼堂 Midway 见证了这场辩论,这里常举办电子音乐节与艺术展。上周,近 800 名软件开发者齐聚于此,参加 Modal 主办的大会。Modal 不是电子音乐 DJ,而是一家估值很高、面向开发者提供算力基础设施与软件工具的公司。
Modal 把大会主旨演讲交给了斯科特・吴(Scott Wu)。他早年因在数学竞赛中大放异彩为人熟知;而他创办的代码智能体初创公司 Cognition,上个月估值飙升至 480 亿美元。
他站在台上,身后幻灯片写着:“是时候怀抱远大野心。”他描绘不远的未来:企业内部遍布 “虚拟员工”,它们以结果为目标,而非单纯完成一项项任务。他说,只要拥有足够的数据中心、内存与沙箱环境,行业终将实现这个愿景。“智能体的能力会持续变强,这就是大趋势。”
支撑他这番号召的底气,来自数学领域的突破。“对我而言,转折点就是 AIME 那一幕。” 他说。AIME 指的是去年,高级 AI 模型的推理能力强大到,在他曾经参赛的高阶数学竞赛中,成绩超越人类选手。“那一刻我就知道,大势已定”—— 意思是人类不再独占智能。
当天下午的同一场会议,我听到了截然不同的声音。迪奥戈・阿尔梅达(Diogo Almeida),前 OpenAI 研究员,自称是 “OpenAI 多款爆款模型的共同作者”。他身着粉色皮草外套,面带微笑上台,语气带着一种内部知情者的热忱,仿佛从一个问题重重的国度或信仰体系出走,如今可以向众人道出真相。他现在执掌 TypeSafe AI,近期推出了一款广受关注的大模型替代品,名为 Jev。
他向台下听众发问:“自动化到底去哪了?”紧接着抛出一连串圈内熟知的缩写术语。“我对当前 AI 现状的一句话总结:如今所有大语言模型,都是基于人类反馈强化学习(RLHF)优化的辅助工具。”(不熟悉的读者:RLHF 即人类反馈强化学习)换句话说,大模型训练目标是取悦参与其中的人类。它们擅长辅助人,但无法在无人值守的场景下完成自动化工作。
在同一场大会上,多位 AI 行业领军人物都在推动软件工程领域的自动化,同时也承认这场变革阻力重重。他们听起来,也没有准备好全盘交给机器接管。
Anthropic 的 Claude Code 产品负责人卡特・吴(Cat Wu)表示:“我们重点推进的一个方向是,思考:哪些任务是我一直在重复做的?为什么我还困在这个循环里?”Anthropic 大概是全球最信奉 AI 潜力的公司。“很多自动化卡在半自动化阶段:Claude 完成 80% 的工作,剩下 20% 依然要人来做,而你要一遍遍重复这些任务。”
还有一些软件工程负责人觉得,比起驯服 AI 智能体,管好人类工程师才是更头疼的难题。知名开源项目 OpenCode 的开发者达克斯・拉德(Dax Raad)说,他们团队当下最大的麻烦,是人类工程师没有认真审阅 AI 写出的代码。“我现在想解决的问题是,怎么让团队提出正确的问题;一旦有未经仔细核查的代码上线,他们能心怀愧疚。” 拉德说道,“这是一个由来已久的难题:如何让人真正上心?”