DeepMind校友创办的Inherent:27B参数小模型在科研复现任务上超越Anthropic和OpenAI
2026年8月22日,由Google DeepMind校友创办的伦敦AI实验室Inherent宣布,其最新发布的AI智能体Faraday在独立复现已发表科学论文结果的任务上,超越了Anthropic和OpenAI等更大、更知名的前沿模型。就在几周前,这家英国初创公司刚刚以5000万美元的种子轮融资走出隐身模式。更值得注意的是,Faraday运行在仅有270亿参数的Qwen 3.6模型之上——相比之下,Anthropic的Claude Opus 4.8和OpenAI的GPT-5.5都是规模大得多的前沿系统。Inherent的联合创始人兼首席科学家Edward Hughes表示,团队不仅追求复现的准确性,还致力于让Faraday展现'研究品味'——一种判断哪些实验值得做、如何设计好实验的直觉。
Faraday所完成的任务听起来简单,实则极具挑战:独立复现已发表科学论文的结果,且不预先被告知答案。对AI系统而言,这意味着智能体需要自行理解论文的实验设计、编写代码、运行分析并得出与原作者一致的结论——这远远超出了传统大模型'背诵'训练数据的能力范围。Inherent的联合创始人、首席科学家Edward Hughes向TechCrunch解释说,论文复现其实是人类科学家的一项标准训练练习,'许多博士生正是从复现开始起步的'。他还强调,击败其他AI系统并不是目的——'我们对此最感兴趣的,不是战胜那些前沿智能体(我们当然喜欢这个结果),而是我们构建它的方式'。
真正让投资者眼前一亮的,是Inherent的技术路线选择。与追求更大模型、更多参数的主流路线不同,Faraday运行在仅有270亿参数的Qwen 3.6之上——参数数量通常被视为模型规模和训练成本的代理指标,而Qwen 3.6的规模比Claude Opus 4.8和GPT-5.5小一个数量级。Inherent设定的成功标准也比单纯准确率更高:除了复现结果,它还希望Faraday展现'研究品味'——一种对哪些实验值得运行、如何设计好实验的直觉。品味是难以言传的,为此Inherent押注于强化学习(reinforcement learning):这种训练方法通过奖励好的结果来引导AI,而不是为它写下明确的规则。与其让智能体主要学习'科学是如何进行的'这类元知识,Inherent更倾向于这种基于奖励的方式,相信它能更好地泛化到长期目标——让智能体能够横跨多个科学领域做出贡献。Hughes说:'我们始终以构建AI科学家智能体、并为其注入品味为北极星。'
这种'科学品味优先'的理念,也塑造了Inherent选择不做什么的决策。例如,团队没有开发自己的编码工具,而是让Faraday使用OpenAI的GPT-5.5 Codex来完成编码任务——这就像人类科学家依赖现成软件而不是凡事自己造轮子。Inherent还刻意避免构建那些只是'说用户想听的话'的智能体。Hughes说,他们的目标是以他最喜欢的那种队友为榜样——那种会跑回来说'我对这个产生了好奇,然后我去做了这些实验,你觉得这些结果怎么样?'的人。这种协作本能也延伸到了Inherent的运营方式:团队目前只有约12名员工,全部在伦敦King's Cross的一间办公室线下办公——这个曾经破败的伦敦街区,因Google DeepMind的入驻而成为全球顶级AI人才聚集地之一。'我们相信伦敦就是该待的地方,'Hughes说。
围绕这次发布,还有几个值得关注的产业信号。其一,Hughes对伦敦的AI人才密度非常乐观,但他也公开呼吁英国终结'花园假期'(garden leave)制度——这是英国常见的做法,禁止离职员工在辞职后数月内加入或创办竞争对手公司,而美国研究人员通常不受此限制,这让美国初创公司在争夺离职人才时占得先机。Hughes本人就曾被这一限制影响,他最终绕过约束,与另外两位DeepMind校友及第四位联合创始人共同创办了Inherent。其二,Inherent并没有放慢脚步:公司计划在年底前将团队扩充到'约20至25人'。考虑到公司在世界模型方面的雄心,以及Demis Hassabis的新角色让部分DeepMind员工感到不安,Inherent的招聘扩张很可能使其成为DeepMind员工考虑跳槽时颇具吸引力的去处。从更宏观的视角看,Faraday的成功也验证了一条与'越大越好'不同的路线:精心设计的强化学习、明确的目标函数和克制的工程选择,可以让小模型在特定任务上击败参数规模大得多的对手——这或许预示着AI竞争正在从'军备竞赛'转向'巧思取胜'。
🤔 常见问题解答
Q1: Inherent是一家什么样的公司?
Inherent是一家由Google DeepMind校友创办的伦敦AI实验室,近期以5000万美元种子轮融资走出隐身模式。公司的长期目标是构建能够发现新科学知识(而不只是验证旧结果)的AI科学家智能体。团队目前约12名员工,全部在伦敦King's Cross的办公室线下办公。
Q2: Faraday是如何在任务上超越Anthropic和OpenAI的?
Faraday运行在仅有270亿参数的Qwen 3.6模型上,通过强化学习训练——用奖励好结果而非预设规则的方式来引导AI。团队还刻意让Faraday使用OpenAI的GPT-5.5 Codex完成编码任务,而不是自建编码工具。Inherent认为,精心设计的训练目标和克制的工程选择,比单纯堆参数更有效。
Q3: 什么是'研究品味'(research taste)?
'研究品味'是Inherent希望Faraday展现的一种能力:判断哪些实验值得运行、如何设计好实验的直觉。Hughes形容理想中的队友是那种会说'我对这个产生了好奇,然后去做了这些实验,你觉得结果怎么样?'的人。这种难以言传的能力通过强化学习来培养。
Q4: '花园假期'(garden leave)制度是什么?
'花园假期'是英国常见的制度,禁止离职员工在辞职后数月内加入或创办竞争对手公司。Hughes本人曾被此限制影响,并公开呼吁终结这一制度,认为它让美国初创公司在争夺离职AI人才时占得先机。Inherent计划年底前将团队扩充到约20至25人。
🛠️ 推荐工具
- 百分比计算器 - 计算27B参数与前沿模型参数规模的百分比差距,直观理解小模型'以小博大'的震撼
- JSON转CSV工具 - 将科研复现实验的JSON结果数据转换为CSV,便于对比不同模型的性能差异
- 字数统计工具 - 统计科学论文摘要与实验报告字数,辅助智能体写作与论文产出管理
总结
Inherent用一场出人意料的'以小博大',为AI科研智能体赛道带来了新的叙事。Faraday以270亿参数的小模型,在论文复现任务上击败了Anthropic和OpenAI的前沿大模型——不是因为更大的规模,而是因为更聪明的训练目标:用强化学习培养'研究品味',用克制的工程选择聚焦核心能力。对DeepMind来说,这家由自家校友创办的伦敦实验室正在成为人才争夺中不可忽视的力量;对AI行业而言,Faraday的成功提醒我们,当'越大越好'的军备竞赛遭遇瓶颈,'巧思取胜'或许才是下一个阶段的主题。