模型融合与进化计算:Sakana AI如何用低成本构建智能协作新范式
上周在测试几个新开源模型时,偶然发现一个叫 Fugu 的模型,背后是一家名为 Sakana AI 的公司。这个名字听起来有点陌生,但一查背景,创始人 David Ha 和 Llion Jones 来头不小,一位是前 Google Brain 研究员,另一位是 Transformer 架构的联合发明人。这让我立刻来了兴趣——由 Transformer 的“祖师爷”之一参与创立的新公司,他们做的大模型,思路会和现在的主流玩法有什么不同?带着这个疑问,我花了两天时间,从模型下载、环境部署到功能实测,完整地跑了一遍。整个过程下来,我的感受是:Fugu 模型本身可能不是最惊艳的,但 Sakana AI 背后透露出的“模型融合”与“进化计算”思路,却像是一股清流,指向了当前大模型军备竞赛中一个被忽视的角落。它没有执着于把单一模型的参数堆到万亿级别,而是尝试用更“聪明”的方式,让一群小模型协作,去解决复杂问题。这听起来很理想化,但实测下来,你会发现这种思路在特定场景下,可能比一个庞然大物更灵活、更经济。如果你也厌倦了“更大、更强、更贵”的单一模型叙事,想看看大模型发展的另一种可能性,那么 Sakana AI 和 Fugu 模型,或许能给你带来一些不一样的启发。1. 先别急着看模型能力,Sakana的思路才是关键在深入实测 Fugu 模型之前,我们必须先理解 Sakana AI 这家公司到底想做什么。如果只是把它当作又一个发布基础模型的开源玩家,那就完全错过了重点。当前大模型领域的主流叙事是什么?是“Scaling Law”(规模定律)。大家普遍相信,只要数据够多、算力够强、模型参数够大,模型的智能就会持续涌现。于是我们看到,从百亿到千亿,再到万亿参数的模型不断被推出,训练成本也水涨船高,逐渐成为只有少数巨头才能参与的“富人游戏”。Sakana AI 的两位创始人,恰恰是从这个游戏的核心圈子里走出来的。他们比任何人都清楚这条路的终点和代价。因此,他们提出的核心思路是“模型融合”(Model Merging)和“进化计算”(Evolutionary Computation)。这听起来有点抽象,我们可以用一个简单的类比来理解:传统的大模型思路,是培养一个“全能冠军”,要求它在所有项目上都拿到高分。而 Sakana 的思路,更像是组建一支“特种部队”。这支队伍里,有人擅长推理,有人精通代码,有人对语言风格敏感。当遇到一个复杂任务时,不是让“全能冠军”一个人硬扛,而是让这支“特种部队”协同作战,各展所长。Fugu 模型,就是这支“特种部队”中的一员,或者说,是 Sakana 用其方法论“进化”出来的一个阶段性成果。它的全称是 “Fugu-RP”,这里的 “RP” 很可能指代 “Recipe”(配方)或某个特定版本。根据公开信息,Fugu 是一个基于 Llama 架构、拥有 70 亿参数的开源模型。它本身并不是一个从零训练的全新巨兽,而是通过 Sakana 的融合与进化技术,将多个现有优秀模型(如数学、代码、对话能力强的模型)的“基因”进行组合与优化后产生的。所以,实测 Fugu,我们不仅要看它作为一个独立模型的“单兵作战能力”,更要透过它,去理解 Sakana 这套“组建特种部队”的方法论是否可行,以及对我们普通开发者意味着什么。2. 环境部署与初体验:轻量、易上手,但别有太高期待理解了背景,我们进入实操环节。对于大多数想尝鲜的开发者来说,第一步永远是:这东西怎么跑起来?2.1 部署方式选择Fugu 模型在 Hugging Face 上提供了模型权重。部署一个 7B 参数级别的模型,在今天已经不是什么难事。主流的方式有以下几种,你可以根据自己的硬件和环境选择:部署方式优点缺点适合场景Ollama