
这项由Corbenic AI独立开发的产业经验报告由研究员Sietse Schelpe撰写以行业经验报告形式发布论文编号为arXiv:2607.14431属于2026年发布的系列研究成果之一感兴趣的读者可通过该编号查阅完整文献及相关附录资料。当所有人都在谈论更大的模型、更多的参数、更强的算力时有一个团队却在悄悄做一件看起来有些反直觉的事——他们把模型彻底冻住不再训练它而是在旁边建了一个知识金库。一旦某道题被解开并通过严格的独立验证所有后续的相同类型问题就永远不需要再重新推理了直接从金库里取答案零消耗毫秒返回每次输出一模一样的字节。这个系统叫做Galahad其底层存储引擎叫做Merlin。这听起来像作弊但仔细想想它其实是在挑战AI领域一个被默默接受的浪费每次用户问一道已经被无数次解答过的数学题、运算题或逻辑推理题顶级AI服务都要重新从头推导一遍消耗大量算力花费真实的金钱而且每次给出的答案还可能略有不同。Corbenic AI的这项研究要测量的就是如果把推导和执行彻底分开会发生什么一、让一个冻住的小模型开挂零推理代币、百分之百准确理解这项研究的核心需要先弄清楚一个关键区别现在大多数AI每次回答问题都要完整地重新思考一遍就像一个学生每次被问到22等于几都要重新在脑子里算一算而不是从记忆里直接取出答案。这个重新思考的过程会消耗资源叫做生成代币generation tokens可以粗略理解成AI思考的步骤数每一步都要花钱、花时间、花电。Galahad系统做的事情完全不同。它维护着一个经过验证的解法库每当一类问题被解决并通过严格的独立审核这个解法就被存进去。下次碰到同类问题系统不让模型重新推理而是直接从库里调出那个已经验证过的解法用模型去执行它、算出新参数下的答案然后返回结果。模型本身没有产生任何新的推理步骤。研究团队在一个12亿参数的开源模型Gemma-4-12B上做了测试让它面对九类数学和算法问题的180道全新题目。所谓全新是指用从未见过的具体数字参数。结果是180道全部答对答对率100%而且每道题产生的生成代币数量是0。这里特别值得说明的是这不是简单的背答案——系统存的是解法方法而不是特定数字的答案。比如某一类问题的三道测试题输入的数字分别是3105、390和15150这三个数字从未出现在记忆库里但系统用存好的解法方法把这三个新数字各自正确算出来了。与此同时研究团队还对比了四款来自不同厂商、不同架构的模型——包括稠密架构的Gemma-4-12B、Qwen3-14B、Phi-4以及混合专家架构的DeepSeek-Coder-V2-Lite——四款模型在同一套记忆库下全部得到了180/180的满分生成代币全为零。这说明这套机制和具体的模型选择无关换个模型结果完全一样。二、验证不看答案卷这个守门员是如何工作的你可能会问怎么知道存进去的解法是对的这正是这套系统最关键也最花心思的地方。Corbenic AI对验证的定义非常严格验证过程绝对不能看答案卷benchmark answer key。这就像监考老师判卷不是拿学生的答案和标准答案对比而是通过完全独立的推理过程来确认答案的正确性。这样做的目的是防止系统作弊——如果验证时偷看了答案那所谓的验证就没有意义。具体来说系统针对不同类型的知识采用了三种独立的验证方式。对于数学证明类的问题使用的是机器可检验的形式化证明——就像数学家提交一篇证明由独立的自动化验证工具逐步检验每一步逻辑是否成立而不是由另一个AI模型给个评分。测试中模型写出了一个正式数学证明独立的证明检验器第一次提交就通过了同时一个故意写错的命题225被同一个检验器拒绝证明这个门确实在认真把关。对于开放性推理类的问题系统采用一致性检验机制——模型以机器可解析的格式输出推理过程自动化程序检查推理内部是否自相矛盾。如果推理的前提和结论打架就会被拒之门外。四款模型各自接受了超过二十个推理框架的测试88个提交全部通过并被正确复用。另外还测试了推理方法的跨域迁移——把一种在某领域验证过的推理方法移植到完全不同的领域医疗分诊四款模型总计80次迁移尝试77次成功通过了一致性门控。更关键的是团队还专门测试了欺骗这个门是否可能——一个表面看起来正确但实际上有细微错误的候选解法被这套分层验证机制识别并拒绝具体的反例也被记录了下来。每个候选解法在被接受之前都要经过150个边界条件的测试。所有测试输入上验证门控一个都没有放错误答案进去。三、这不是缓存也不是普通的知识检索——一个被频繁误解的设计不少人听到存解法、取解法会把它和已有的技术混淆。研究团队在报告中专门列出了这套系统与相邻技术的区别因为这些区别恰恰是整套保证成立的关键。语义缓存semantic cache和向量检索系统RAG——也就是目前AI行业里最流行的知识库方案——是通过模糊的语义相似度来找答案的就像在图书馆里用关键词找大概相关的书。这种方式的根本问题是找到的东西可能不是你真正需要的那本。研究团队做了一个专门的测试在一个4500条目的验证知识库上让精确地址寻址和近似相似度匹配各自工作结果是精确寻址零错误而近似匹配取错的比例高达94.3%。换句话说用当前主流的向量检索方式每一百次查询里有94次会拿回错误的答案——而且是拿到一个看起来很正确的错误答案没有任何报错这才是真正的危险所在。前缀缓存prefix/KV caching——这是vLLM、SGLang等推理引擎里常见的加速手段——确实可以复用一部分计算但它的本质是跳过了相同输入前缀的重复计算模型依然要为每道题生成新的输出代币而且没有任何验证机制确保答案正确。还有一类智能体技能库agent skill libraries比如Voyager、TroVE等系统思路上已经接近Galahad会积累可复用的工具。但它们的验收标准通常是另一个模型的判断或者针对特定任务的神谕oracle而不是独立的、不依赖答案卷的验证门控。一旦负责判断的模型出错错误的解法就进了库。Galahad把精确选中正确条目、按位精确复现答案、存入前通过独立验证三件事同时做到而研究团队对市面上主要类别的六类已发布系统做了系统性审查没有发现任何一个同时具备这三个属性。四、一次性成本有多少回本要多久这套机制的经济账是这样算的解决并验证九类问题总共花了16579个生成代币。这是一次性的总成本覆盖了所有求解和验证活动。之后每次复用的边际成本是零个代币。如果同样的问题由一个顶级AI服务来回答每次都要走完整的生成流程通常一道经过完整推理的答案需要500到1000个生成代币。按这个数字倒推16579除以500得到的是3316579除以1000得到的是17。也就是说一个问题家族只要被问上17到34次前期的一次性验证成本就全部回收了。从第35次开始每一次都是纯粹的节省。这个比例会随着使用量的增加无限扩大。从能耗角度看180道题的完整复用测试每款模型消耗了约6.3到6.5瓦时的电平均每道验证答案约36毫瓦时——大约相当于一只LED灯泡燃烧13秒的用电量。而那次一次性的九类问题求解验证活动总共消耗了81.1瓦时大约是复用成本的2000多倍但这2000多倍只付一次此后永远免费。五、知识可以合并而且能跨域搭积木Galahad的能力不只是一对一地取出存好的答案存进去的知识可以被组合起来回答从未存过的新问题。研究团队测试了一道需要同时调用三个不同存储解法的复合问题——每一个单独的解法都不包含这道题的答案但把三个解法拼在一起系统答对了5道中的5道生成代币仍然是零。当把其中一个必要的解法从库里拿掉结果立刻变成0/5。这证明系统在用知识做真正的计算组合而不是碰巧在某个地方存了这个问题的答案。知识合并还可以在更大的尺度上进行。团队把来自单一专业领域的六个独立验证知识条目合并成一个14134个代币长的工作上下文模型从这个合并上下文中生成了一个综合性的分阶段答案每个元素都能追溯到它来自哪个源条目没有任何跨源的张冠李戴。更有意思的是跨域计算给模型提供两个来自不同领域的存储条目一个存着物理常数另一个存着计算规则模型把两者结合算出了正确答案44牛顿与真实值完全一致而这两个条目单独看都不包含这道题的答案。类似地来自医学领域和天文物理领域的两个存储知识在合并上下文下模型能够在一个回答里同时引用两者两种不同的合并配置都测试成功了。九个条目同时合并是目前测试过的上限超出这个范围的行为尚未测量研究团队在报告里明确说明了这一点没有超出测量范围进行推断。六、存储层Merlin是如何保证金库不崩、不混、不错的维护这个知识金库的底层引擎叫Merlin它负责确保存进去的东西是唯一的、可查的而且出了问题也不会把整个库搞坏。精确寻址的速度是一个关键指标。在一个包含4500个条目的知识库上Merlin的内容键值计算速度达到每个键3.7纳秒也就是每秒2.71亿个键是加密哈希算法速度的60.2倍是标准库默认实现的18.5倍。寻址从来不会成为系统的瓶颈随着知识库扩大这个优势只会越来越明显。在实际的全集成生产路径上从一个查询进来到选中正确条目中位数用时1.6微秒95分位数是17微秒而一次完整的复用执行需要6到23毫秒寻址时间只占其中极小的一部分。去重同样经过严格测试给系统喂入6000个候选条目其中2000个是唯一的4000个是字节完全相同的重复项系统精确接受了2000个滤掉了4000个。而且规则是严格的——哪怕两个条目只差一个字节也被视为不同的新知识。存储安全性上研究团队测试了两种真实故障场景。在一个硬性内存上限下常规存储方式直接崩溃报访问违规、进程挂掉Merlin在同样的上限和同样的工作量下选择拒绝超出的请求系统继续存活。在写入中途被打断的场景下之前已提交的条目全部保持完整可读没有任何数据损坏而用同样方式打断一个常规文件存储整个文件变得完全不可读。进程完全重启之后Merlin恢复出了每一条条目字节完全一致。七、在已解决的问题上小模型赢了研究报告里有一节专门讲这套系统与顶级AI服务的比较而且特别声明用来比较的顶级模型的数字全部来自那些模型厂商自己公布的官方报告没有私自测试任何顶级模型。在从零开始解决全新陌生问题这件事上报告完全承认顶级模型领先——Anthropic公布的AIME 2026得分77.5、LiveCodeBench-v6得分72.0谷歌公布的Gemma-4-12B的这些指标确实不在同一水平。这个方向不是Galahad的目标报告没有任何这方面的竞争宣称。但在已经解决并验证过的问题这块领土上对比关系完全倒转。顶级API每次收到一道已经被解答过无数次的问题依然要完整地生成一遍答案花钱、花时间、不确定结果、没有验证保证。Galahad这边的答案是零生成代币、6到23毫秒返回、每次输出字节完全一致、存储前通过独立验证。而且这块已解决领土只会随着时间推移不断扩大从不缩小。报告还专门提出了一个公开挑战如果有任何厂商能展示一个API在已解决问题上以零边际生成代币、按位精确、使用预先验证的结果来回答研究团队愿意把这个挑战算作被推翻。目前没有已知的已发布产品文档描述了这样的服务。八、一台46GB的GPU能装下六百万个代币的上下文最后还有一项关于存储容量的对比测试结果可以说是量级上的差距。研究团队在一台46GB显存的GPU上让Galahad系统、vLLM和SGLang三者在同样的硬件条件下各自测试能够维持多大的工作上下文。vLLM在30399个代币时触发了硬性错误这是它的上下文长度上限它至少会诚实地报错。SGLang接受超过32000个代币的输入但悄悄截断而且不返回任何第一个代币——这意味着用户以为在获得服务实际上什么都没收到。Galahad维持了一个600万代币的可移动窗口整个过程GPU显存增量只有263兆字节几乎是平的。在这600万代币的存储内容里团队放置了5个探测点系统全部正确取回而且无论探测点在哪个深度访问时间都稳定在0.55到0.59秒之间——取第5970000个代币处的内容和取第0个代币处的内容花的时间一样。更早的一次测试甚至达到了1498万代币同样保持了平坦的内存占用。这里有一个重要的说明这不是模型在全局注意力600万个代币那对当前任何模型来说都是不可能的计算量。实际上系统维护的是一个在这600万代币上可以自由移动的窗口模型在任何时刻实际处理的仍然是一个有限大小的窗口只是这个窗口可以精确地移动到任何位置。团队也用一个对照实验验证了这一点故意把窗口放在别处深层探测点就看不到了答案就错了。这是设计上的预期行为而不是缺陷。此外在复用速度上同样的任务Galahad在4000、16000、30000个代币大小的存储内容上分别比对手快13倍、41倍和55倍而且这个优势随着上下文增大而持续扩大。说到底这项研究的核心洞察是当一道问题已经有了经过验证的正确答案重新推导它一遍不是智慧是浪费。Corbenic AI搭建的这套系统本质上是给AI加了一个永久不遗忘、永远不犯同样错误的知识金库。小模型冻住不动金库持续积累已解决的问题越来越多而每道已解决问题的回答代价趋向于零。这种思路并不是要取代顶级AI的原始推理能力——在面对全新难题时大模型的强项无可替代。但在那些可以被验证、会反复出现的问题上反复为相同的推理付费实际上是在用最贵的工具做最不需要贵工具的事。对于那些有大量重复性可验证任务的场景——比如财务计算、合规检查、参数化工程分析——这套机制提供了一种在成本、速度、确定性和可审计性上同时占优的选项。对于普通用户来说这项研究更像是一个提醒当前我们付费使用的AI服务可能有相当大比例的算力和费用被花在了重复解决已经解决过的问题上。如果这种浪费能够被系统性地消除AI服务的成本结构可能会发生根本性的变化。至于这是否会推动行业改变当前的默认做法以及这套系统在更复杂、更开放的任务上能走多远将会是接下来值得持续关注的问题。---QAQ1Galahad系统和普通的AI缓存有什么本质区别A普通AI缓存或向量检索是靠大概相似来找答案研究测试表明这类方案在4500条目的知识库上有高达94.3%的错误取回率。Galahad用精确内容寻址4500条目零碰撞而且每个存入的解法必须通过不依赖答案卷的独立验证确保取出的东西是真正正确的。这个区别决定了两者在可靠性上不在同一个级别。Q2Galahad验证知识的过程为什么不能看答案卷A如果验证时直接把模型输出和标准答案对比那这个验证本质上是在作弊——它依赖了外部已知答案而不是独立判断解法是否正确。Galahad的三种验证方式形式化证明检验、一致性检验、分层边界测试都是通过独立的逻辑推断来确认正确性和答案卷完全隔离这样存入的解法才具有真正的可信度。Q3Galahad系统对普通用户或企业有什么实际意义A对于有大量重复性可验证任务的场景比如财务计算、参数化工程分析、合规审查这套系统意味着前期解决和验证一次之后后续每次查询的成本接近零速度在毫秒级而且每次结果完全一致可以留审计记录。相比每次都调用顶级AI接口重新生成这是一种在成本和确定性上的结构性改善。