全球三大AI包揽IMO满分,击败99%人类
📅 2026/7/27 7:15:14
👁️ 次浏览
第67届国际数学奥林匹克正式落幕中国队以232分斩获桂冠。三名少年拿下42分满分。现场掌声还未散尽GitHub上悄然浮现了另一份亮眼的成绩单。前Google工程师Deedy Das甩出一场AI横评7个前沿大模型全自主单挑IMO 2026全部6道题。Claude Fable 5狂揽42分满分。耗时仅仅2.5小时烧掉51美元。GPT-5.6 Sol的xhigh版本同样满分。用时3.8小时成本更是压到了极低的20美元。KimiK3紧随其后拿下满分。历经17.4小时鏖战花费31美元。再算上独立交卷的AxiomProver整整四方势力全部登顶满分。作为参照过去七年IMO4347名人类选手参赛只有30人拿过满分——比例0.69%。成绩断层式碾压从结果来看不仅满分42和第四名28之间横着14分的鸿沟而且三个满分模型登顶的姿势截然不同。Claude Fable 5打得干净利落。9轮对话6轮有效输出单趟最长73分钟P3全程输出70万token。GPT-5.6 Sol显得有些坎坷。在P2上磨了106分钟跑4轮中途被网络故障打断两次。但算力控制堪称恐怖——总输出只有23万token三个满分里最省。KimiK3像一头不知疲倦的巨兽。2.8万亿参数的MoE模型一口气喷涌出154万token是Sol的6.5倍。光P3一道题就发起6次冲锋鏖战491分钟。数学直觉的正面交锋P1是全场最温和的开胃菜所有模型几分钟搞定人类选手也几乎无一失手。题目大意是黑板上写着2026个大于1的正整数。每一步选两个数m和n擦掉换上gcd(m,n)和lcm(m,n)/gcd(m,n)。反复操作直到无法继续。证明(a) 过程一定会终止最终恰好剩一个大于1的数M(b) M的值不依赖于操作顺序。为了便于理解这道题我们先做一个微缩实验。黑板上只有12和18。12 2² × 318 2 × 3²。第一步gcd(12,18) 6lcm(12,18)/6 6黑板变成[6, 6]。第二步gcd(6,6) 6lcm(6,6)/6 1黑板变成[6, 1]。只剩一个大于1的数游戏终止。M 6。不管你怎么打乱操作顺序M永远是6。为什么答案藏在素因子里。对每个素数p取所有数被p整除次数的最大公约数再把这些素数幂乘起来——这个值从第一步到最后一步都一直不变。Claude Fable 5直接生造了一个每步必定缩水的计数器。对于这道题Fable 5定义了一个量Φ T N。T是黑板上所有数的素因子个数之和重复计N是大于1的数的个数。比如黑板[12, 18]12的素因子是2、2、3共3个18的是2、3、3共3个T 6N 2Φ 8。然后它证明了每执行一步操作Φ至少减少1。分两种情况——如果gcd(m,n) 1素因子总数T会减少如果gcd(m,n) 1T不变但大于1的数少了一个N减1。Φ是正整数每步至少减1过程必须在有限步内终止。单一计数器一刀斩断。GPT-5.6 Sol追踪乘积字典序降维。Sol看的则是两个量P 所有数的乘积K 大于1的数的个数。每步操作如果gcd(m,n) d 1新的两个数的乘积是mn/d比原来小全局乘积P严格变小。如果d 1P不变但K减少1。(P, K)这个二元组在字典序下严格递减要么P变小要么P不变但K变小。正整数的字典序不可能无限递减。终止。两条截然不同的路径攻克了同一个问题的(a)部分。到了(b)部分三个模型殊途同归都证明了对每个素数p黑板上所有数被p整除次数的最大公约数在操作中不变。最终公式也是一模一样——回到例子验算12和18。对p2v₂(12) 2v₂(18) 1gcd 1贡献2¹。对p3v₃(12) 1v₃(18) 2gcd 1贡献3¹。M 2 × 3 6和手算分毫不差。全场最廉价的白卷P6这道数论题是Day 2的压轴它要求证明递推序列最终具有周期性。去年IMO 2025全球只有6个人类解出P6。Claude Fable 526分钟两轮满分。GPT-5.6 Sol60分钟两轮满分。KimiK3381分钟四轮满分。Grok 4.5在P6上只挤出7053个token全场垫底。提交文件里赫然写着一句Full proof: (Not yet complete.)$0.18全场最廉价的白卷。Grok的毛病不止于此。整个测试中它反复陷入一种诡异的幻觉信誓旦旦地声称「证明已经写入文件」后台却连写入工具都没碰一下。这不是数学能力问题是agent能力问题。模型知道应该写文件也声称自己写了但在工具调用层面没有动手。三年三级跳硅基大脑的恐怖进化2024年DeepMind的AlphaProof首次在IMO级别摸到银牌门槛。2025年OpenAI和DeepMind同时出手。OpenAI未公开模型解5题拿下35分金牌Gemini Deep Think达到同等段位。2026年三个通用大模型直接拿下满分。这次不仅没有经过任何专项数学训练而且所有人都能用上。甚至还有一个是开源的。写下机器战书的人整场测试的起点是一家叫Axiom Math的公司。他们将IMO 2026的全部6道考题逐字逐句翻译成了机器能够理解的Lean 4形式化题面。有了这套机器可读的题目AI才能直接输出Lean证明、由编译器自动判分不再需要人类评委阅卷。拿到题面后Deedy Das迅速搭建起全自动化的测试框架。各大模型在赛道上各自狂奔跑完了全部6道关卡。AxiomProver也独立斩获了满分。值得一提的是Axiom Math的创始人洪乐彤年仅25岁。她出生于广州仅用三年便横扫MIT数学与物理双学位更是Morgan Prize的得主。去年底她一手打造的AxiomProver拿下了Putnam数学竞赛的满分。这是该项赛事98年历史上的第6个满分奇迹。今年3月这家公司完成了2亿美元A轮融资。估值直冲16亿美元。普通人的生活将被如何重构能写4229行严格证明的模型手里握着的不只是解数学题的能力。它真正掌控的是长链条逻辑推导每一步不能跳、不能错、不能含糊。合同条款有没有漏洞、保险理赔条件满不满足、税务方案合不合规剥开表象都是同一类问题答案不能「差不多对」。过去这种逐条核验只有专业人士能做按小时计费。如今随着这个能力铺进消费级产品遇到棘手问题只需打开手机就行了。原文链接刚刚全球三大AI包揽IMO满分击败99%人类-36氪
1. 楼宇光纤线路接入的行业背景与挑战在数字化转型浪潮下,楼宇智能化已成为现代建筑的基础要求。作为承载数据流量的"血管系统",光纤网络的质量直接决定了整栋建筑的ICT服务能力。根据TIA-568.3-D标准,商业建筑光纤布线系统的设计寿…
📅 2026/7/27 7:15:14
2026年的科技圈,英伟达、OpenAI依然稳居顶流,海力士和三星则强势上位。一众新旧巨头争相登场,这里面真正耐人寻味的玩家,却是贝索斯。
2021年卸任亚马逊CEO后,贝索斯可是一点没闲着:借着Blue Origin&#…
📅 2026/7/27 7:15:14
先把答案放桌上:因为产出从来不是工具单独决定的,它是一道乘法:产出 认知 工具。工具那一项,顶级的每月也就几十美金,人人买得起——花钱能买到的东西,注定拉不开差距;拉开差距的是认知那一项…
📅 2026/7/27 7:15:14
1. Claude Code文件过滤机制深度解析作为AI辅助编程工具链中的新锐成员,Claude Code通过精细化的文件过滤系统确保开发环境的安全性与效率。这套机制主要由两个核心配置文件构成:项目级的.claudeignore和系统级的permissions.deny。前者类似于Git的.giti…
📅 2026/7/27 8:25:31
KVM主题:guestmount文件系统挂载指南
在虚拟化技术日益普及的今天,KVM(Kernel-based Virtual Machine)作为Linux平台上的一个强大虚拟化解决方案,受到了众多开发者和系统管理员的青睐。KVM允许用户将Linux内核转化为一…
📅 2026/7/27 8:25:31
在内容审核日益严格的今天,如何准确识别AI生成文本已成为开发者必须面对的技术挑战。特别是对于教育平台、内容社区、招聘系统等场景,误判人类原创内容为AI生成(false positives)不仅影响用户体验,更可能引发法律风险。…
📅 2026/7/27 8:25:31
1. 项目概述:为什么企业级Web应用部署不能“一键搞定”?干了这么多年开发和运维,我发现一个挺有意思的现象:很多开发团队在本地把Web应用跑得飞起,功能测试也全过了,可一到部署上线,就跟换了个人…
📅 2026/7/27 8:25:31
Linux C 基础组件设计细则(日志库 线程池)
本文档基于提供的代码实现与设计思路,从架构思想、类结构、关键实现、避坑要点等维度进行完整拆解,覆盖日志库的策略模式设计、线程池的池化与单例设计,以及并发编程的核心…
📅 2026/7/27 8:25:31
还在为找不到靠谱的落脚点发愁?这篇东西能帮你省下几万冤枉钱,还能让你避开那些坑爹的隐形雷区,看完你就心里有数了。说实话,刚听到“geo1529304Z空间”这串字符的时候,我脑子里蹦出的第一个念头就是:这玩意儿是不是又是哪个二道贩子搞出来的新名词?毕竟现在市面上各种“…
📅 2026/7/27 8:23:48
现象在 WezTerm 终端中,包含中文路径的文本(如标签页标题、Shell 提示符、路径补全)中,某些汉字时而渲染为日文字形,时而显示为简体中文(中国大陆)字形。以「径」字为例,日文写法右侧…
📅 2026/7/27 0:00:07
这个问题看似在寻找一个答案,实际上是在寻找一种“值得继续投入的方向感”。很多人在问:
“人生有什么意义?”
深层可能是在问:
我现在做的事情值得吗?我的努力有没有价值?我的存在是不是重要?未…
📅 2026/7/27 0:00:07
1. 为什么MoE架构让大模型参数量翻倍却不增加推理成本?去年我在部署一个千亿参数大语言模型时,首次接触到混合专家模型(Mixture of Experts,简称MoE)架构。当时最让我震惊的是,这种架构的模型参数量可以达到…
📅 2026/7/27 0:00:07
更多请点击:
https://codechina.net
第一章:AI帮助理解数学概念 人工智能正以前所未有的方式重塑数学学习的路径。通过自然语言处理与符号计算的深度融合,AI不仅能解析抽象定义,还能将定理、证明和几何直觉转化为可交互、可验证的…
📅 2026/7/27 1:11:21
1. 项目背景与核心价值去年参与的一个短剧项目让我深刻体会到传统创作流程的痛点:编剧团队花了三周打磨剧本,角色设计反复修改了七版,最后成片时又因为演员档期问题不得不临时调整分镜。这种低效的创作模式在快节奏的内容行业越来越难以为继。…
📅 2026/7/27 1:11:21
remix-i18next TypeScript类型安全实践:确保翻译键与类型定义同步 【免费下载链接】remix-i18next The easiest way to translate your React Router framework mode apps 项目地址: https://gitcode.com/gh_mirrors/re/remix-i18next
在开发多语言应用时&am…
📅 2026/7/27 1:11:21
目录
第一步:选对模板,省心一半
第二步:打开扫码点餐功能
开启功能按钮
桌台管理与桌码生成
第三步:个性化设计,打造品牌感
调整点餐页面
设置点餐规则 你还在让顾客站着排队点餐吗?2025年ÿ…
📅 2026/7/27 7:11:38
在业务中快速构建一个能理解私有文档、准确回答专业问题的智能助手,是很多开发团队面临的共同挑战。传统方案往往需要从零开始搭建复杂的 RAG(检索增强生成)系统,涉及文档解析、向量化、检索、大模型调用等多个环节,整…
📅 2026/7/26 17:10:53
FAE放射组学分析工具:医学影像特征探索的完整解决方案 【免费下载链接】FAE FeAture Explorer 项目地址: https://gitcode.com/gh_mirrors/fae/FAE
你是否曾经面对海量医学影像数据感到无从下手?想要从CT、MRI等影像中提取有价值的定量特征&#…
📅 2026/7/27 5:11:32