ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

如何评价 OpenAI 最新推出的 GPT-6 Sol 和 GPT-6 Luna?

如何评价 OpenAI 最新推出的 GPT-6 Sol 和 GPT-6 Luna? 我这两天看 GPT-6 Sol 和 GPT-6 Luna第一感觉其实不是“GPT-6 终于全面来了”反而觉得 OpenAI 现在越来越喜欢把同一代模型拆成不同档位了。以前大家讨论模型比较容易变成哪个最聪明、跑分高多少现在到了 GPT-6 这一代更像是在问这个任务到底值不值得用最贵的模型跑。GPT-6 Sol 和 Luna 是 9 月 22 日刚发布的目前已经进入 API同时开始放到 ChatGPT Work 和 Codex 里。这里有个细节挺容易误会目前它们和普通 ChatGPT 聊天里的模型还是分开的所以你开了 Plus 或 Pro也不要看到“GPT-6 发布”就默认自己平时聊天已经全部切到 GPT-6 了。至少从 OpenAI 现在的说明看这次更新明显更偏开发、Agent 和批量工作场景。我目前比较看好 Sol。原因倒不是名字从 GPT-5.6 Sol 变成 GPT-6 Sol 这么简单而是它的定位挺清楚复杂代码、Agent、多步骤任务又不想每次都上最贵的 Astra。OpenAI 给 Sol 的官方定位就是复杂 coding 和 agentic workflows支持从 none 一直到 max 的 reasoning effortcontext window 做到了 105 万 tokens。对于平时用 Codex 改项目的人这种升级可能比聊天的时候“感觉回答聪明了一点”更实际。比如以前我让 Codex 看一个比较大的仓库真正让人烦的经常不是某一段代码不会写而是任务做长以后开始忘前面的约束改 A 文件的时候把 B 文件的逻辑搞乱或者跑到中间开始偏题。这类任务如果 Sol 在长上下文、工具调用和连续执行上的稳定性能提升实际使用感受会很明显。至于是不是已经到了“可以放心把整个项目扔进去”的程度我现在还不太敢这么说毕竟模型才刚出来一天网上很多评价也都是第一轮测试。Luna 反而是这次让我有点意外的那个。很多人一看到 Luna 这种定位可能会觉得就是“便宜版 GPT-6”适合没钱的时候凑合用。但 OpenAI 给它的 API 定价确实低得有点夸张标准价格下每百万输入 tokens 是 0.1 美元输出 0.5 美元Sol 则是输入 2 美元、输出 10 美元。两者都是 105 万 context、最高 12.8 万输出 tokens。单纯按 API 价格算Luna 跟 Sol 根本不是差一点是直接差了一个很大的档位。这就会带来一个挺有意思的变化。以前调用模型的时候大家经常舍不得让 AI 多跑几次因为每次都在烧 credits。现在如果 Luna 的实际能力能维持在一个够用的水平那很多重复任务完全可以放心交给它比如批量分类、整理文件、跑一些固定格式的代码任务、做初步 review甚至让 Codex 先用 Luna 跑一轮遇到难题再换 Sol。对于 API 用户来说我觉得这个意义可能比单纯跑分提升还大因为你真的敢让它干活了。这里我觉得还要把 ChatGPT 会员和 API 分开看。Plus、Pro 这种套餐解决的是 ChatGPT、Codex、Work 里面能用什么模型、给多少额度的问题API 则还是按 tokens 和 credits 单独付费。很多人以前看到自己已经充值了 Plus就以为 API 也包含进去这两个一直不是一回事。所以如果只是平时聊天、偶尔让 Codex 改代码没有必要看到 GPT-6 就急着升级套餐或者购买一大堆 credits。反过来如果公司每天要批量跑几百万、几千万 tokens那 Luna 这种价格变化确实值得重新算账。而且我觉得 OpenAI 现在的思路已经挺明显了Astra 放最难、最贵的任务Sol 承担大部分认真工作的场景Luna 去吃掉那些量特别大、但没有必要每次都调用最强模型的任务。官方自己的模型选择页面也是这么写的Astra 偏最复杂的 reasoning 和 codingSol 在能力和成本之间取平衡Luna 就是面向成本敏感和高吞吐场景。如果只让我选一个长期用我目前大概率还是 Sol。写代码、读仓库、让 Codex 连续做十几步修改我宁愿额度消耗快一点也不太想为了省 credits 反复返工。但如果是 API 批量任务Luna 就很有吸引力尤其是那种一天跑几千甚至几万次请求的业务单价差距最后会非常夸张。所以这次 GPT-6 Sol 和 Luna 给我的感觉有点像 OpenAI 已经不太执着于让所有人都去用“最强模型”了。普通用户最后可能根本不会天天关心 Astra 跑分有多高真正影响体验的反而是我买了这个套餐以后Codex 能不能多跑几次额度是不是够用响应够不够快失败以后重新跑会不会心疼。GPT-6 Luna 如果后面实际表现没有出现明显缩水我甚至觉得它可能会比 Sol 更容易大规模普及。Sol 会是很多重度用户愿意主动选择的模型而 Luna 很可能慢慢变成那种“你每天用了很多次但根本没注意自己一直在用它”的模型。这个可能才是这两个模型里比较有意思的地方。
返回列表