ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Google Gemini 原生多模态拆解笔记:这次走 TaoToken 让 Claude Code 读白皮书

Google Gemini 原生多模态拆解笔记:这次走 TaoToken 让 Claude Code 读白皮书 拆解 Google Gemini 时「拼接式多模态」与「原生多模态」的路线差异是最值得反复比较的部分。这次我改用 Claude Code 做长会话 Agent让它分批读白皮书和版本公告逐项输出对比TaoTokenhttps://taotoken.net/?utm_sourcetaotoken_aicg_blog_end负责统一管理模型访问同一个 Key 既能走 Gemini也能随时切到其他模型做交叉验证。模态协同性差、长上下文不足正是 Gemini 系列从头到尾都在解决的行业核心痛点也是这篇文章里 Claude Code 要持续追踪的两条主线。原文拆解分成官方定义、核心版本迭代、技术架构、痛点落地、优势不足五个板块手动操作时要开十几个标签页反复核对版本表。这次把流程改成先去 TaoToken 拿 Key 配好 Claude Code再把资料按版本分批投喂最后让 Agent 在同一段会话里输出对比。实际跑下来不用再担心页面关掉后找不到出处每次调用也能在控制台看到 Token 消耗与返回质量。1. 先把「Gemini 拆解」改成 Claude Code 能执行的三批任务1.1 原文的五个板块重组为三个工作包原文信息量很大官方定义、版本迭代、核心技术架构、行业痛点、落地场景、核心优势与现存不足。如果把这些内容一次性塞给 Claude Code很容易出现前面读后面忘、输出结构跑偏的问题。所以要先把它拆成三个工作包每个工作包对应一批资料和一条明确的输出指令。第一个包是「定义与架构」放 Gemini 1.0 和 1.5 的白皮书、开发者文档中关于原生多模态、MoE 稀疏架构、环形注意力的描述。Claude Code 读完这包只做一件事回答「Gemini 在底层架构上和拼接式模型到底差在哪」。第二个包是「版本与迭代」放 Gemini 2.0、3.0、3 Pro 的官方版本公告包含上下文窗口变化、DeepThink 深度推理、media_resolution 参数、企业版发布等。这个包的任务是按时间线梳理每一项升级对应解决的场景问题。第三个包是「生态与落地」放 Google Workspace、Android、Apple Intelligence 集成案例以及官方披露的开发者数量和企业客户数据。任务聚焦在「One Google 生态协同给落地带来了什么」以及资料中提到的不足与限制。三个包的输出最后合并成一张四维度对比表。这里有一个关键区别原文是作者自己读资料后写结论而 Agent 模式下Claude Code 读的是你放进项目目录或贴进对话的原始资料而不是凭常识脑补所以喂给它的材料边界决定了它输出结论的可信度。1.2 为什么用长会话而不是一次性提问普通对话框适合问单个问题不适合做持续拆解因为每开一个新对话模型就要重新理解背景上下文一长还会丢掉前面说过的小结论。Claude Code 这类 Agent 工具的优势是会话可以一直挂着分批喂料逐步修正输出结构。我在实际跑的时候分三天喂了三批资料每天只处理一个工作包。中间发现问题比如某个版本号对不上就直接在当前对话里纠正它后续输出都会沿用修正后的口径。这种连续性是一次性提示词很难模仿的。2. 拿 Key 与配置TaoToken 统一入口Claude Code 指向同一个 Base URL2.1 打开官网完成注册并创建 API Key配置的第一步是去 TaoToken 注册登录进入控制台后创建 API Key。创建后把 Key 复制保存后续要填进 Claude Code 的环境变量里。这把 Key 是 TaoToken 的访问凭证不是 Google 官方 Key配置路径和官方文档里的做法不一样别混用。如果之前你已经在 Claude Code 里给不同模型各配了一把 Key这里可以统一成一把TaoToken 用自己的模型映射机制把同一个 Key 路由到不同模型上你只需要维护一个凭证切换模型时不用换 Key只换模型 ID。2.2 在 ~/.claude/settings.json 写入环境变量Claude Code 接兼容 API 通道最稳的写法是把环境变量写到~/.claude/settings.json的env块里。这样做的好处是不会因为终端会话不同而漏加载环境变量也不会影响其他终端里的工具。{ env: { ANTHROPIC_BASE_URL: https://taotoken.net/api, ANTHROPIC_AUTH_TOKEN: YOUR_API_KEY, ANTHROPIC_MODEL: YOUR_MODEL_ID } }保存后彻底重启 Claude Code不是新建终端是退出进程再重新进入。其中ANTHROPIC_MODEL的值以 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end 模型广场当时列表为准不要凭记忆填一个名字。部分版本的 Claude Code 还会提示配置ANTHROPIC_SMALL_FAST_MODEL如果启动时看到相关提示在模型广场选一个低延迟模型 ID 填上即可。提示Base URL 填写的是 https://taotoken.net/api末尾没有 /v1。Claude Code 发起请求时会自动拼接 /v1/messages 之类的路径如果你自己加了 /v1反而会拼出双 /v1 的地址。3. 按版本迭代喂资料让 Claude Code 沿着时间线输出「架构—上下文—生态」3.1 第一批Gemini 1.0 / 1.5 白皮书和开发者文档把官方白皮书转成文本放到项目目录gemini-docs/下或者直接分段贴进对话。我建议用本地目录方式因为 Claude Code 可以自己读文件省去复制粘贴造成的格式错乱。喂完第一批资料后我给的指令是你正在拆解 Google Gemini 系列。资料在 gemini-docs/01 目录下。 请按顺序输出 1. Gemini 的官方定义与核心定位 2. 与「原生多模态」直接相关的架构设计 3. 上下文窗口和推理效率相关数据 4. 与拼接式多模态的关键差异 先输出结论再贴资料中的依据片段。Claude Code 会先扫目录、读文件然后按这条指令输出。第一批的关键检验标准是「原生多模态」这条主线是否清晰如果输出里出现「文本和视觉各自处理后再融合」之类的表述说明它没有抓住重点需要马上纠正。3.2 第二批Gemini 2.0 / 3.0 / 3 Pro 版本公告版本公告信息密度高适合按时间顺序依次读入。我让 Claude Code 先列一个时间线再逐个版本填充信息发布时间、上下文窗口、新增技术、生态集成、开发者工具变化。这个阶段最值得关注的是 3 Pro 把上下文窗口推到 300 万 Token 的能力。可以让 Claude Code 沿着「32K → 100K → 500K → 100 万 → 300 万」的路径输出一张演进表并标出每个阶段的标志性技术MoE、环形注意力、DeepThink。表格出来之后人工核对一遍版本号和时间再让它继续分析前后版本的继承关系。3.3 第三批生态合作与落地案例生态案例经常分散在案例研究和公告里长度不长但数量多。把这些材料放进gemini-docs/03目录让 Claude Code 读取后做两件事一是归纳 Google Workspace、Android、Apple Intelligence 三条生态线的集成方式二是找出原文「不足」部分对应的反面证据例如中文能力、闭源模式、生态依赖等。第三批输出时Claude Code 可能会遇到资料里没有的信息。我要求它遇到这种情况必须写「资料中未提及待补」不许自己编一个出来。这一步是 Agent 拆解和普通对话最大的区别普通对话会顺着话头往下圆而 Agent 模式下我们可以强制它区分「资料有」和「资料无」。3.4 合并输出一份四维度对比表三批资料都读完后让 Claude Code 合成最终对比表把前面三批结论合并成四维度对比 官方定义与架构 / 版本迭代 / 痛点与落地 / 优势与不足 每个维度列出 Gemini 各版本的关键变化、以及你判断依据的文件名。合并输出后人工检查一遍。凡是它标注「资料中未提及」的地方回到原始白皮书和公告补充凡是它给出具体数字的地方对照原文确认出处。整个复现过程到这里基本完成接下来做交叉验证。4. 交叉验证与用量核对同一把 Key 切模型回控制台对账4.1 换一个模型复核关键结论当 Claude Code 输出「Gemini 多模态协同推理效率比某种拼接式方案高出四成」之类的结论时我会换一个模型独立复核。做法很简单不改 Base URL不改 Key只把 settings.json 里的ANTHROPIC_MODEL换成模型广场上的另一个模型 ID重开会话让它自己读同一批白皮书并回答同一个问题。两个模型基于同一份材料、同一个判断标准输出后再对比两者的表述和数字。出现分歧的地方往往就是原文中需要进一步确认的争议点也值得回到官方文档再核对一遍。这套操作里 TaoToken 只负责转发请求模型切换纯粹是配置层面的改动几分钟就能完成。4.2 回控制台检查本次调用的 Token 消耗配置是否正确最终以控制台的调用记录为准。登录 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end 查看最近调用如果能看到刚才 Claude Code 会话产生的请求记录、Token 数和对应模型 ID说明 Base URL、Key、模型 ID 三项全部正常。这一步也对应原文里「看文档、查用量」的收尾动作但更直接调用记录里能清楚看到每次长会话消耗了多少 Token以及模型 ID 是否与模型广场一致。如果记录为空说明 Claude Code 可能在走缓存路径或配置没生效回到第 2.2 节检查。5. 配通之后可能遇到的三个问题5.1 401 UnauthorizedKey 和环境变量如果 Claude Code 启动后所有请求都返回 401大概率是 Key 复制不完整或 settings.json 的 env 值里混入了空格。检查顺序先打开控制台重新复制一次 Key再确认 env 里没有多余字符最后确认用的是 TaoToken 创建的那把 Key 而不是别的服务商的 Key。这几种情况在日志里的表现都一样所以按顺序排查而不是反复重启。5.2 404 或路由错误Base URL 不要带 /v1如果日志里出现https://taotoken.net/api/v1/v1/messages之类的路径说明 Base URL 末尾带了 /v1。正确的写法是 https://taotoken.net/apiClaude Code 会自动拼接 /v1/messages 路径。这个错很常见因为很多 OpenAI 兼容服务要求你手动写 /v1而 Anthropic 兼容服务不需要两种习惯混在一起就变成双 /v1。5.3 模型不存在的报错ANTHROPIC_MODEL填了一个模型广场上不存在的 ID 时Claude Code 会报模型相关的 404 或 400。处理方式不是猜名字而是回模型广场查当时列表。模型 ID 可能带版本或日期后缀以列表显示为准。另外切换模型后要重启 Claude Code 再验证确认新配置已加载。6. 这套链路直接复用到下一篇拆解6.1 换资料清单保留同一套 Agent 流程原文结尾预告下一篇拆解 Anthropic Claude 系列。用这套链路不需要改任何配置把gemini-docs/换成claude-docs/把提示词里的模型名从 Gemini 换成 Claude再按「架构 → 上下文 → 生态」三个工作包分批喂给 Claude Code。TaoToken 仍然作为统一 API 通道Key 和 Base URL 都不用动。6.2 先从一次简短对话开始验证整套复用之前建议先在 TaoToken 模型对话 里用同一把 Key 发一条消息确认模型 ID 和 Base URL 没有填错。如果准备长期用它读白皮书、写代码可以看一下 Coding Plan 的套餐是否匹配你的调用量Key 在 控制台 API Keys 创建。Claude Code 环境变量细节见 接入文档下一篇拆解直接从同一份 settings.json 开始。
返回列表