ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

ARIS Manual Review MCP 服务器实战指南:零 API 成本的人工中转跨模型评审

ARIS Manual Review MCP 服务器实战指南:零 API 成本的人工中转跨模型评审 AI 技能/插件AI 评测科研人工智能MCP 服务dsh-plugin【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep点击查看免费下载导读本篇技术指南聚焦 ARISAuto-Research-In-Sleep项目中的 manual-review MCP 服务器——一个面向跨模型评审场景的人工中转human-in-the-loop评审桥接器。它不自动调用任何付费评审 API而是打开本地浏览器页面或写入文件让你把评审提示词复制到与执行器不同模型家族的任意模型ChatGPT 免费版、DeepSeek、Kimi、Gemini、Qwen 等再把回复粘贴回来从而以零 API 成本获得满足 ARIS 验收门要求的跨模型评审。读完本文你将掌握该服务器的安装注册、浏览器/文件双模式使用、环境变量调优、Reviewer-Model:身份行的验证机制、多轮评审连续性以及故障恢复方法并理解其底层源码实现原理。是什么人工中转评审桥接器ARIS 的默认评审器是 Codex MCP自动调用 API而 manual-review 服务器是它的人工中转替代方案。核心设计是一句话不自动调用 Codex/GPT API而是打开浏览器页面让你将评审提示词复制到不同模型家族再将回复粘贴回来。零 API 成本评审过程不消耗任何 API 额度评审模型完全由你选择任何可分类的文本模型都可用只要 ARIS 能按家族OpenAI、Anthropic、Google、DeepSeek、Moonshot/Kimi、Qwen识别该模型名称即可强约束无法归类的模型名无法证明它与执行器属于不同家族因此不能用于验收cannot acquit——这是该服务器最重要的安全边界。从源码结构看该服务器是一个基于 Python 标准库无第三方依赖的 MCP 服务器通过 stdio 与 Claude Code 通信核心逻辑集中在 server.py浏览器界面由 ui.html 提供。适用场景没有 Codex/GPT Plus 订阅想使用免费模型进行评审ChatGPT 免费版、DeepSeek、Kimi、Gemini 等希望每次评审自行选择评审模型预算有限但仍想获得跨模型评审质量。付出的代价是失去完全自动化需要手动复制粘贴换来的是模型选择的完全自由与零 API 成本。若执行器是 Claude Code请勿使用 Claude 产品作为评审者——同家族评审无法通过 ARIS 验收门。安装与注册服务器仅使用 Python 标准库无需安装任何额外依赖。注册命令如下# 注册到 Claude Code用户级 claude mcp add manual-review -s user -- python3 /path/to/Auto-claude-code-research-in-sleep/mcp-servers/manual-review/server.py注册完成后在任意已接线的 ARIS 技能后添加reviewer: manual即可启用/auto-review-loop topic — reviewer: manual /research-review paper/ — reviewer: manual /experiment-audit results/ — reviewer: manual /proof-checker paper/ — reviewer: manual /rebuttal paper/ — reviewer: manual /idea-creator direction — reviewer: manual目前接线了 manual-review 的技能仅限 Claude Code 环境因 MCP 工具仅在 Claude Code 可用如下表技能评审用途/research-review论文评审/auto-review-loop迭代改进/experiment-audit实验代码审计/proof-checker数学证明验证/rebuttal反驳压力测试/idea-creator想法评估/research-lit当前没有 manual-review 调用块如需文献分析深度评审请使用其他评审路由。路由细则见 skills/shared-references/reviewer-routing.md 的 Optional: Manual Review 一节以/research-review为例其技能文件中将mcp__manual_review__review与mcp__manual_review__review_reply列入允许工具详见 skills/research-review/SKILL.md。重要行为差异若 manual-review MCP 未安装技能会打印安装命令并停止而不会静默回退到 Codex——因为目标用户很可能没有 Codex 订阅静默回退必然失败。这一点与 oracle-pro 的未安装则优雅回退策略不同。两种工作模式浏览器模式默认适用于 Windows、macOS 和有桌面环境的 Linux。工作流程如下流程到达评审步骤浏览器自动打开http://127.0.0.1:port左侧面板完整评审提示词点击复制提示词按钮右侧面板在此粘贴模型回复——第一行必须是Reviewer-Model: 准确模型 ID点击提交——流程继续。若缺少该行或评审模型与执行器同家族页面会直接显示被拒原因你可以就地修正第一行后重新提交。浏览器界面由 ui.html 实现中英双语切换、顶部横幅警告必须使用不同模型家族、可折叠的操作教程、左右双栏布局以及多轮评审时展示历史对话Previous Exchanges的折叠区域。文件模式无桌面 Linux / SSH适用于 SSH 或无浏览器环境的服务器。设置环境变量后生效export MANUAL_REVIEW_MODEfile工作流程流程到达评审步骤查看.aris/pending_review/pending_review.json读取其中的prompt_file和response_file字段获取路径打开prompt_file指向的prompt.md阅读提示词文件顶部包含跨模型警告复制到你的模型获取回复将回复写入response_file指向的response.md第一行为Reviewer-Model: 准确模型 ID服务器检测到文件确认内容稳定后继续流程。文件模式的关键约定服务器等待回复文件非空且稳定两次读取内容不变后才读取不要硬编码.aris/pending_review/response.md路径始终使用pending_review.json中的路径不要先创建空文件再编辑应一次性写入完整内容或使用临时文件名后重命名如.response.md.tmp再rename。环境变量参考变量默认值说明MANUAL_REVIEW_SERVER_NAMEmanual-reviewMCP 服务器名称MANUAL_REVIEW_TIMEOUT_SEC8640024h最大等待时间MANUAL_REVIEW_MODEbrowserbrowser或fileMANUAL_REVIEW_AUTO_OPENtrue是否自动打开浏览器MANUAL_REVIEW_PORT17900固定 HTTP 端口被占用时递增MANUAL_REVIEW_PENDING_DIR.aris/pending_review状态/提示词/回复文件目录MANUAL_REVIEW_DEBUG_LOG空调试日志文件路径从 server.py 的源码可见这些变量的读取方式MANUAL_REVIEW_AUTO_OPEN的取值集合为1/true/yes不区分大小写MANUAL_REVIEW_PORT从17900起始最多尝试 10 次递增重试MAX_PORT_ATTEMPTS 10全部失败则报错。文件模式下还有两个内部参数FILE_STABLE_INTERVAL_SEC 3稳定性校验间隔两次读取需间隔 3 秒和FILE_POLL_INTERVAL_SEC 2轮询间隔。核心机制一模型家族分类与Reviewer-Model:身份行家族分类规则服务器通过 model_family() 函数对模型名做正则匹配识别六个家族匹配冲突时返回unknown家族匹配关键词正则openaigpt、chatgpt、codex、oracle、o1、o3、o4anthropicclaude、sonnet、opus、haiku、anthropicgooglegemini、googledeepseekdeepseek[0-9.]*允许版本号如deepseek-v3、deepseek-r1moonshotkimi、moonshot同样支持版本号qwenqwen、tongyi如qwen3-max、qwen2.5-72b不在此列的模型名无法归类因而不能用于验收——请按厂商的准确写法填写。Reviewer-Model:身份行需要产出判定verdict的评审回复必须以一行注明实际撰写它的模型开头Reviewer-Model: deepseek-v3 Score: 7/10 ...服务器通过 reviewer_model_from_response() 只解析第一行re.fullmatch精确匹配Reviewer-Model:\s*值不信任正文中的其他表述再与执行器家族比对。validate_reviewer_identity() 实现fail-closed严格门禁执行器模型缺失或家族未知 → 拒绝回复首行不是Reviewer-Model: exact-model-id→ 拒绝评审模型家族未知 → 拒绝评审模型与执行器同家族 → 拒绝错误信息会给出双方家族。诚实边界这是自报的身份不是证明——ARIS 校验的是你写入的这一行它无法独立得知你实际使用了哪个网页。UI 顶部的警告是提示性的真正构成验收门的是被追踪的模型身份与推导结果。核心机制二pending 状态文件与令牌认证状态文件服务器把每次评审的状态写入MANUAL_REVIEW_PENDING_DIR默认.aris/pending_review/顶层pending_review.json指向当前评审状态的指针每个线程独立的子目录thread_id/包含prompt.md文件模式、response.md文件模式、pending_review.json。状态文件结构见 write_pending_state(){ status: waiting, url: http://127.0.0.1:17900?tokenabc123, prompt_file: /abs/path/to/.aris/pending_review/thread_id/prompt.md, response_file: /abs/path/to/.aris/pending_review/thread_id/response.md, thread_id: 12位十六进制, created_at: 2026-09-21T03:43:04Z }浏览器模式下prompt_file为null、url非空文件模式下反之。每次调用都会生成新的thread_iduuid4().hex[:12]子目录按线程隔离避免并发调用互相覆盖。一次性令牌与浏览器安全浏览器模式下服务器生成一次性会话令牌_generate_token()基于 uuid4 hexURL 形如http://127.0.0.1:17900?tokenabc123。_check_token() 校验查询参数或X-Review-Token请求头_check_origin() 作为纵深防御拒绝Origin非http://127.0.0.1:端口的跨站请求及Sec-Fetch-Site非 same-origin/none 的请求。测试 test_manual_review.py 中的test_browser_mode_http验证了无 token 访问返回 403、恶意 Origin 返回 403、跨站 Sec-Fetch-Site 返回 403、OPTIONS 一律返回 403且响应头中不包含Access-Control-Allow-Origin。多轮评审与线程连续性对于使用多轮评审的技能如/auto-review-loop、/proof-checkerPhase 3服务器提供两个工具工具参数用途reviewprompt必填、config开启新的评审会话review_replythreadId必填、prompt必填、config在既有线程中继续对话review_reply会把此前所有轮次的提示词/回复作为上下文展示浏览器页面在可折叠的历史对话区域显示文件模式下写入prompt.md的 Previous Exchanges 部分每轮内容截断至 500 字符建议跨轮次保持同一个模型对话窗口以获得最佳连续性若传入未知的threadId服务器返回错误见handle_review_reply与测试test_review_reply_unknown_thread。从源码看线程历史以内存字典_threads保存存活于 MCP 服务器进程生命周期内append_exchange记录每轮 user/assistant 内容。端到端集成测试 test_manual_review_integration.py 完整模拟了一次research-review调用发送真实评审提示词 → 通过 HTTP 提交回复 → 校验返回格式 → 用review_reply进入第 2 轮并验证threadId保持不变、历史上下文正确传递。并发、超时与取消并发 fail-fast若已有评审正在进行新的review/review_reply调用会被拒绝并返回 Another manual review is already in progress见测试test_second_review_rejected_while_first_pending防止多个 HTTP 页面互相覆盖超时默认等待 24 小时MANUAL_REVIEW_TIMEOUT_SEC86400超时后流程报错取消支持 MCP 标准的notifications/cancelled通知。_cancel_active_call() 只设置信号由工作线程的finally负责关闭 HTTP 服务器、释放端口、清理 pending 状态requestId 不匹配的取消会被忽略见测试test_cancel_wrong_request_id_ignored取消后服务器仍然存活可接受新请求见test_mcp_cancel_notification_cleans_browser_state与 10 轮压力测试test_cancel_stress_10_iterations。文件模式的高级细节文件模式的提示词写入采用原子写入os.replace先写临时文件.prompt.md.tmp再重命名避免观察者人工具或测试套件在文件创建与 flush 之间读到空内容。prompt.md顶部包含跨模型警告横幅中英双语并在严格模式下附加执行器模型及其推导家族、以及Reviewer-Model:行要求见 file_mode_warning()。回复校验流程轮询response.md跳过空文件与读取失败两次读取内容一致才接受稳定性校验随后做身份校验。若身份行错误回复会被转存为response.rejected.mdkeep_thread_dirTrue保留线程目录保住你刚粘贴的文本以便就地修正重贴——而不会把整份工作随错误的第一行一起扔掉见 wait_for_file_response() 及测试test_file_mode_empty_rejected、test_file_mode。恢复与故障排查不小心关了浏览器标签页查看.aris/pending_review/pending_review.json获取完整 URL必须完整复制包含一次性 token如http://127.0.0.1:17900?tokenabc123服务器仍在运行重新打开该 URL 即可。不要手动输入裸地址http://127.0.0.1:17900——没有 token 会返回 403。服务器超时默认超时 24 小时超时后流程报错重新运行技能即可。粘贴了错误回复提交后无法撤销需要时重新运行技能。身份被拒检查回复第一行是否为Reviewer-Model: 准确模型 ID且该模型家族与执行器不同、且可被 ARIS 归类浏览器页面会直接显示被拒原因可就地修改后重新提交。调试设置MANUAL_REVIEW_DEBUG_LOG指向日志文件可记录发送的消息SEND与 HTTP 访问日志见 debug_log()。详细的中文操作手册另见 docs/MANUAL_REVIEW_GUIDE_CN.md其中包含与本文对应的完整工作流程、Reviewer-Model:行规范与最佳实践。最佳实践使用推理能力强的模型——提示词为深度推理设计界面会显示reasoning_effort xhigh推荐徽标该值仅作提示、不会嵌入提示词正文。GPT-4o、DeepSeek-V3、Kimi、Gemini 等效果较好若执行器是 Claude Code请勿使用任何 Claude 家族模型。保持Reviewer-Model:在第一行——不要让模型自行添加的空行、标题或开场白排在它前面服务器只解析第一行。粘贴完整回复——不要截断或总结流程会从回复中解析特定字段分数、判定、行动项。不要修改提示词——原样粘贴评审任务文本与 Codex 收到的完全一致人工中转包装层只追加模型身份响应格式行。多轮评审时——在模型中保持同一对话第 2 轮不要开新对话。后续计划图片生成支持codex-image2的人工替代方案上传/粘贴图片图片评审循环通过同一 UI 进行论文插图的迭代改进。赞分享AI 技能/插件AI 评测科研人工智能MCP 服务dsh-plugin【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep点击查看免费下载相关推荐Windows平台XPU调度新选择XSched安装与验证指南Windows平台XPU调度新选择XSched安装与验证指南 前往项目官网免费下载 https://ar.openeuler.org/ar/ https:/AI 技能/插件AI 评测科研人工智能MCP 服务dsh-pluginARIS Codex Gemini 评审者接入指南跨模型 Review 桥的架构、安装与异步审查实战ARIS Codex Gemini 评审者接入指南跨模型 Review 桥的架构、安装与异步审查实战 导读 本文是 ARISAuto ResearchAI 技能/插件AI 评测科研人工智能MCP 服务dsh-pluginARIS 跨模型审查实战用 Codex 主执行 Claude Code CLI 审查的 claude-review MCP 桥接方案ARIS 跨模型审查实战用 Codex 主执行 Claude Code CLI 审查的 claude review MCP 桥接方案 导读 本文讲解 AAI 技能/插件AI 评测科研人工智能MCP 服务dsh-plugin上一篇如何快速把微信聊天记录导出成 HTML 永久保存留痕 WeChatMsg 完整指南下一篇Office Custom UI Editor定制 Office 功能区选项卡与按钮的完整指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表