ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

gbrain concept-synthesis 技能实战:将数千条概念 stub 沉淀为分层知识地图

gbrain concept-synthesis 技能实战:将数千条概念 stub 沉淀为分层知识地图 人工智能RAGAgent 记忆MCP 服务知识管理【免费下载链接】gbrainGarrys Opinionated OpenClaw/Hermes Agent Brain项目地址https://gitcode.com/gh_mirrors/gb/gbrain点击查看免费下载本指南基于 gbrain 仓库 plugin/skills/concept-synthesis/SKILL.md 展开讲解如何用五阶段流水线把 ingestion 管道signal-detector、idea-ingest、voice-note-ingest日积月累产生的大量原始概念 stub去重、打分、分层、综合、聚类最终产出 T1 Canon → T4 Riff 四层分级的知识地图并配一套可逆的 Phase 5 精选淘汰cull机制。读完你将掌握Jaccard/语义去重与合并时间线的具体做法、六轴评分 rubric 的加权规则与硬性门槛、merge-with-backlinks 的可逆合并管线以及如何在 gbrain CLIquery/search/get/put/delete/restore/revert/history上落地整套流程。这个技能解决什么问题gbrain 的多个摄取技能会把用户提到的每一个想法都建成一个概念页面skills/signal-detector/SKILL.md —— 从文本渠道生成原始概念 stub它区分用户原创思考 →originals/与引用的世界概念 →concepts/并强调用用户原话捕获skills/voice-note-ingest/SKILL.md —— 音频渠道同理skills/idea-ingest/SKILL.md —— 链接/文章渠道同理。数月之后concepts/下会出现数千个 stub 页面其中大量重复或近似重复时间线重复——同一个来源在多个概念页里反复出现没有综合——只有用户在某个日期提过 X没有思想演进没有分层——所有概念平铺无轻重缓急没有聚类——相关想法彼此没有链接。concept-synthesis 的任务就是把这份原材料变成一份策展过的知识指纹curated intellectual fingerprint。它的核心承诺是Phases 1–4 只做向上合并永不删除Phase 5 才是精选淘汰且每一步破坏性操作都可逆。五阶段架构总览技能本体是 Markdown 形式的 Agent 指令Agent 调用 gbrain 既有操作 LLM 多轮完成流水线Phase 1: Dedup merge确定性 N stubs → ~N/4 个 canonical concepts ├── Jaccard 去重标题 首段的词重叠度 ├── 子串去重founder mode vs founder mode vs manager mode ├── 语义去重LLM 判断这是不是同一个想法 └── 把重复页的时间线 别名合并进 canonical 页 Phase 2: Score tier确定性 启发式 每个 canonical concept → 打分并分级 ├── Frequency引用该概念的独立来源数 ├── Timespan首次提及 → 末次提及的天数 ├── Breadth出现的不同月份数 ├── Engagement概念来源的平均互动量若有 └── Tier: T1 Canon | T2 Developing | T3 Speculative | T4 Riff Phase 3: SynthesizeLLM仅 T1T2 T1 T2 → 富综合 ├── Evolution narrative想法如何随时间变得锋利 ├── Best articulation互动最高或最精确的原话引用 ├── Related concepts到其他概念的交叉链接 ├── Context想法诞生/演进时正在发生什么 └── Counter-positions这个想法反对什么 Phase 4: Cluster mapLLM 全部分层概念 → 知识集群 ├── 把相关概念归入领域LLM 自动命名 ├── 生成集群摘要页 ├── 构建主 concepts/README.md 完整地图 └── 识别思想谱系概念 A → 演化为概念 B Phase 5: Curation cullrubric 可逆合并 每个概念 → 硬性判定: ELITE | KEEP | MERGE/REWRITE | DELETE ├── 六轴 rubricsubstance 权重 2xpackaging 权重 1x 最低 substance 门槛 ├── Grounding 标签VERIFIED / OPINION / NEEDS_SOURCE / UNSAFE ├── 集群预算 声誉风险门 ├── 带 backlinks 合并进集群 canonical完全可逆 └── merge_count / independent_sources → 涌现式层级提升Phase 1 的合并预估是N stubs → 约 N/4 个 canonical concepts这是对去重收益的经验估算四分之三的 stub 会在合并后消失但它们的信号时间线、别名、来源会被保留而不是被丢弃。调用方式Agent 如何执行技能本身是 Agent 指令不提供独立二进制。执行时的标准流程# 1. 列出全部概念页 gbrain query type:concept --limit 10000 --json # 2. Phase 1 去重 —— Agent 本地应用 Jaccard 子串 # 再用 LLM 识别语义重复。 # 3. Phase 2 分级 —— Agent 依据 frequency / timespan / breadth # 给每个 canonical 概念打分并把 tier 写进 frontmatter。 # 4. Phase 3 综合 —— 对每个 T1/T2Agent 读取时间线 # 关联来源页通过 put_page 把综合段落写回概念页。 # 5. Phase 4 聚类 —— Agent 读取分层后的概念列表 # 写出 concepts/README.md 完整知识地图。这些命令与 gbrain CLI 的实际实现一致query是核心检索命令见 src/cli.ts 中op.name query的分支处理search、get、put、delete、restore、revert、history共同构成页面读写与版本恢复的完整闭环restore同时出现在 sources 子命令与备份恢复路径中见 src/commands/backup.ts。值得一提的检索细节gbrain query支持salience重要度基于emotional_weight与活跃 takes与recency新鲜度按前缀衰减concepts/、originals/等前缀是 evergreen 不衰减两个正交轴未显式传参时会用正则启发式自动判定。概念综合阶段检索相关上下文时可按需显式传salience/recency详见 skills/conventions/salience-and-recency.md。输出格式一综合后的概念页T1 Canon —— 完整综合--- title: concept name type: concept tier: 1 tier_label: Canon mention_count: 18 distinct_months: 8 first_mention: YYYY-MM-DD last_mention: YYYY-MM-DD composite_score: 78.4 aliases: [alternate phrasing 1, alternate phrasing 2] related: [sibling-concept-1, sibling-concept-2] --- # concept name **Tier 1 — Canon** | 18 mentions across 8 months ## Synthesis [2-4 段叙事想法如何演进、在用户世界观中意味着什么、为何重要。第三人称分析性语气。] ## Best Articulation 来自来源的原话引用——这个想法最精确或互动最高的表达。 — Date ## Evolution | Period | Expression | Signal | |--------|-----------|--------| | YYYY-MM | 首次表达 | 首次使用——愿景框架 | | YYYY-MM | 变得锋利 | 反模式浮现 | | YYYY-MM | 巅峰形态 | 最干净的表达 | ## Related Concepts - sibling concept — 关系描述 - sibling concept — 关系描述 ## Timeline [完整去重后的时间线条目、引文、来源链接]要点拆解frontmatter 是机器可读的分层依据tier数值tier_label人类可读双字段mention_count/distinct_months/first_mention/last_mention是 Phase 2 打分的直接落盘composite_score是加权综合分aliases保存去重时吸收的别名供搜索命中related是 Phase 3 的交叉链接。## Best Articulation必须是逐字引用而非转述。这与 skills/conventions/quality.md 的引用铁律一脉相承每个事实都要带[Source: ...]行内引用且引用优先级最高的是用户直接陈述Users direct statements (highest authority)。## Evolution表格是思想演进的证据载体每一行都必须能在既有 brain 页面上验证绝不允许幻觉日期或引文。T3 / T4 —— 只保留 stub不做 LLM 综合--- title: concept name type: concept tier: 4 tier_label: Riff mention_count: 1 --- # concept name **Tier 4 — Riff** | 1 mention Quote from the source — Date这是预算纪律的落点T3/T4 只保留原始引文 层级标记不消耗 API 预算做综合。只有 T1/T2 才值得 LLM 综合——这正是反模式清单里对 T3/T4 跑综合 浪费 API 预算的正面对照。输出格式二集群地图 concepts/README.md# Intellectual Universe ## Canon (T1) — N concepts The permanent intellectual fingerprint. Ideas that recur across years. ### [Cluster Name] - concept-slug — one-line characterization - ... ### [Other Cluster] - ... ## Developing (T2) — N concepts Sharpening. Might become canon. ## Speculative (T3) — N concepts Testing in public. ## Stats - Total concepts: N - T1 Canon: N - T2 Developing: N - T3 Speculative: N - T4 Riff: N - Earliest source: YYYY-MM-DD - Latest source: YYYY-MM-DD集群地图是全流程的对外门面## Stats区块给出全语料的分层快照Earliest/Latest source帮助判断语料的时间跨度。集群命名规则见下文反模式——Generic cluster names (Various Topics) 是明令禁止的反模式如果你无法给集群命名说明这个集群不是真实的。Phase 5Curation cull —— keep/delete/merge 评分细则Phases 1–4 只向上合并、永不删除。数月之后空洞的 stub 会稀释真正在复利累积的概念。Phase 5 就是清理给每个概念一个硬性判定按节奏cadence或按需运行且每一步破坏性操作都可逆。运行前务必遵循 skills/conventions/test-before-bulk.md先清理 3–5 个集群做试点读真实输出确认无误后再跑全量。该约定文档记录了渐进式批量纪律10 → 100 → 500 → full 四级拉升每轮都要做 count-before/count-after 校验、2% 错误率上限、随机抽检正是为 Phase 5 这类可能写出上百页的批量操作准备的。核心问题如果用户两年后冷启动翻到这个概念它会让一个想法更锋利、或播下一颗新种子——还是会被当作填充物划过划过Scroll-past DELETE。六轴评分每轴 1–5 分三个substance实质轴权重2x三个packaging/fit包装与适配轴权重1x。实质扛起概念包装赢得表面积。SUBSTANCE2x 权重轴135Insight tension—— 承载真正的智力负荷机制、非显而易见的因果、反转、隐藏成本陈词滥调创业很难有特定视角的熟悉想法可复用的具名机制Originality surprise—— 反转预期的全新框架而非人人会写的俗套幸运饼干式格言自律胜过动机透过用户视角的已知想法感觉新铸且可移植的框架Specificity completeness—— 自包含的主张/机制/区分有具体细节而非缺少上下文才能理解的碎片含糊或残缺完整但普通具体、有证据、完全自足PACKAGING FIT1x 权重轴135Voltage wit—— 语言中的电荷锐利转折、压缩、落地的一句平淡 / 教科书式干净可引用、有爆发力Representative—— 听起来像用户或连接到用户已记录的世界观任何账号都写得出来与用户视角兼容不折不扣的用户指纹Powerful legible—— 可用的弹药文章段落、演讲金句、会议框架AND 能传递用户到底是谁惰性琐事稍加打磨可用可直接部署 让别人更懂用户评分 → 判定加权分 (Insight Originality Specificity) × 2 (Voltage Representative Powerful) × 1。满分 45换算为百分比。加权 %判定必须同时满足的门槛≥85%ELITE—— 保留 标记复用无任何轴 3至少两个 5 分且至少一个落在 SUBSTANCE 轴上75–84%KEEP(Insight ≥ 4 或 Originality ≥ 4) 且 Specificity ≥ 3 且 (Representative ≥ 3 或 Powerful ≥ 4)55–74%MERGE/REWRITE 或弱保留好想法配差身体 → 并入集群 canonical 或重写为自包含。仅当出处罕见或填补覆盖空白时按原样保留否则 DELETE。55%DELETE—最低 substance 门槛覆盖百分比只要 Insight 3 或 Originality 3概念永远不能是 KEEP 或 ELITE。风格不能为空洞的想法买单。MERGE/REWRITE 是真实的第三种判定不是托词。许多 stub 是活跃的想法被困在虚弱的身体里——把它们并入集群 canonical 或重写为独立页。使用条件Insight ≥ 3 但 Specificity 或 Voltage 拖低了分数。硬性 DELETE 触发命中任一即删无论分数幸运饼干式重述Fortune-cookie restatement——真实但没说任何贺卡之外的东西空话无机制。碎片Fragment——依赖不可得的上下文不自包含除非出处罕见且即便如此也仅在可理解 有用时保留。乱码提取Mangled extraction——转录乱码、句中截断、语无伦次或把 chunk 标题伪装成概念。离题琐事Off-mission trivia——准确但与你构建、相信或可能使用的任何东西都无关。集群内重复Duplicate within cluster——通不过下述操作性重复测试。无依据的事实断言Unsupported factual claim——错误或未注明来源却被当作事实陈述的事实/历史/因果断言见 grounding 标签。软化或删除。Grounding 标签仅限事实型概念——贴标签而非只扣分任何事实、历史、科学或因果主张都要过一遍真值核查并在 frontmatter 中打上grounding:标签VERIFIED—— 准确 有来源 → 可保留并部署。OPINION—— 明确框定为用户的观点/论点 → 没问题。NEEDS_SOURCE—— 看似合理但以事实口吻未注明来源 → 仅当改写为观点/主张后保留。UNSAFE—— 错误或犀利但为假 → DELETE 或软化。不要存储自信的虚假陈述——一旦部署它们只会让别人更不理解用户。引用规范遵循 skills/conventions/quality.md其Source precedence把用户直接陈述列为最高权威冲突时note the contradiction with both citations而不是悄悄二选一。声誉风险门Reputational-risk gate一个犀利但可能误代表用户的概念——让用户听起来残忍、轻视他人、或持有一个他们并不持有的立场——是负债不是弹药。即使 Voltage 高分也要标记为重写或删除。Powerful 意味着使用后无反弹。集群预算规模化后的陈词滥调问题当大量概念来自同一来源或共享同一想法时评估集合而非逐一评估。每个语义集群的默认预算1 个 canonical 概念机制最锋利的陈述——永远保留。1–2 个仅当各自贡献了不同的机制、具体例子、不同的情绪调性、新受众或用户独有的措辞。超过 3 个仅当与进行中的项目绑定。集群内其余一切 → MERGE优先见下或 DELETE。四十个同一主题的近似 stub → 一个 canonical 机制概念可能再加一句好句子。其余向上合并。操作性重复测试不要凭肉眼判断% 重叠。把候选与集群内最佳既有概念对比问它是否新增了机制、例子、情绪调性、受众或用户专属措辞没有 → MERGE并入并保留信号或 DELETE。有 → 它新增的东西就是保留它的理由。硬性 KEEP 覆盖挽救低分——但有底线每个覆盖仅当概念可理解且潜在有用时生效独有声音Singular voice——捕捉到只有用户会说的话。声音胜过打磨但声音不能胜过连贯。对进行中项目承重Load-bearing for an active project——直接支撑已知论点或进行中的工作。罕见出处Rare provenance——无法再生的真实引文/时刻一次会议、用户自己的笔记且携带可恢复的意义。没有内容的关于那个 AI 东西的精彩观点不符合条件。Merge-with-backlinks可逆 —— 什么都不会被销毁对冗余集群清理是反向的不要删尾把尾部向上合并进 canonical 头部让合并账本merge ledger成为显著性salience指标。一个想法被独立地重新推导 N 次不是膨胀——是语料在 N 个不同语境里标记这个很重要。删除重复会扔掉这个信号合并则捕获它。每次合并都会在 canonical 上长出三个 frontmatter 字段 一个正文区块merge_countint——吸收的页面原始数量含同源重复提取。independent_sourcesint——集群提取自的不同来源数。这才是真正的显著性指标——当单一来源被反复重新提取时原始 merge_count 会虚高independent_sources 正是解药。backlinks{source, angle, date}列表——每个被吸收页的来源 它带来的特定角度。所有框架都存活只是不再是独立的顶层页面。## Facets正文——canonical 机制置顶然后每个被吸收页一行as seen in {source}: {angle}。概念变成多角度的而不是冗余的。合并质量门拒绝不完整合并仅当 (a)## Facets区块为每个被吸收页各有一行来源 特定角度且 (b) 每条backlinks都有 source angle date 时合并才会写入。空 facets 或悬空条目 拒绝合并并标记该集群人工复核。不允许半吊子合并。区分度守卫是硬性否决HARD VETO不是建议。两个看起来像重复的概念除非 LLM 评审肯定性地确认它们陈述的是同一机制否则不合并。默认是不合并评审必须挣得这次合并且其 yes/no 理由按集群记录。不同的机制/例子/调性 → 各自保留 canonical。相似性提出候选判断力定夺。寻找合并候选 —— 用定性波段不用数值截断。不要硬编码相似度阈值gbrain search返回的是混合RRF 融合分数不是原始余弦相似度任何钉死的数字都会随语料与搜索模式漂移而失效。定性工作法搜索每个概念的标题 首段当另一个概念出现在结果列表顶部、且与其余结果有明显分数差距时把它当作合并候选。共享词汇但不共享机制的概念会落在列表中部——那正是区分度守卫发挥作用的地带。在全量执行前先在自己语料的分布上做校准。合并机制渐进式、完全可逆# 0. 盘点要清理的分层 gbrain query type:concept --limit 10000 --json # 1. 探测合并候选互相出现在列表顶部 gbrain search concept title first paragraph --limit 10 # 2. 在触碰之前把被吸收页原样归档到 _merged/ 下 # 在其 frontmatter 中加 merged_into: canonical-slug。 # _merged/ 树就是撤销按钮。 gbrain get concepts/absorbed-stub gbrain put concepts/_merged/cluster-name/absorbed-stub # 3. 生长 canonical 头部merge_count、independent_sources、 # backlinks 和 ## Facets 区块 gbrain put concepts/canonical-slug # 4. 软删除被吸收的原页在 purge 前可恢复 gbrain delete concepts/absorbed-stub # 撤销路径gbrain restore slugpurge 窗口内、 # _merged/ 副本purge 后仍存活、以及每页版本历史 gbrain history concepts/canonical-slug gbrain revert concepts/canonical-slug version_id增量提交。清理期间没有任何东西被硬删除_merged/树 软删除 页面历史让每一步都可逆。合并账本 → 涌现式层级提升把independent_sources喂回 Phase 2 的 Frequency 轴。当 canonical 概念的independent_sources越过语料直方图的自然间隙——看分布别硬编码整数——它就是层级提升候选T4→T3、T3→T2、T2→T1 复核。没有体积上限一个不断吸收合并的概念应该长得肥胖。层级边界因此是涌现的而非手绘的——语料在告诉你一个反复出现的思想已经挣得了自己的层级。质量门去重质量不应存在两个概念页是换种说法的同一个想法。别名保留在 frontmatter 中供搜索命中。运行gbrain query type:concept抽查数量下降。层级质量T1 应该让人感觉对那确实是我反复使用的框架之一——可识别、反复出现、锋利。T2 应该让人感觉我在打磨这个它越来越清晰了。无概念应处于 T1 却 4 个月跨度或 6 次提及。无概念应处于 T4 却 3 个月跨度。综合质量捕捉演进而非重复。使用逐字引文而非转述对应 skills/conventions/quality.md 的引用铁律。链接到相关概念Markdown 链接非 wiki 链接。不幻觉来源或日期。清理质量当概念持有集群中唯一的机制陈述时不得删除它——canonical 必须在每次清理中存活。每次合并都通过合并质量门## Facets已填充 backlinks条目完整。无半吊子合并。区分度守卫的判定按集群记录任何合并写入前评审必须大声说过 yes。没有 UNSAFE 标签的主张以事实口吻存活。每个被吸收页在被软删除前都有逐字的_merged/副本。Cron 集成按节奏跑而非每次信号都跑这是重活。按节奏运行而非跟随每个信号在大批摄取批次完成后signal-detector 爆发、archive crawler 运行等。每周 cron做新晋升 T1/T2 概念的增量综合。语料显著漂移时手动触发全量重新综合。Phase 5 清理比综合跑得少——月度或当一次大摄取波明显推高 stub 数量时。永远先 test-before-bulk先试点 3–5 个集群见 skills/conventions/test-before-bulk.md。反模式清单❌ 对 T3/T4 跑综合——浪费 API 预算在可能永远不会变得锋利的思想上。❌ 幻觉引文或日期。时间线必须能在既有 brain 页面上验证。❌ 通用集群名Various Topics。如果你无法命名集群集群就不是真的。❌ 在没有新来源素材的情况下重复综合已综合的 T1。尊重幂等性。❌ 为合并候选硬编码数值相似度截断。搜索分数是语料与模式相对的用定性波段让区分度守卫定夺。❌ 仅凭相似度合并。共享词汇 ≠ 共享机制区分度守卫是硬性否决不是建议。❌ 删除冗余概念而非向上合并。删除会扔掉驱动层级提升的频率信号。❌ 因为措辞漂亮就保留空洞概念。最低 substance 门槛正是为此存在。❌ 清理期间硬删除。归档到_merged/ 软删除让每条撤销路径存活。❌ 未先做 3–5 个集群试点就全量清理见 skills/conventions/test-before-bulk.md。归档位置与关联技能输出文件按主主题规则归档在concepts/下遵循 skills/_brain-filing-rules.mdReusable framework/thesis →concepts/—— 它是心智模型sources/仅用于原始数据与批量导入回链铁律要求每次提及带 brain 页的实体都建立双向回链。合成输出是 sui generis 例外仅限一对一来源 特定读者的个人化产物才用media/format/前缀路径。本技能与摄取侧的三个上游技能组成完整闭环skills/signal-detector/SKILL.md —— 文本渠道创建原始概念 stubskills/voice-note-ingest/SKILL.md —— 音频渠道skills/idea-ingest/SKILL.md —— 链接/文章渠道。契约Contract与一致性技能 frontmatter 声明mutating: true、writes_pages: true、writes_to: [concepts/]并保证路由匹配 frontmatter 中的 canonical 触发器如 concept synthesis、canon vs riff、cull my concepts输出写入writes_to:列出的目录适用时遵循引用的约定quality.md、brain-first.md、_brain-filing-rules.md隐私契约保持无真实姓名、无 fork 专属文件系统路径字面量、无上游 fork 引用。全文的契约细节在正文各节已完整展开frontmatter 的triggers列表含 synthesize my concepts、find patterns across my notes、trace idea evolution、which concepts to keep 等为 Agent 路由提供入口。技能输出形状在正文Output 部分内联说明该契约由test/skills-conformance.test.ts一致性测试校验。赞分享人工智能RAGAgent 记忆MCP 服务知识管理【免费下载链接】gbrainGarrys Opinionated OpenClaw/Hermes Agent Brain项目地址https://gitcode.com/gh_mirrors/gb/gbrain点击查看免费下载相关推荐gbrain concept-synthesis把数千条概念存根提炼成分层知识图谱的完整实战指南gbrain concept synthesis把数千条概念存根提炼成分层知识图谱的完整实战指南 本文围绕 gbrain 插件变体 gbrain coding人工智能RAGAgent 记忆MCP 服务知识管理gbrain concept-synthesis 技能实战指南从原始概念草稿到分级知识地图与可逆精选修剪gbrain concept synthesis 技能实战指南从原始概念草稿到分级知识地图与可逆精选修剪 本指南以仓库中的 skills/concept sy人工智能RAGAgent 记忆MCP 服务知识管理大麦抢票工具实测Selenium 与 Appium 双端自动化购票上手指南大麦抢票工具实测Selenium 与 Appium 双端自动化购票上手指南 上一场演出开票我手已经悬在立即购买上方等选完城市、场次、票价页面已经翻成GUI 自动化RPA创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表