<?xml version="1.0" encoding="utf-8"?>
<rss version="2.0" xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/">
    <channel>
        <title>Memex Server Blog</title>
        <link>https://memex-server.memect.cn/docs-site/blog</link>
        <description>Memex Server Blog</description>
        <lastBuildDate>Mon, 06 Jul 2026 00:00:00 GMT</lastBuildDate>
        <docs>https://validator.w3.org/feed/docs/rss2.html</docs>
        <generator>https://github.com/jpmonette/feed</generator>
        <language>zh-cn</language>
        <item>
            <title><![CDATA[学习材料：从传统知识工程到可进化知识库]]></title>
            <link>https://memex-server.memect.cn/docs-site/blog/knowledge-engineering</link>
            <guid>https://memex-server.memect.cn/docs-site/blog/knowledge-engineering</guid>
            <pubDate>Mon, 06 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[这是一份面向新成员的学习材料，介绍 Memex 背后的核心方法论：可进化知识库（Agentic Ontology）。]]></description>
            <content:encoded><![CDATA[<p>这是一份面向新成员的学习材料，介绍 Memex 背后的核心方法论：<strong>可进化知识库（Agentic Ontology）</strong>。
内容提炼自鲍捷《可进化知识库构造：从 Ontology 101 到 Agentic Ontology》（2026-04-30），
该文总结了史记知识库、三体 Wiki、红楼梦 Wiki 三个真实项目的工程经验。</p>
<h2 class="anchor anchorWithStickyNavbar_LWe7" id="一什么是知识工程它的范式为什么过时了">一、什么是知识工程，它的范式为什么过时了<a href="https://memex-server.memect.cn/docs-site/blog/knowledge-engineering#%E4%B8%80%E4%BB%80%E4%B9%88%E6%98%AF%E7%9F%A5%E8%AF%86%E5%B7%A5%E7%A8%8B%E5%AE%83%E7%9A%84%E8%8C%83%E5%BC%8F%E4%B8%BA%E4%BB%80%E4%B9%88%E8%BF%87%E6%97%B6%E4%BA%86" class="hash-link" aria-label="一、什么是知识工程，它的范式为什么过时了的直接链接" title="一、什么是知识工程，它的范式为什么过时了的直接链接">​</a></h2>
<p>知识工程（Knowledge Engineering）是构建知识库、知识图谱、本体（Ontology）的工程学科。
2001 年 Noy &amp; McGuinness 的经典教程 <em>Ontology 101</em> 奠定了传统范式的七个步骤：确定领域范围 → 复用已有本体 → 列举关键词 → 定义类层次 → 定义属性 → 定义约束 → 创建实例。</p>
<p>它的隐含假设是：<strong>领域专家可以在执行前设计出接近完整的 schema</strong>。
对小而清晰的领域（如葡萄酒分类）成立；对大而复杂的领域（如 57 万字的《史记》）会失效：</p>
<ul>
<li>执行前无法预知文本里究竟有多少种实体类型</li>
<li>schema 定稿后，执行中不断冒出边界案例，被迫返工</li>
<li>专家精力耗尽在前期设计，而不是实际的知识提取</li>
</ul>
<p>2026 年的新条件是：大语言模型能处理复杂语义，AI Agent 能自主执行迭代任务。
<strong>知识工程的瓶颈从"执行速度"转移到了"反思质量"</strong>——这催生了新范式。</p>
<h2 class="anchor anchorWithStickyNavbar_LWe7" id="二三个项目一条方法论演化链">二、三个项目：一条方法论演化链<a href="https://memex-server.memect.cn/docs-site/blog/knowledge-engineering#%E4%BA%8C%E4%B8%89%E4%B8%AA%E9%A1%B9%E7%9B%AE%E4%B8%80%E6%9D%A1%E6%96%B9%E6%B3%95%E8%AE%BA%E6%BC%94%E5%8C%96%E9%93%BE" class="hash-link" aria-label="二、三个项目：一条方法论演化链的直接链接" title="二、三个项目：一条方法论演化链的直接链接">​</a></h2>
<table><thead><tr><th>阶段</th><th>项目</th><th>规模</th><th>方法论贡献</th></tr></thead><tbody><tr><td>探索期</td><td>史记知识库</td><td>20,408 页 / 15,331 实体 / 22 类</td><td>奠基：JIT 本体演进、反思收敛、SKILL 系统、Harness 约束、PN 系统</td></tr><tr><td>提炼期</td><td>三体 Wiki</td><td>1,325 页 / 10 类</td><td>精炼：Butler 永续 loop、质数周期反思、多实例并发</td></tr><tr><td>成熟期</td><td>红楼梦 Wiki</td><td>2,510 页 / 26 类</td><td>验证：语义 wikilink、<strong>2 天完成整库</strong></td></tr></tbody></table>
<p>注意最后一行：当 SKILL 文档、Butler 框架、Harness 约束都成熟后，
启动一个新知识库（2,510 词条、26 种类型）只花了<strong>两天</strong>。这就是方法论积累的复利。</p>
<h2 class="anchor anchorWithStickyNavbar_LWe7" id="三六个核心特征">三、六个核心特征<a href="https://memex-server.memect.cn/docs-site/blog/knowledge-engineering#%E4%B8%89%E5%85%AD%E4%B8%AA%E6%A0%B8%E5%BF%83%E7%89%B9%E5%BE%81" class="hash-link" aria-label="三、六个核心特征的直接链接" title="三、六个核心特征的直接链接">​</a></h2>
<h3 class="anchor anchorWithStickyNavbar_LWe7" id="1-自底向上的本体涌现">1. 自底向上的本体涌现<a href="https://memex-server.memect.cn/docs-site/blog/knowledge-engineering#1-%E8%87%AA%E5%BA%95%E5%90%91%E4%B8%8A%E7%9A%84%E6%9C%AC%E4%BD%93%E6%B6%8C%E7%8E%B0" class="hash-link" aria-label="1. 自底向上的本体涌现的直接链接" title="1. 自底向上的本体涌现的直接链接">​</a></h3>
<p>本体不是专家预先设计的蓝图，而是从文本中提取、验证、迭代后<strong>涌现</strong>出来的结构。</p>
<p>对比两种路径：</p>
<ul>
<li><strong>Big Bang 设计</strong>（传统）：4 周设计完整 schema → 执行时频繁不匹配 → 大规模返工，总计约 12 周，质量不确定</li>
<li><strong>JIT 演进</strong>（新范式）：第 1 周用 4 类最小本体标注 5 章拿到可用版本，之后每周扩类、扩覆盖、反思，4 周达到 92% 质量</li>
</ul>
<p>史记的 22 类实体没有一类是一开始"设计"出来的——都是处理具体文本时发现有必要区分才引入的。
例如"器物"类是在处理本纪时才出现的，最终占了 4.6%（926 页）。</p>
<h3 class="anchor anchorWithStickyNavbar_LWe7" id="2-多层次自动化反思循环">2. 多层次自动化反思循环<a href="https://memex-server.memect.cn/docs-site/blog/knowledge-engineering#2-%E5%A4%9A%E5%B1%82%E6%AC%A1%E8%87%AA%E5%8A%A8%E5%8C%96%E5%8F%8D%E6%80%9D%E5%BE%AA%E7%8E%AF" class="hash-link" aria-label="2. 多层次自动化反思循环的直接链接" title="2. 多层次自动化反思循环的直接链接">​</a></h3>
<p>质量改进不靠人工逐条审查，靠 Agent 周期性反思。五层架构：</p>
<table><thead><tr><th>层级</th><th>触发</th><th>执行者</th><th>检查什么</th></tr></thead><tbody><tr><td>L1 Lint</td><td>每次写入</td><td>脚本</td><td>单页格式</td></tr><tr><td>L2 Validate</td><td>每批次</td><td>脚本</td><td>跨页一致性</td></tr><tr><td>L3 Q-Check</td><td>每轮</td><td>Butler 自评</td><td>任务质量评级</td></tr><tr><td>L4 反思</td><td>每 29 轮</td><td>Agent + 规律库</td><td>系统性错误模式</td></tr><tr><td>L5 人工抽查</td><td>不定期</td><td>人工</td><td>5–10% 随机抽样</td></tr></tbody></table>
<p>反思是<strong>收敛</strong>的。史记对 3,198 个事件做了 5 轮年代推断反思：准确率从 60% → 80% → 88% → 92% → 95% → 97%，
每轮修正数递减。收敛判据：每轮修正数降到上一轮 1/3 以下且绝对值 &lt; 50。</p>
<p>反思的发现不会被丢弃，而是沉淀进<strong>规律库</strong>（史记积累了 134 条），每条规律都带"检测条件 + 修正动作"，
下一轮直接用规律库扫描全库。这相当于代码工程里的回归测试用例库。</p>
<h3 class="anchor anchorWithStickyNavbar_LWe7" id="3-schema-的语义演化路径">3. Schema 的语义演化路径<a href="https://memex-server.memect.cn/docs-site/blog/knowledge-engineering#3-schema-%E7%9A%84%E8%AF%AD%E4%B9%89%E6%BC%94%E5%8C%96%E8%B7%AF%E5%BE%84" class="hash-link" aria-label="3. Schema 的语义演化路径的直接链接" title="3. Schema 的语义演化路径的直接链接">​</a></h3>
<p>知识表示分三代进化：</p>
<ol>
<li><strong>纯导航链接</strong>：<code>[[贾宝玉]] 是 [[荣国府]] 的公子</code> —— 只能人工浏览</li>
<li><strong>语义 Wikilink</strong>：<code>[[金玉良缘::薛宝钗]]</code> —— 关系类型编码进链接，支持关系查询和图谱推理</li>
<li><strong>动态查询块</strong>：页面里嵌入 <code>::: query</code> 块，运行时生成表格 —— schema 变成可编程的数据接口</li>
</ol>
<p>Frontmatter 同样从静态元数据 → 自动计算的质量字段（<code>quality_score</code>）→ 结构化多维属性（带 surface/canonical/source 的别名结构）。</p>
<h3 class="anchor anchorWithStickyNavbar_LWe7" id="4-段落编号pn知识的坐标系">4. 段落编号（PN）：知识的坐标系<a href="https://memex-server.memect.cn/docs-site/blog/knowledge-engineering#4-%E6%AE%B5%E8%90%BD%E7%BC%96%E5%8F%B7pn%E7%9F%A5%E8%AF%86%E7%9A%84%E5%9D%90%E6%A0%87%E7%B3%BB" class="hash-link" aria-label="4. 段落编号（PN）：知识的坐标系的直接链接" title="4. 段落编号（PN）：知识的坐标系的直接链接">​</a></h3>
<p>给原文每个段落分配全局唯一编号（如 <code>003-042</code>），把"引用原文"从模糊的章节定位变成精确坐标。这带来三种能力：</p>
<ul>
<li><strong>精确引用</strong>：两个词条引用同一 PN，系统可自动关联</li>
<li><strong>覆盖率统计</strong>：全库覆盖率变成可精确计算的指标，Butler 据此优先处理盲区</li>
<li><strong>矛盾检测</strong>：同一 PN 被两个词条给出不同解读时，可自动标记</li>
</ul>
<p>一句话记忆：<strong>没有 PN 就没有精确引用，没有精确引用就没有可验证的质量标准。</strong></p>
<h3 class="anchor anchorWithStickyNavbar_LWe7" id="5-harness-驱动的硬约束">5. Harness 驱动的硬约束<a href="https://memex-server.memect.cn/docs-site/blog/knowledge-engineering#5-harness-%E9%A9%B1%E5%8A%A8%E7%9A%84%E7%A1%AC%E7%BA%A6%E6%9D%9F" class="hash-link" aria-label="5. Harness 驱动的硬约束的直接链接" title="5. Harness 驱动的硬约束的直接链接">​</a></h3>
<p>一个血泪教训：2026-04-24，史记 Butler 批量导入引文时，<strong>覆盖了 136 个页面的手写引文节</strong>——
尽管 CLAUDE.md 里明确写着"不得覆盖"。结论：</p>
<blockquote>
<p>prompt 里的规则是<strong>软约束</strong>，Agent 上下文长了就会遗忘；
Harness Hook 里的检查脚本是<strong>硬约束</strong>，每次工具调用必然触发，无法遗忘。</p>
</blockquote>
<p>具体做法：PreToolUse Hook 在每次写入前跑校验脚本（保护节检测、引号规范、单次 diff ≤ 20 行、frontmatter 必填字段），
不通过就阻止写入并把原因回传给 Agent；PostToolUse Hook 在写入后记录细粒度修订历史（独立于 git 的第二层追踪）。</p>
<p>"单次 diff ≤ 20 行"的价值是控制爆炸半径：即使 Agent 出错，损害也是有界、可回滚的。</p>
<h3 class="anchor anchorWithStickyNavbar_LWe7" id="6-方法论的-skill-化与自举">6. 方法论的 SKILL 化与自举<a href="https://memex-server.memect.cn/docs-site/blog/knowledge-engineering#6-%E6%96%B9%E6%B3%95%E8%AE%BA%E7%9A%84-skill-%E5%8C%96%E4%B8%8E%E8%87%AA%E4%B8%BE" class="hash-link" aria-label="6. 方法论的 SKILL 化与自举的直接链接" title="6. 方法论的 SKILL 化与自举的直接链接">​</a></h3>
<p>把操作方法提炼为 Markdown 格式的 SKILL 文档（史记积累了 14 个元技能 + 89 个管线技能）。为什么用文档而不是代码？</p>
<ul>
<li><strong>灵活</strong>：发现新错误模式，加一条规则即可，后续处理自动获益</li>
<li><strong>可读</strong>：领域研究者能直接阅读和验证方法论</li>
<li><strong>可迁移</strong>：元技能层可以直接用于《汉书》《资治通鉴》等新语料</li>
<li><strong>自举</strong>：知识工程本身可以用知识工程的方法改进</li>
</ul>
<p>其中"柳叶刀方法"定义了自动化优先级：**能用规则绝不用 LLM，能用代码绝不用人工，LLM 只处理规则覆盖不了的复杂语义，人工只兜底极端案例。**史记最终约 98% 的标注由规则或 LLM 自动完成。</p>
<p>成本数据：57.7 万字的史记完整处理约千元人民币；优化后每 10 万字降到百元级。
以此估算，二十六史（约 4,000 万字）全覆盖约 5–10 万元——从"方法论上不可能"变成"经济上可行"。</p>
<h2 class="anchor anchorWithStickyNavbar_LWe7" id="四一张表总结新旧范式">四、一张表总结新旧范式<a href="https://memex-server.memect.cn/docs-site/blog/knowledge-engineering#%E5%9B%9B%E4%B8%80%E5%BC%A0%E8%A1%A8%E6%80%BB%E7%BB%93%E6%96%B0%E6%97%A7%E8%8C%83%E5%BC%8F" class="hash-link" aria-label="四、一张表总结新旧范式的直接链接" title="四、一张表总结新旧范式的直接链接">​</a></h2>
<table><thead><tr><th>维度</th><th>传统知识工程（Ontology 101）</th><th>可进化知识库（Agentic Ontology）</th></tr></thead><tbody><tr><td>本体来源</td><td>专家预先设计</td><td>从文本自底向上涌现</td></tr><tr><td>质量改进</td><td>人工逐个审查</td><td>Agent 反思循环自动化</td></tr><tr><td>Schema 演化</td><td>变更成本高，大量返工</td><td>增量添加，向后兼容</td></tr><tr><td>数据安全</td><td>依靠人工操作规范</td><td>Harness 运行时强制执行</td></tr><tr><td>方法论传递</td><td>论文和文档（人阅读）</td><td>SKILL 文件（Agent 可执行）</td></tr><tr><td>规模瓶颈</td><td>专家时间</td><td>计算成本（随规模线性）</td></tr></tbody></table>
<p><strong>可进化知识库的完整定义</strong>：由 AI Agent 维护的知识系统，本体从原始文本自底向上涌现，
质量通过多层次自动化反思循环持续改进，操作受运行时安全约束保护，方法论以 SKILL 形式沉淀并可跨项目复用。</p>
<h2 class="anchor anchorWithStickyNavbar_LWe7" id="五动手清单如何启动一个可进化知识库">五、动手清单：如何启动一个可进化知识库<a href="https://memex-server.memect.cn/docs-site/blog/knowledge-engineering#%E4%BA%94%E5%8A%A8%E6%89%8B%E6%B8%85%E5%8D%95%E5%A6%82%E4%BD%95%E5%90%AF%E5%8A%A8%E4%B8%80%E4%B8%AA%E5%8F%AF%E8%BF%9B%E5%8C%96%E7%9F%A5%E8%AF%86%E5%BA%93" class="hash-link" aria-label="五、动手清单：如何启动一个可进化知识库的直接链接" title="五、动手清单：如何启动一个可进化知识库的直接链接">​</a></h2>
<ol>
<li><strong>Week 0</strong>：3–5 个最核心的实体类型（人、地、事几乎所有领域都需要），处理 5–10% 文本。不求完整，求"可以开始反思"</li>
<li><strong>Week 1–2</strong>：第一轮反思——哪些类型最频繁？哪些边界最模糊？有没有系统性错误？更新规则和 SKILL</li>
<li><strong>Week 3+</strong>：广度（覆盖更多文本）与深度（提升已有词条质量分级）并行，每 20–30 轮触发全局反思</li>
</ol>
<p>五条工程铁律：</p>
<ol>
<li><strong>尽早配置 Harness</strong>——在第一次 Agent 操作前，而不是第一次数据丢失后</li>
<li><strong>Frontmatter 第一，正文第二</strong>——结构化元数据更容易机器处理和质检</li>
<li><strong>为原文分配 PN 编号</strong></li>
<li><strong>量化一切</strong>——没有量化就没有收敛判断</li>
<li><strong>SKILL 是一等公民</strong>——方法论进化与数据进化同步</li>
</ol>
<h2 class="anchor anchorWithStickyNavbar_LWe7" id="延伸阅读">延伸阅读<a href="https://memex-server.memect.cn/docs-site/blog/knowledge-engineering#%E5%BB%B6%E4%BC%B8%E9%98%85%E8%AF%BB" class="hash-link" aria-label="延伸阅读的直接链接" title="延伸阅读的直接链接">​</a></h2>
<ul>
<li>Noy &amp; McGuinness (2001). <em>Ontology Development 101</em>. Stanford KSL-01-05.</li>
<li>鲍捷 (2026). <a href="https://baojie.github.io/shiji-kb" target="_blank" rel="noopener noreferrer">史记知识库</a> / <a href="https://baojie.github.io/three-body/" target="_blank" rel="noopener noreferrer">三体 Wiki</a> / <a href="https://baojie.github.io/honglou/" target="_blank" rel="noopener noreferrer">红楼梦 Wiki</a></li>
<li>原文全文见 memex 仓库 <code>ref/summary/可进化知识库构造.md</code></li>
</ul>
<blockquote>
<p>传统知识工程的难点是"如何设计完美的本体"；
可进化知识库的难点是"如何设计有效的反思循环"——以及让这个循环本身在项目间传递和进化。</p>
</blockquote>]]></content:encoded>
            <category>学习材料</category>
            <category>知识工程</category>
            <category>方法论</category>
        </item>
        <item>
            <title><![CDATA[Memex Server 正式开放]]></title>
            <link>https://memex-server.memect.cn/docs-site/blog/welcome</link>
            <guid>https://memex-server.memect.cn/docs-site/blog/welcome</guid>
            <pubDate>Fri, 03 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[经过数月的内部测试，Memex Server v0.2.x 正式对外开放。]]></description>
            <content:encoded><![CDATA[<p>经过数月的内部测试，<strong>Memex Server v0.2.x</strong> 正式对外开放。</p>
<p>Memex Server 是一个把书自动变成结构化知识库的 AI 编排服务——上传一本 epub/pdf/md/txt，
系统通过多阶段 Agent 流水线（egg → boot → grow → butler）自动生成可检索的 Wiki 站点。</p>
<h2 class="anchor anchorWithStickyNavbar_LWe7" id="主要能力">主要能力<a href="https://memex-server.memect.cn/docs-site/blog/welcome#%E4%B8%BB%E8%A6%81%E8%83%BD%E5%8A%9B" class="hash-link" aria-label="主要能力的直接链接" title="主要能力的直接链接">​</a></h2>
<ul>
<li><strong>四种接入方式</strong>：CLI、HTTP API、Web GUI、MCP，满足不同使用场景</li>
<li><strong>Butler 持续维护</strong>：生成完成后，管家在后台按轮次持续补全、提质词条</li>
<li><strong>多用户隔离</strong>：按用户目录分隔存储，admin/user 角色权限独立</li>
<li><strong>实时进度</strong>：SSE 订阅流，秒级推送阶段事件和 token 用量</li>
</ul>
<h2 class="anchor anchorWithStickyNavbar_LWe7" id="快速上手">快速上手<a href="https://memex-server.memect.cn/docs-site/blog/welcome#%E5%BF%AB%E9%80%9F%E4%B8%8A%E6%89%8B" class="hash-link" aria-label="快速上手的直接链接" title="快速上手的直接链接">​</a></h2>
<p>查看 <a href="https://memex-server.memect.cn/docs-site/quickstart">快速开始</a> 文档，5 分钟内跑起来。</p>
<p>有问题或建议，欢迎在 <a href="http://192.168.0.24/memex/memex-server" target="_blank" rel="noopener noreferrer">GitLab</a> 提 issue。</p>]]></content:encoded>
            <category>发布</category>
            <category>公告</category>
        </item>
    </channel>
</rss>