1 · Towards Agentic AI Governance:Agentic AI 治理的首次系统缺口评估
arXiv:2607.07612 · 2026-07 · 论文链接 ↗
一句话:对现有治理框架做逐条映射,指出「没有任何一套现成框架覆盖 Agentic AI 的独有风险面」,给出缺口清单而非又一套新标准。
🔰 通俗解释:现有 ISO 42001 / NIST AI RMF / EU AI Act 都是为人写好后再打补丁给 AI;这篇反过来:先拆解 Agentic AI 的独有能力(自主工具调用、长程规划、多系统写权限),再逐项问「现有框架哪一条管得住它」——结论是大部分管不住。
核心机制:
① 以新加坡 2026-01 发布的《Agentic AI 治理框架》为唯一参照基准
② 逐维度缺口映射:问责链(多 agent 谁背锅)、行为边界(工具权限)、人机协同点、审计粒度
③ 输出「缺口-建议」对照表而非新框架,避免标准通胀
核心机制:
① 以新加坡 2026-01 发布的《Agentic AI 治理框架》为唯一参照基准
② 逐维度缺口映射:问责链(多 agent 谁背锅)、行为边界(工具权限)、人机协同点、审计粒度
③ 输出「缺口-建议」对照表而非新框架,避免标准通胀
对 BOSS-OS 的关联
★★★★☆ 治理链「框架通胀 → 缺口审计」方法论拼图——与 NO.22 三框架统一分类学互补:那篇告诉你三大框架怎么统一读,这篇告诉你统一完之后还缺什么
直接可用于 BOSS-OS 的治理自查:把 DBEI-KOCIR-M 的门控/审计机制逐条对到缺口清单上,已覆盖的打勾、未覆盖的进 KL 清单。我们既有的门控与审计机制可作答卷素材(具体机制内部留痕,R6 自检通过后另行公开)。
⚡ 行动建议:短期:按缺口清单做一次内部自查(半天);把「已覆盖/未覆盖」结论记入治理文档。与 NO.22 治理链拼「缺口审计」拼图。
2 · Mem^p:把 Agent 的执行轨迹蒸馏成可复用程序记忆
arXiv:2508.06433 · 2026 · · 论文链接 ↗
一句话:Agent 跑完任务留下的轨迹不该只当日志——Mem^p 把成功轨迹蒸馏成两层程序记忆:细粒度逐步指令 + 高层级脚本,下次同类任务直接调用,少走弯路。
🔰 通俗解释:现有 agent 记忆多存「事实」(semantic)或「事件」(episodic),很少存「怎么干」(procedural)。Mem^p 补上这一层:
核心机制:
① **双通道蒸馏**:轨迹 →(a)细粒度 step-by-step 指令(可执行)(b)高层级 script(可复用的任务骨架)
② 检索时按任务相似度调用,指令层指导逐步操作、脚本层提供全局路线
③ 随经验积累持续精炼,旧脚本被新证据修正
关键数据:在多个 agent 基准上,程序记忆注入后成功率提升且步数下降——「干过一次的活,第二次更快更稳」。
核心机制:
① **双通道蒸馏**:轨迹 →(a)细粒度 step-by-step 指令(可执行)(b)高层级 script(可复用的任务骨架)
② 检索时按任务相似度调用,指令层指导逐步操作、脚本层提供全局路线
③ 随经验积累持续精炼,旧脚本被新证据修正
关键数据:在多个 agent 基准上,程序记忆注入后成功率提升且步数下降——「干过一次的活,第二次更快更稳」。
对 BOSS-OS 的关联
★★★★★ 记忆链「事实/事件记忆 → 程序记忆」拼图——直接对应小研的自动化:论文日报每次执行的检索-筛选-发布流程,就是可被蒸馏的程序记忆
对编队即战力:patent-mine、论文情报官、槽位切换演练,全都是「重复性多步流程」——把每次执行轨迹蒸馏成 script 存入员工仓,新会话 clone 仓即继承经验(资产随人走的记忆版)。
⚡ 行动建议:短期:在论文情报官流程试点——每期执行后蒸馏一条「脚本+指令」进 memory;三个月后对比新旧期执行步数与差错率。
3 · Memory in the Age of AI Agents:Agent 记忆研究全景图
arXiv:2512.13564 · 2026 · · 论文链接 ↗
一句话:一篇被引 101 次的记忆研究全景综述:划清 agent 记忆研究的问题域,把散落各处的记忆机制收进一张可导航的地图。
🔰 通俗解释:做 agent 记忆最大的痛是「每家叫法不同、机制散落各论文」——这篇的价值是划界与分类,让人不再重复发明。
核心机制:
① 明确 agent 记忆研究的问题域边界(什么算记忆问题、什么不算)
② 现有方法按操作对象与生命周期分类定位
③ 指出开放问题与评估缺口
关键数据:cited by 101,已成为该子领域引用锚点。
核心机制:
① 明确 agent 记忆研究的问题域边界(什么算记忆问题、什么不算)
② 现有方法按操作对象与生命周期分类定位
③ 指出开放问题与评估缺口
关键数据:cited by 101,已成为该子领域引用锚点。
对 BOSS-OS 的关联
★★★☆☆ 记忆链「地图层」——与 Mem^p(程序记忆机制)同读:一张地图 + 一个具体机制样本
作为编队记忆架构(对话桥/长期记忆/程序记忆)的对照检查表:我们已实现的层在地图哪里、空白层是哪些。
⚡ 行动建议:短期:用此图给编队记忆栈做一次层位标注;空白层进迭代候选池。
4 · KG-RAG:企业文档生态的智能体爬取与知识图谱化
arXiv:2604.14220 · 2026-04 · 论文链接 ↗
一句话:针对企业复杂文档生态,把 RAG 从「向量相似度检索」升级为「智能体爬取+知识图谱组织」——先爬结构、再查图谱,而不是拿 query 去硬碰非结构化文本。
🔰 通俗解释:企业 RAG 的痛点是文档之间有关联(引用、依赖、版本)而向量检索看不到关联。
核心机制:
① **Agentic crawling**:智能体自主决定爬取哪些文档、沿哪些引用链展开
② **知识图谱组织**:抽取实体与关系入图,检索时沿图遍历而非仅靠相似度
③ 与传统语义检索混合,弥补纯向量在多跳问题上的盲区
核心机制:
① **Agentic crawling**:智能体自主决定爬取哪些文档、沿哪些引用链展开
② **知识图谱组织**:抽取实体与关系入图,检索时沿图遍历而非仅靠相似度
③ 与传统语义检索混合,弥补纯向量在多跳问题上的盲区
对 BOSS-OS 的关联
★★★☆☆ 知识层「向量 RAG → 图谱 RAG」拼图——与 NO.22 DocuSearch(三信号混合 RAG)互补:那篇优化单次检索质量,这篇改变知识的组织方式
BOSS-OS 知识层(KB 1109 篇+)正是多关联文档生态——跨文档引用链(判例↔规范↔决策记录)用图谱组织后,跨仓溯源类问题(kb-first 高频场景)命中率预期提升。
⚡ 行动建议:中期:KB 知识层 PoC——选「判例库↔规范文档」子域试做图谱化,对比纯向量检索的跨文档溯源准确率。
5 · MAST:多智能体 LLM 系统为什么会失败——首个系统化失败分类学
arXiv:2503.13657 · NeurIPS 2025 · cited 777 · 论文链接 ↗
一句话:对多智能体系统失败做首个全面分类学 MAST:三大类 15 种失效模式,并发现多数失败源于组织设计与协作机制,而非模型能力本身。
🔰 通俗解释:大家都在堆 agent 能力,没人系统回答「它们怎么失败的」——MAST 用组织理论视角给出答案。
核心机制:
① **三大类失效**:规范与系统问题 / 对齐与交互问题 / 任务与验证问题,细分 15 种模式
② **关键发现**:多数失败来自组织设计与 agent 间协调(而非单模型能力)——与组织理论一致
③ 配套开源标注工具(GitHub MAST)
关键数据:NeurIPS 2025;cited 777;已成为 MAS 可靠性研究的引用锚点。
核心机制:
① **三大类失效**:规范与系统问题 / 对齐与交互问题 / 任务与验证问题,细分 15 种模式
② **关键发现**:多数失败来自组织设计与 agent 间协调(而非单模型能力)——与组织理论一致
③ 配套开源标注工具(GitHub MAST)
关键数据:NeurIPS 2025;cited 777;已成为 MAS 可靠性研究的引用锚点。
对 BOSS-OS 的关联
★★★★☆ 编排/治理链「失败分类学」——与 NO.09 OrchestraBench(可诊断恢复)互补:那篇给恢复机制,这篇给失败命名法
直接可用的复盘清单:槽位切换、patent-mine、论文情报官的每次失败,按 MAST 15 模式归类入账——失败有了统一编码才能统计出「我们最常死在哪一类」。
⚡ 行动建议:短期:把 MAST 分类挂进 dev-review-loop 与 automation 红灯上报格式;本季度末统计编队失败分布,针对性补最弱一类。