1 · Interaction Scaling:测试时扩展的第三轴——交互而非思考
arXiv:2607.11598 · 2026-07-13 · 论文链接 ↗
🔴 关键级
一句话:测试时扩展(TTS) traditionally 只有两条路——让模型想更久(推理链延长)或采样更多次(best-of-N 投票),但这两条路都有天花板。本文提出第三条路:交互扩展——模型生成 artifact,外部工具观察实际行为,模型根据真实反馈修正。
🔰 通俗解释:传统 TTS 的问题在于"自嗨"——所有额外计算都来自同一套权重和提示,模型无法获得它本来不知道的信息。

Interaction Scaling 的思路:
① 模型提出一个 artifact(如代码、规划、答案)
② 外部仪器/环境观察其实际表现
③ 模型根据真实反馈修正

核心突破:**grounding**(接地)。当反馈和评估指标都基于真实世界观察时,交互扩展能突破推理和采样达到的性能天花板。

实验数据:在代码生成任务中,proposer-reviewer 系统通过交互达到 100% pass rate,而纯推理和 best-of-N 采样均 plateau 在 ~85%。
★★★★★ TTS 链补全第三维度,Agent Hub 编排范式升级
与 NO.10 TTS 三体制/NO.11 Consilience/NO.12 ThinkRetrieve 拼接成完整的 TTS 方法论矩阵。NO.10 定义单链/采样/搜索三体制,ThinkRetrieve 是检索增强单链,Interaction Scaling 则是「执行反馈循环」——四者构成 TTS 的完整光谱。BOSS-OS 的 Agent Hub 若需执行代码、调用工具、操作文件,必须引入交互扩展机制而非仅依赖推理链延长。
⚡ 行动建议:中期集成。在 Agent Hub 的编排引擎中增加「交互验证」环节:对代码生成类任务,执行后再将结果反馈给模型修正。优先在 coding agent 场景 PoC,目标是将 pass@1 提升至 ≥95%。
2 · UniT:统一多模态 Chain-of-Thought 测试时扩展
arXiv:2602.12279 · 2026-02-11(Meta AI)· 论文链接 ↗
🔴 关键级
一句话:现有 TTS 方法仅在文本领域有效,UniT 将其扩展到统一多模态模型——单模型通过推理、验证、精炼多轮实现图文联合推理,无需分离的视觉/语言模块。
🔰 通俗解释:当前多模态模型(如 GPT-4V、Gemini)在处理复杂图文推理时,通常将视觉和语言处理分开,或在生成推理链时丢失视觉细节。

UniT 的核心创新:
① **统一模型训练**:单一架构处理文本和图像,避免模态间信息损耗
② **多轮 Chain-of-Thought**:推理→验证→精炼的迭代循环
③ **Agentic 数据合成**:自动构建多模态推理轨迹

关键发现:
• 短推理轨迹训练的模型可泛化到长推理链
• 序列式 CoT 比并行采样更高效(计算预算相同时准确率更高)
• 生成+编辑轨迹训练提升 OOD 泛化能力
★★★★☆ 多模态 TTS 能力补全,契合 BOSS-OS 图文理解需求
与 NO.10 TTS 三体制/NO.12 ThinkRetrieve 拼接。BOSS-OS 的知识库包含专利文档(图文混合)、制度文件(结构化文本),UniT 的多模态 TTS 能力可直接应用于复杂文档推理场景。特别是「验证→精炼」循环机制,可用于专利新颖性判断的多轮论证。
⚡ 行动建议:短期验证。评估 UniT 框架在 BOSS-OS 专利比对场景的适用性:输入专利文档(图文混合),输出创新性评估报告。重点关注多轮推理对复杂技术方案的解析能力提升。
3 · MKG-RAG-Bench:多模态知识图谱 RAG 检索基准
arXiv:2606.26458 · 2026-06-27(KDD 2026)· 论文链接 ↗
🟠 高级
一句话:MKG-RAG-Bench 是首个专门评估多模态知识图谱 RAG 检索能力的基准,涵盖通用和医疗两个领域,揭示图谱 RAG 的瓶颈在于检索而非生成。
🔰 通俗解释:传统 RAG 仅检索文本片段,MKG-RAG 则检索知识图谱中的实体关系 + 多模态内容(图片、表格)。但现有工作缺乏标准化评估基准。

MKG-RAG-Bench 的设计:
① **双领域数据集**:通用问答(WikiQA 扩展)+ 医疗问答(PubMed 扩展)
② **多模态 KG**:实体包含图像描述,关系包含结构化属性
③ **可控评估**:隔离检索环节,单独测量检索召回率和生成准确率

关键发现:
• 图谱 RAG 的检索瓶颈显著——添加图像和图边并不保证准确率提升
• 向量 RAG 在简单查询上更快,图谱 RAG 在多跳推理上更优
• 检索质量是决定最终生成的首要因素
★★★★☆ 知识层图谱选型参考,补全 NO.10 Agentic KG RAG
与 NO.10 Agentic KG RAG(递归爬取 +70% CFR)拼接。MKG-RAG-Bench 提供了评估框架,帮助 BOSS-OS 在「向量 RAG vs 图谱 RAG vs 混合架构」之间做技术选型。特别是专利知识库场景——专利文本包含大量图表和公式,多模态 KG RAG 是天然选择。
⚡ 行动建议:中期评估。使用 MKG-RAG-Bench 的评估协议,在 BOSS-OS 专利知识库上对比三种架构:纯向量 RAG、纯图谱 RAG、混合架构。目标:多跳推理准确率 ≥85%,响应延迟 ≤2s。
4 · Agentic AI:大语言模型智能体的统一分类学与架构
arXiv:2601.12560 · 2026-01-18 · 论文链接 ↗
🟠 高级
一句话:本文提出 Agentic AI 的统一分类学,将 LLM 智能体分解为六个模块化维度——感知、记忆、行动、画像、认知架构、学习与多智能体系统,并综述当前评估实践。
🔰 通俗解释:当前 Agentic AI 研究分散,缺乏统一框架。本文首次系统性地构建分类学:

① **Core Components**(核心组件):感知(Perception)、记忆(Memory)、行动(Action)、画像(Profiling)
② **Cognitive Architecture**(认知架构):规划(Planning)、反思(Reflection)
③ **Learning**(学习):在线学习、元学习、强化学习
④ **Multi-Agent Systems**(多智能体):拓扑结构、通信协议、协作模式
⑤ **Environments**(环境):仿真环境、真实部署、安全约束
⑥ **Evaluation**(评估):能力评测、安全评估、对齐测量

关键论点:Agentic AI 的进步不仅依赖模型规模,更依赖「可控制、可审计、可对齐」的架构设计。
★★★★☆ 编排链理论锚点,指导 Agent Hub 架构设计
与 NO.11 CASE Framework(四阶治理)/ NO.12 MasDrift(授权漂移)拼接。本文的分类学为 BOSS-OS 的 Agent Hub 提供架构参考:感知→记忆→规划→行动→评估的完整链路,对应 DBEI-KOCIR-M 的治理层级。特别是「画像」模块——Agent 的自我建模能力对授权管理至关重要。
⚡ 行动建议:长期参考。将本文分类学纳入 BOSS-OS 架构设计文档,作为 Agent Hub 模块划分的理论基础。优先完善:记忆模块(长期/短期分离)、评估模块(安全/能力双轨)。
5 · LATTICE:治理优先的授权自主 AI 运行架构
Frontiers in AI · 2026 · 论文链接 ↗
🟠 高级
一句话:LATTICE 提出治理优先架构,将 cryptographic audit(密码学审计)和 human oversight(人类监督)嵌入多智能体系统的底层,而非事后补丁。
🔰 通俗解释:当前 AI 治理多是「事后补救」——出问题后再审查。LATTICE 的核心创新是「治理优先」:

① **Governance Agent**:每个网格单元配备治理 Agent,负责规划、执行协调
② **Cryptographic Audit Trail**:所有决策和操作记录在不可篡改的审计链上
③ **Separation of Concerns**:治理逻辑与执行逻辑分离,互不影响
⑋ **Human-in-the-Loop**:关键决策需人类确认

实验场景:医疗信息系统中的多智能体协作,4 个 Agent 协同完成诊断、处方、审核流程。
★★★★☆ 治理链「密码学审计」层补全
与 NO.11 CASE Framework(四阶治理)/ NO.12 POLIS(制度设计)拼接。CASE 提供分层治理架构,POLIS 提供制度设计理论,LATTICE 提供技术实现——三者形成完整治理体系。BOSS-OS 的 DBEI 边界审查可扩展为「密码学审计」:所有 Agent 操作记录在链,支持事后追溯和责任认定。
⚡ 行动建议:中期构建。在 BOSS-OS 的治理引擎中增加「审计链」模块:记录所有 Agent 决策和操作,支持密码学验证。优先在金融/医疗等高合规场景试点,目标:审计追溯时间 ≤1s,不可篡改性 100%。

本期 5 篇总览

#论文 / 文献来源级别核心贡献
1Interaction Scaling:测试时扩展第三轴arXiv 2607关键交互反馈突破推理/采样天花板
2UniT:统一多模态 Chain-of-Thought TTSarXiv 2602(Meta)关键单模型图文联合推理,序列 CoT 高效
3MKG-RAG-Bench:多模态知识图谱 RAG 基准arXiv 2606(KDD 26)高级检索是瓶颈,图谱 RAG 适合多跳推理
4Agentic AI:统一分类学与架构arXiv 2601高级六维模块化分类,架构设计指南
5LATTICE:治理优先的授权自主 AI 架构Frontiers AI 2026高级密码学审计 + 人类监督嵌入底层