1 · MAS-Orchestra:何时该用多智能体,第一次被量化
ICML 2026 · arXiv:2601.14652 · 论文链接 ↗
🔴 关键级
一句话:多智能体系统不是"上了就比单模型强"——这篇用函数调用强化学习自动设计整套 MAS,并给出 MASBench 五个轴,第一次把"什么时候该用 MAS、该用多大"量化成可查表的东西。
🔰 通俗解释:现在大家默认"多 Agent 协作肯定比单 Agent 强",结果很多场景硬上 MAS 反而更慢更贵还更错。问题在:从来没人系统地告诉你"什么任务值得用 MAS、用几个、串多深、并行多大"。

MAS-Orchestra 做两件事:①把"自动设计多智能体系统"重述成一个 RL 问题——让编排模型一次性用函数调用输出整张 MAS(角色+连接+顺序),而不是逼编排者去读/复现子 Agent 的内部代码;②配套 MASBench,从 Depth(递归深度)/Horizon(步数)/Breadth(并行度)/Parallel/Robustness 五个轴,刻画"MAS 到底在哪些条件下真强于单 Agent"。
★★★★★ 编排决策的量化地基
BOSS-OS 的数字工人军团天然是多 Agent 系统——专利 Agent、审查 Agent、代码 Agent 并行协作。你迟早要回答"这个任务该派几个 Agent、什么拓扑、串多久",过去这是拍脑袋。

核心洞察:sequential 多步编排逼着 orchestrator 每步做局部最优,但 MAS 的收益来自全局协调——两者本质冲突,所以必须整体训练而非逐步拼接。这恰好解释了已发 INFRAMIND(基础设施感知)/Nexa(动态自适应)为何要端到端学编排。

与已发 AdaptOrch(拓扑>模型选择)、Nexa(并行↔串行自适应)构成闭环:选拓扑 → 自适应 → 量化决策边界。
⚡ 行动建议:中期。Agent Hub 编排层引入"拓扑决策五轴"作为路由判断依据;MASBench 思路可作内部编排基线。本期与 NO.01 AdaptOrch、NO.03 Nexa/INFRAMIND 拼成完整编排方法论链。
2 · Test-Time Scaling 推理体制框架:把"想得久"说清楚
arXiv:2608.04001 · 2026-08-04 · 论文链接 ↗
🔴 关键级
一句话:"测试时扩展"现在被滥用了——不同算法(单轨迹深想 / 多候选投票 / 前缀搜索)被当成同一个"预算"标量比较,导致论文结论互相打架;这篇把 TTS 形式化为"预算化推理",分成三种结构体制,并规定怎么报告才算可复现。
🔰 通俗解释:"给模型更多推理算力就能更聪明"已成共识,但没人说清你说的到底是哪一种——是让一条思路想更深?还是生成多个答案投票?还是对进行到一半的状态做搜索剪枝?这三种的统计结构、算力账、失败模式完全不同。把它们都塞进一个"预算"数字里比,等于拿苹果跟橘子比。

这篇把推理系统的评估对象从"模型+准确率"换成"整个推理系统"——含 prompt 模板、解码配置、搜索控制器、验证器、停止规则。并发布 20 亿+ 完整推理 trace 供复现。
★★★★★ 推理预算从盲调到可度量
你所有的 Agent 推理预算、verify/投票策略都属 TTS。若不分清"我在用哪种体制",成本-准确率曲线根本不可比。

三体制:① single-trajectory sequential(单轨迹顺序深想)② leaf-level scaling with terminal reduction(多候选末态归约,即 best-of-N/验证)③ prefix-level scaling(对未完成部分状态搜索剪枝)。

直接呼应 NO.03 Overthinking:那篇揭示"想太久会反悔、边际递减",但缺度量标准;这篇的 evaluation profile 体系正好给你度量那篇现象的可复现协议——把"反悔点"变成可调参数而非玄学。
⚡ 行动建议:立即。Agent Hub 推理预算从"统一 token 预算"升级为"三体制选择 + 协议匹配报告";用其 evaluation profile 给内部 Agent 推理建可复现基线。本期与 NO.03 Overthinking 形成"现象→度量"闭环。
3 · AgenticRAG:让 LLM 自己翻文档找证据
arXiv:2605.05538 · 2026-05 · 论文链接 ↗
🔴 关键级
一句话:标准 RAG 把"找依据"的重活压在检索栈上、模型只看检索末端给的固定候选;AgenticRAG 在现有企业搜索之上套一层轻量 harness,给推理 LLM 配 search/find/open/summarize 工具,让它自己迭代检索、翻文档、分析证据。
🔰 通俗解释:传统 RAG 像一个被蒙着眼的答题者:检索系统丢给他一摞候选段落,他只能在里面挑。复杂任务(跨文档取证、长链条推理)这种"固定候选"会漏掉关键证据。

AgenticRAG 的做法:不推翻你现有的企业搜索基础设施,只在上面加一层"会自己动手的推理 LLM"——给它 search(搜)、find(定位)、open(打开)、summarize(总结)工具,让它像人一样:先搜一轮、点开相关文档、在文档内导航、再自主分析证据,而不是一次性吞下检索栈的末态输出。
★★★★☆ 知识/数据层的工程升级路线
BOSS-OS 知识/数据层若止步于向量 RAG,复杂多跳、跨文档取证类任务(专利新颖性比对、交底书查重、标准条款援引)会失真。AgenticRAG 是这条层的升级路线。

硬数据:BRIGHT recall@1 49.6%(+21.8pp 超最佳 embedding 基线)、WixQA factuality 0.96(+13% 相对)、FinanceBench 答案正确率 92%(距 oracle 真证据仅 2pp)。消融显示最大增益来自"单次检索→agentic 工具调用"(5.9× 提升)。

与 NO.01 SCAIR 互补:SCAIR 管"结构化图谱怎么走"(schema 约束 KG 推理),AgenticRAG 管"非结构化文档怎么挖"(agentic 工具检索)——两者拼接即 BOSS-OS 完整知识层。
⚡ 行动建议:短期可落地。知识层从"向量 RAG"过渡到"agentic harness + 现有检索";复用其 search/find/open/summarize 工具抽象,避免重造检索栈。本期与 NO.01 SCAIR 拼成"图谱+文档"双轨知识层。
4 · Measuring AI R&D Automation(AIRDA):治理始于度量
arXiv:2603.03992 · 2026-03 · GovAI & University of Oxford · 论文链接 ↗
🔴 关键级
一句话:AI 正在自动化"AI 研发"本身(AIRDA),而我们的监督能力追不上——这篇提出 14 个具体指标,主张"治理始于度量",在失控前先有数据。
🔰 通俗解释:过去 AI 是工具,现在 AI 开始写 AI 的研究论文、做 AI 的实验、提 AI 的训练方案。这叫 AIRDA(AI 研发自动化)。问题随之而来:系统越来越复杂、人参与越来越少,"必要的监督"和"实际的掌控"之间的缺口在扩大。作者说:别空谈,先度量——没有数据,决策全在黑暗里。

他们给出 14 个指标,分四类:实验类(AI 做 AI 研究的水平,人类/AI/混合队对比)、组织类(研究者把多少时间委托给 AI、多少关键决策有 AI 参与)、运营类(AI 生成结果的错误数、AI 绕过控制的事件数)、经济类(算力 vs 人力预算占比、研究员人数变动)。
★★★★★ 原理级创新的操作化度量
BOSS-OS 的定位就是"AI 创新生产操作系统"——让 AI 跨过组合式创新、进入原理级创新。这正是 AIRDA 描述的"AI 自动化自身研发"。你既要吃这红利,又要防"监督缺口"——这篇给你可操作的度量尺。

核心论点:自动化既可能加深缺口(系统更复杂、人参与更少),也可能用 AI 监控 AI 来缩小——前提是先度量。

与已发 NO.04 HAIG 形成方法论闭环:HAIG 诊断"自主性飞快、问责原地踏步"的治理不对称;AIRDA 给"飞了多少、差多少"的量化工具。再叠 NO.02 政策接口方案 → 方法论→度量→政策三层完整覆盖。
⚡ 行动建议:立即。把 AIRDA 的 14 指标映射为 BOSS-OS 内部"AI 自研监督看板";这是 HAIG 治理不对称诊断的度量落地。本期与 NO.02/NO.04 拼成治理闭环。
5 · Prima.cpp:家用设备组网跑 30–70B 大模型
ICLR 2026 · 论文链接 ↗
🟠 高级
一句话:消费级家用设备(旧 Mac/PC、混合 CPU/GPU、内存不足、Wi-Fi 链接)也能跑 30–70B 大模型——prima.cpp 用流水环并行 + 异构调度,把 70B 压到 674ms/token、32B+投机解码跑到 26 tok/s,且永不 OOM、保护隐私。
🔰 通俗解释:大模型推理通常要么上云(失去数据主权、按 token 付费),要么买 A100 集群(贵)。prima.cpp 证明另一条路:把你手头几台普通家用机连起来当成一个分布式推理网格——旧 Mac、Windows PC、混合显卡、内存不够、走 Wi-Fi 都行。

关键工程:①流水环并行(PRP)把磁盘 I/O 与计算/通信重叠,解决 mmap 卸载的"预取-释放"冲突;②Halda 异构感知调度,在 RAM/VRAM 约束下协同优化每设备 CPU/GPU 负载与设备选择。
★★★★☆ 主权本地推理网格的可行性证据
你的主权本地栈(gemma4-12b MLX / omlx 候选)目前是单机的;prima.cpp 证明"多台家用机组网"能把本地能力从 12B 拉到 70B 级——主权推理不必依赖云,也不必买专业集群。

硬数据:4 台消费设备,70B 达 674ms/token(<6% 内存压力),32B+投机 26 tok/s;相比 llama.cpp/exo/dllama 快 5–17× TPOT;支持 8B–70B 细粒度,跨 OS、量化兼容、Wi-Fi 容忍、OOM-free。
⚡ 行动建议:中期探索。评估把 BOSS-OS 本地推理从单机 MLX 升级为"多设备 prima.cpp 联邦"——契合创世者多 Mac 环境做主权大模型推理网格。注意:当前本地栈以 MLX 为主,prima.cpp 属 llama.cpp 系,需评估迁移成本。

本期 5 篇总览

#论文来源级别核心贡献
1MAS-OrchestraICML 2026关键函数调用 RL 自动设计 MAS + MASBench 五轴量化"何时该用多智能体"
2Test-Time Scaling 体制框架arXiv 2608关键三体制形式化 + 评估协议 + 20亿 trace,终结 TTS 不可比
3AgenticRAGarXiv 2605关键agentic 工具检索 harness,BRIGHT recall@1 +21.8pp
4AIRDAarXiv 2603关键GovAI/Oxford 14 指标度量"AI 自动化自身研发"监督缺口
5Prima.cppICLR 2026高级家用集群分布式推理 70B,主权本地网格可行证据