1 · ProgRouter:进度引导在线路由——任务做到哪一步,才决定调哪个模型
arXiv:2608.25992 · 2026-08 · 论文链接 ↗
一句话:ProgRouter 提出「进度引导的在线路由」——不再按 query 一次性选模型,而是在多智能体工作流的每一步,依据「任务已完成多少、还剩多少难度、时间/成本预算还剩多少」动态选 LLM,在保质量的前提下压住长程成本。
🔰 通俗解释:现有级联路由(cascade routing)是「一次性、query 级别」决策,无法适应多步工作流里「每一步该用哪个模型取决于任务进展」的动态性。ProgRouter 把路由从「query 级一次性拍板」推进到「step-wise 在线逐步决策」。
核心机制:
① **多视角任务进度打分器**:粗粒度(工作流结果机制)+ 细粒度(子任务完成度、进度趋势、工作流状态质量)组合,给每一步一个「进度画像」
② **双路进度预测器 + 自适应元门控**:估计每个候选模型的「进度增益」(再走一步能推进多少)
③ **在线逐步路由**:在进度增益、时间预算、长期运行成本三者间平衡,而非只看单步最优
关键数据:在 HumanEval Plus / MBPP / MATH-500 / ASQA(代码生成、数学推理、RAG 长问答)上,相对关键基线降低运营成本,同时保持任务求解性能——证明「路由跟着进度走」比「一次性选模型」更省。
核心机制:
① **多视角任务进度打分器**:粗粒度(工作流结果机制)+ 细粒度(子任务完成度、进度趋势、工作流状态质量)组合,给每一步一个「进度画像」
② **双路进度预测器 + 自适应元门控**:估计每个候选模型的「进度增益」(再走一步能推进多少)
③ **在线逐步路由**:在进度增益、时间预算、长期运行成本三者间平衡,而非只看单步最优
关键数据:在 HumanEval Plus / MBPP / MATH-500 / ASQA(代码生成、数学推理、RAG 长问答)上,相对关键基线降低运营成本,同时保持任务求解性能——证明「路由跟着进度走」比「一次性选模型」更省。
对 BOSS-OS 的关联
★★★★☆ 编排链「静态拓扑/一次性路由 → 进度感知的逐步在线路由」拼图——ProgRouter 是 DBEI-KOCIR-M 多 Agent 编排中「路由随任务进展自适应」的工程路径
与 NO.01 AdaptOrch(拓扑选择)/ NO.03 Nexa(并行↔串行)/ NO.05 MAS-Orchestra(量化边界)/ NO.06 TopoPrior(先验)/ NO.09 OrchestraBench(可诊断恢复)/ NO.17 事件驱动编排 / NO.21 DMoA(可微分上下文路由)拼接。DMoA 解决「路由如何学习」,ProgRouter 解决「路由何时该变」——两者互补:一个让路由可微分自学习,一个让路由跟着任务进度动态切换 backbone。对 BOSS-OS Agent Hub 的逐步成本-质量门控直接可用:每一步按进度打分动态选 backbone + 设预算上限,避免长程工作流成本失控。
⚡ 行动建议:中期 PoC。在 Agent Hub 编排层评估「进度引导逐步路由」:每一步用多视角进度打分器 + 自适应元门控,在质量/时间/成本预算间权衡选 backbone;先在代码生成 + 数学推理任务上对比一次性路由的运营成本。本期与 NO.01/03/05/06/09/17/21 编排链拼「进度感知路由」拼图。
2 · MawForge:本地推理栈「有界专家物化」——把 MoE 大模型当磁盘对象按需调进内存
arXiv:2607.09686 · 2026-07 · 论文链接 ↗
一句话:MawForge 把本地 MoE 推理从「整模型必须进内存」改成「整模型留在磁盘、公共张量常驻、被路由命中的专家按需物化进有界执行缓存」——在 24GB 统一内存的 M5 Pro 上跑通 34GB Qwen3.6-35B-A3B 与 25GB Gemma4-26B-A4B 的 Q8 服务。
🔰 通俗解释:MoE 稀疏激活只省了「计算」,没省「内存」——大多数本地推理路径仍把整个 GGUF 当整文件加载,一旦模型+KV缓存+运行时超出机器吸收能力就崩。MawForge 重构为内存层次:全模型是磁盘持久对象,公共张量常驻,被 router 命中的专家张量按层按专家拆成小块,只在需要时拷进有界内存槽。
核心机制:
① **split-pack 架构**:模型留盘、公共张量常驻、专家按需物化进有界执行缓存
② **预算模型 + 原生 GGUF 服务路径**:18 GiB 显式服务目标,静态规划先拒后跑
③ **验证矩阵**:600 行非投机 MawForge + 静态规划接受 27/30 cell、拒绝 3 cell;540 行生成全部合法(无触发内存守卫)
④ **关键反直觉**:专家缓存非单调——更大缓存提升命中率却可能因主机内存压力降吞吐;Qwen Q8 偏好 15% 最小缓存,Gemma Q8 偏好 35%
关键数据:M5 Pro 24GB 统一内存 / 18GiB 服务目标;34GB Qwen3.6-35B-A3B Q8 + 25GB Gemma4-26B-A4B Q8 跑通;直接非 MawForge 加载 Gemma4 26B Q8 @32K 触发 98% 安全守卫被终止,split-pack 全程跑完。
核心机制:
① **split-pack 架构**:模型留盘、公共张量常驻、专家按需物化进有界执行缓存
② **预算模型 + 原生 GGUF 服务路径**:18 GiB 显式服务目标,静态规划先拒后跑
③ **验证矩阵**:600 行非投机 MawForge + 静态规划接受 27/30 cell、拒绝 3 cell;540 行生成全部合法(无触发内存守卫)
④ **关键反直觉**:专家缓存非单调——更大缓存提升命中率却可能因主机内存压力降吞吐;Qwen Q8 偏好 15% 最小缓存,Gemma Q8 偏好 35%
关键数据:M5 Pro 24GB 统一内存 / 18GiB 服务目标;34GB Qwen3.6-35B-A3B Q8 + 25GB Gemma4-26B-A4B Q8 跑通;直接非 MawForge 加载 Gemma4 26B Q8 @32K 触发 98% 安全守卫被终止,split-pack 全程跑完。
对 BOSS-OS 的关联
★★★★★ 本地推理栈「有界内存 MoE 服务」拼图——直接对应 omlx / gemma4-12b 主权本地栈的「大模型装不进内存」痛点
与 NO.06 Cassandra 边缘自投机 / NO.08 Litespark 极端量化 / NO.09 Mirai 硬件友好量化 / NO.10 Lynx 渐进投机 KV / NO.16 BaseRT Apple Silicon 原生 Metal / NO.19 VeriCache 无损化投机 / NO.21 Lossless but Not Free 拼接。前面解决「量化/投机/内核」四杠杆,MawForge 解决「MoE 稀疏激活没自动变成稀疏驻留」这一层——把内存层次显式化。BOSS-OS 主权本地栈想跑 Gemma4-26B-A4B 这类 MoE:直接加载会爆内存,MawForge 的 split-pack + 有界专家缓存给出可落地路径,且「缓存大小非单调」的提醒直接避坑。
⚡ 行动建议:短期评估。在 omlx/MPS 栈评估 MawForge split-pack:先把全模型留盘、公共张量常驻,再按路由命中物化专家进有界缓存;目标机型 M5 Air 32GB 跑 Gemma4-26B-A4B Q8 时设 18GiB 服务上限,避开 98% 内存守卫。本期与 NO.06/08/09/10/16/19/21 本地推理链拼「有界内存 MoE」拼图。
3 · TTS 推理体制分类学:把「多采样+聚合」拆成三种不可互换的算法
arXiv:2608.04001 · 2026-08 · 论文链接 ↗
一句话:一篇把「测试时扩展」从模糊口号拆成严谨分类学的论文——把它形式化为自回归模型隐式前缀树上的「预算化推理」,区分单轨迹序贯扩展、叶级扩展+终末归约、前缀级扩展三种体制,并指出「用标量预算掩盖协议差异」是跨研究不可比的根因。
🔰 通俗解释:「测试时扩展」现在是个筐——多采样投票、树搜索、长链思考全被塞进一个「算得多就更强」的标量预算里。这篇论文说:这些算法统计结构、算力需求、失败模式都不同,不能互换。
核心机制:
① **三体制分类**:单轨迹序贯扩展(一条路想更久)/ 叶级扩展+终末归约(采样多条完整候选再投票或验证)/ 前缀级扩展(在部分状态上搜索)
② **把整个推理系统当被评对象**:分离端到端性能与候选库诊断;提出评测画像,其坐标与泛函可恢复/界定常见重复采样指标
③ **算力核算 + 不确定性估计匹配协议**;区分精确重放 vs 分布可复现
④ **实证**:覆盖广识、符号推理、竞赛数学;公开释放 1,403,520 次采样尝试
关键数据:1,403,520 sampled attempts released;把 TTS 论文的可比性锚定到「协议层」而非「预算数字层」。
核心机制:
① **三体制分类**:单轨迹序贯扩展(一条路想更久)/ 叶级扩展+终末归约(采样多条完整候选再投票或验证)/ 前缀级扩展(在部分状态上搜索)
② **把整个推理系统当被评对象**:分离端到端性能与候选库诊断;提出评测画像,其坐标与泛函可恢复/界定常见重复采样指标
③ **算力核算 + 不确定性估计匹配协议**;区分精确重放 vs 分布可复现
④ **实证**:覆盖广识、符号推理、竞赛数学;公开释放 1,403,520 次采样尝试
关键数据:1,403,520 sampled attempts released;把 TTS 论文的可比性锚定到「协议层」而非「预算数字层」。
对 BOSS-OS 的关联
★★★★★ TTS 链「体制分类 + 可复现」封口——把 NO.05/NO.10 的「三体制形式化」升级为带评测画像与算力核算的操作框架
与 NO.01 Plan and Budget / NO.03 Overthinking & Guided by Gut / NO.05 测试时扩展三体制 / NO.07 ∇-Reasoner / NO.08 Refining Over Resampling / NO.09 SVR 自验证 / NO.10 三体制统一形式化 / NO.19 Learning When to Think / NO.20 Funnel of Thoughts / NO.21 V₁ pairwise 择优 拼接。NO.10 给出三体制形式化,这篇补上「怎么评、怎么核算算力、怎么保证可复现」——等于给 BOSS-OS 的 TTS 实验台一份方法论护栏:选用体制前先声明协议,否则跨实验不可比。
⚡ 行动建议:立即。把本文「三体制 + 评测画像 + 算力核算」纳入 BOSS-OS TTS 实验规范:每次测评显式声明推理体制(单轨迹/叶级/前缀级)、预算口径与不确定性估计;优先用其公开 140 万次采样数据集做回归基准。本期与 NO.03/05/07/08/09/10/19/20/21 TTS 链拼「体制分类+可复现」拼图。
4 · DocuSearch:知识层「三信号融合 + 逐块落地验证」——每个 chunk 自带事实性闸门
arXiv:2609.01617 · 2026-06 · 论文链接 ↗
一句话:DocuSearch 在真实电信运维环境落地的离线多智能体 RAG——把稠密向量(0.50)、BM25 全文(0.35)、知识图谱邻居扩展(0.15)三路信号用加权 RRF 融合,再经 cross-encoder 重排 + MMR 去冗余,核心是「逐块 agentic 评估环」:每个 chunk 自己判断要不要更多上下文、是否真能回答问题、答案是否真有检索依据,不落地就回退多块合并。
🔰 通俗解释:企业文档库里「答案散在多个不相邻段落、混着厂商术语和缩写」时,单信号向量检索经常扑空。DocuSearch 不赌单一信号,而是把三种证据源拉齐融合,最妙的是「逐块评估环」——
核心机制:
① **三信号加权 RRF 融合**:向量 0.50 + BM25 0.35 + KG 0.15,平滑常数 k=60
② **cross-encoder 重排 + MMR(λ=0.65)** 去冗余保多样
③ **逐块 agentic 评估**:LLM 判「需更多上下文?」「充分回答?」「答案有依据?」;无依据答案不返回,回退多块合并
④ **全本地托管模型 + LangGraph 编排**,电信生产环境验证
关键数据:P@10=0.69 / R@10=0.79 / grounding rate 89.6%,相对稠密-only RAG 基线分别 +15 / +16 / +18.4 个百分点。
核心机制:
① **三信号加权 RRF 融合**:向量 0.50 + BM25 0.35 + KG 0.15,平滑常数 k=60
② **cross-encoder 重排 + MMR(λ=0.65)** 去冗余保多样
③ **逐块 agentic 评估**:LLM 判「需更多上下文?」「充分回答?」「答案有依据?」;无依据答案不返回,回退多块合并
④ **全本地托管模型 + LangGraph 编排**,电信生产环境验证
关键数据:P@10=0.69 / R@10=0.79 / grounding rate 89.6%,相对稠密-only RAG 基线分别 +15 / +16 / +18.4 个百分点。
对 BOSS-OS 的关联
★★★★★ 知识层「混合检索 + 逐块事实性闸门」拼图——与 NO.16 VDGR-RAG(图遍历+反思)、NO.10/16 KG 递归爬取互补,补上「融合权重 + 落地 grounding 验证」这一层
与 NO.01 SCAIR / NO.05 AgenticRAG / NO.06 HCG-RAG / NO.07 Which RAG Wins / NO.08 Self-Correcting RAG(NLI 忠实度)/ NO.09 ADORE / NO.16 VDGR-RAG / NO.21 Beyond Vector Similarity(图计算算子)拼接。BOSS-OS 知识层(Obsidian 714+ 文档、双 CRM、专利交底书)需要「不落地就不返回」的事实性闸门——DocuSearch 的逐块评估环 + 89.6% grounding 是直接可抄的工程范本,且 RRF 加权融合给出可解释的检索可组合性(向量/词法/图谱各占比例)。
⚡ 行动建议:中期架构。给知识层 RAG 加「三信号加权 RRF 融合 + 逐块 grounding 闸门」:向量/BM25/KG 按 0.50/0.35/0.15 融合,每个 chunk 经 LLM 三问(上下文充分?回答充分?有依据?)不通过则多块合并回退;用 P@10/R@10/grounding rate 三指标评测。本期与 NO.01/05/06/08/09/16/21 知识层拼「混合检索+落地验证」拼图。
5 · 三框架统一治理分类学:ISO 42001 / NIST AI RMF / EU AI Act 合成一套控制库
arXiv:2608.07515 · 2026-08 · 论文链接 ↗
一句话:一篇把 ISO/IEC 42001、NIST AI RMF、EU AI Act 三个治理工具「调和」成统一分类学的论文——指出三者差在「法律地位/治理主体/风险定义」三个不可被词汇抹平的差异,给出五分析层 + 八「监管稳定」治理域 + 可追溯脊,让组织跑一套控制库和证据基座就满足三套义务。
🔰 通俗解释:企业现在常建三条平行治理轨道——一条为认证(ISO)、一条为内部风险管理(NIST)、一条为法律合规(EU Act),导致控制重复、问责碎片化、成本虚高。这篇说:不要把它们压成一个,而是识别「共享治理基元」并映射差异,让一套控制库同时尊重三套义务。
核心机制:
① **识别三者不可抹平的差异**:法律地位(强制法 vs 自愿指南 vs 可认证标准)、治理主体(系统+角色 vs 风险管理功能 vs 组织管理体系)、风险定义(基于意图的列表 vs 情境化迭代评估)
② **统一治理分类学**:五分析层 + 八「监管稳定」治理域,由可追溯脊绑定
③ **四步实施模型 + 两个高风险实例**
④ **边界条件**:明确写出「统一失败」的场合
关键数据:五层 / 八域 / 可追溯脊;反映 2026 年中状态(含 2026-05 Digital Omnibus 重排 AI Act 高风险义务、2024 NIST 生成式 AI Profile)。
核心机制:
① **识别三者不可抹平的差异**:法律地位(强制法 vs 自愿指南 vs 可认证标准)、治理主体(系统+角色 vs 风险管理功能 vs 组织管理体系)、风险定义(基于意图的列表 vs 情境化迭代评估)
② **统一治理分类学**:五分析层 + 八「监管稳定」治理域,由可追溯脊绑定
③ **四步实施模型 + 两个高风险实例**
④ **边界条件**:明确写出「统一失败」的场合
关键数据:五层 / 八域 / 可追溯脊;反映 2026 年中状态(含 2026-05 Digital Omnibus 重排 AI Act 高风险义务、2024 NIST 生成式 AI Profile)。
对 BOSS-OS 的关联
★★★★★ 治理链「多框架统一」封口——与 NO.09 CAGE-1(Prebind 受控)、NO.21 Evidence-Led(治理=操作系统)同构,把「怎么把受控落成日常控制」升级为「一套控制库满足三套国际义务」
与 NO.02 政策接口 / NO.04 HAIG / NO.05 AIRDA / NO.06 伦理审查办法 / NO.07 余晓晖 / NO.08 实施意见 / NO.09 CAGE-1 / NO.10/11/18/19/20/21 治理系列 拼接。BOSS-OS 要对接国内创新治理话语 + 出海合规——这套「统一分类学 + 可追溯脊 + 单一控制库」正是 DBEI 运行层把治理义务落地的国际范本:把 ISO/NIST/EU 的差异显式化,避免重复控制,且满足主权本地栈的合规可审计性。
⚡ 行动建议:立即。把本文「五层 + 八域 + 可追溯脊」映射进 BOSS-OS DBEI 治理层:识别与国内政策接口(NO.02)的共享基元,建单一控制库 + 证据基座,避免「认证/风险/合规」三轨平行;与 NO.09 CAGE-1 Prebind、NO.21 Evidence-Led 合并成「部署前治理门禁 + 运行控制库 + 多框架合规」。本期与 NO.02/04/05/06/07/08/09/10/11/18/19/20/21 治理链拼「多框架统一」拼图。
本期总览
| 编号 | 论文 | 方向 | 重要度 | DBEI-KOCIR-M 关联 |
|---|---|---|---|---|
| 1 | ProgRouter 进度引导在线路由(2608.25992) | 编排链路由 | 🟠 高级 | 多视角进度打分器 / 自适应元门控 / 逐步成本-质量权衡 |
| 2 | MawForge 有界专家物化(2607.09686) | 本地推理有界内存 | 🔴 关键 | split-pack 留盘+常驻+按需物化 / M5 Pro 24GB 跑 34GB Qwen3.6 / 缓存非单调 |
| 3 | TTS 推理体制分类学(2608.04001) | TTS 链可复现 | 🔴 关键 | 三体制形式化 / 评测画像 / 算力核算 / 140 万采样公开 |
| 4 | DocuSearch 三信号混合 RAG(2609.01617) | 知识层混合检索 | 🔴 关键 | 加权 RRF 0.50/0.35/0.15 / 逐块 grounding 闸门 / P@10 0.69 R@10 0.79 89.6% |
| 5 | 三框架统一治理分类学(2608.07515) | 治理链多框架 | 🔴 关键 | ISO/NIST/EU 统一 / 五层八域 / 可追溯脊 / 单一控制库 |