0. 序言:逻辑正确性与物理断裂性

我们承认一个事实:在逻辑抽象层,推理(Inference)确实是AI智能体的"心跳"与最小功能单元。Agent的行为确实可被分解为 推理 × N

然而,计算机体系结构的演进从来不由逻辑优美决定,而由物理瓶颈决定(即算力墙、显存墙、I/O延迟墙)。若将"带Tool Call的推理事务"视为不可拆分的原子(类似CPU指令),将导致GPU资源锁死、调度死锁和批处理效率崩塌。

因此,本概论提出 “宏观逻辑原子化,微观物理流水化” 的双层解耦架构。

这一架构思路与2026年产业实践高度吻合。以Mooncake(FAST 2025最佳论文)为例,Moonshot AI的KVCache中心化解耦架构已经在生产环境证明了"推理舱可挂起、KV Cache可换出、GPU可复用"的工程可行性。Mooncake将prefill和decode分离到不同GPU池,KV Cache通过RDMA在节点间流转,使GPU利用率从"独占式长事务"的低位运行跃升至持续饱和状态。这不是理论推演——Kimi作为月活千万级的LLM服务,其底层正是这套架构在支撑。


一、 计算原语的重新分层(剥离谬误)

我们必须将"原子操作"拆解为两个独立的工程层:

层级定义工程实质类比
物理原子(不可抢占)单次模型前向传播(Forward Pass)GPU流处理器执行矩阵乘法,生成若干Token的连续计算过程。CPU的指令周期
逻辑事务(可挂起)推理舱(Reasoning Cell)加载Context输出决策的完整闭环,但不包含Tool执行的等待时间CPU的指令流水线阶段
调度对象令牌时间片(Token Time-Slice)推理引擎(如vLLM)通过Continuous Batching,将多个推理舱合并为一个物理Forward。操作系统的线程时间片

核心结论:系统架构的底层调度器不感知"Agent"或"Task",仅感知**“待生成的Token数量”**。

这一结论已被2026年的推理引擎实践充分验证。vLLM的调度器在每个Forward Pass之后执行一个简洁循环:扫描完成序列→释放KV Cache块→从等待队列拉取新请求→拼接为复合批次→执行下一次前向传播。调度器从不在请求粒度上决策,而是在迭代粒度上决策。Sarathi-Serve(OSDI 2024)进一步将这一理念推向极致——通过chunked-prefills将长prompt的prefill拆分为与decode请求混合的统一计算批次,实现stall-free scheduling,在相同硬件上达到vLLM基线的2.6倍服务容量。

关键数据:SGLang在96块H100上部署DeepSeek-R1,借助RadixAttention的前缀复用和连续批处理,实现了52.3k input tokens/s和22.3k output tokens/s的吞吐。这证明了"以Token时间片为调度对象"的架构能够支撑万亿级Token调用。


二、 存储层次体系(Memory Hierarchy)的物理映射

“Context即Cache"方向正确,但物理布局必须清晰,以指导硬件选型:

层级对应存储物理介质特性
L0 寄存器当前激活的KV CacheGPU HBM(高带宽显存)必须常驻,延迟<1ms,容量极小(受限于Context Length)。以Llama-3-70B为例,每token约1MB KV Cache,一个128K上下文请求需约40GB HBM。
L1 缓存对话状态(State)与系统PromptCPU 内存(DRAM)推理前需预加载至HBM,延迟约10ms。vLLM的swap机制即在此层操作。
L2 缓存短期记忆/向量索引块/前缀复用本地SSD(NVMe)或远端Redis按需检索,延迟约1-10ms。SGLang的RadixAttention用基数树在此层管理跨请求的KV Cache复用。
L3 内存(后备存储)长期知识库/文档对象存储(S3)或分布式文件系统延迟>100ms,仅作为RAG检索源。
新增关键层:投机预取草稿缓存(Draft Cache)GPU SRAM / 小模型权重用于推测解码(Speculative Decoding),即AI时代的"分支预测器”,用于掩盖推理延迟。
2026新增层:分布式KV Cache池跨实例共享的KV CacheDRAM + SSD池 + RDMA网络Mooncake Store / LMCache提供的三级解耦存储。

架构准则:OS的职责是预取(Prefetch)换入换出(Swap)。当Agent发出Tool Call时,其L0级的KV Cache必须立即**Checkout(换出)**至L1或磁盘,以释放宝贵的HBM资源。

2025年NeurIPS最佳论文HiFC将这一准则推向了物理极限。HiFC摒弃了DRAM中转,通过GPU Direct Storage(GDS)直接在GPU HBM和NVMe SSD的pseudo-SLC区域之间传输KV Cache页,实现4.7 GiB/s的持续吞吐,使SSD级换入换出的性能逼近DRAM方案。这意味着L2层的延迟边界正在被物理层创新大幅压缩。

2026年的产业实践更进一步:vLLM V1引擎默认采用recompute策略(重算而非swap),因为prefill阶段可以高度并行化,重算256个token的KV Cache比从CPU DRAM swap回来更快。但对于长上下文场景,Mooncake的分布式KV Cache池通过RDMA网络实现了跨实例的KV Cache共享——prefill实例计算KV Cache后,通过Transfer Engine传输到decode实例,延迟低至网络往返级别。NetKV(2026年6月)进一步引入了网络拓扑感知的解码实例选择,在64-GPU fat-tree拓扑上将平均TTFT降低21.2%。

MemGPT(Packer et al., 2023,现Letta公司)在概念层率先提出了"虚拟上下文管理"——将OS的虚拟内存分页模型映射到LLM上下文管理:main context对应RAM,external context对应磁盘,virtual context对应虚拟内存。2026年Letta进一步将这一理念发展为"上下文工程"(Context Engineering),提出agent记忆不是存储问题而是上下文管理问题,并引入了基于git的上下文版本控制(Context Repositories)。


三、 I/O与系统调用(MCP)的异步化重构

MCP(Model Context Protocol)在概念上可类比为AI时代的System Call,但在调用模式上必须彻底重构:

  • 旧范式(同步阻塞):推理 → 调用MCP → 等待返回 → 继续推理(错误:GPU闲置)。
  • 新范式(异步非阻塞 + DMA类比)
    1. 推理舱发出MCP请求(如查数据库)。
    2. **调度器立即挂起(Suspend)**该推理舱,保存KV Cache检查点(Checkpoint),释放GPU。
    3. MCP执行引擎(类比DMA控制器)在后台异步搬运数据。
    4. 调度器切换至另一个就绪的推理舱,填充GPU的Continuous Batching空洞。
    5. 当MCP完成,通过**事件中断(Event Callback)**通知调度器,调度器恢复(Resume)原推理舱。

工程结论:MCP不是System Call(抢占内核态),而是AIO(异步I/O) + 中断处理。Agent Runtime必须内置Event Loop(事件循环)

MCP自2024年11月由Anthropic发布后,到2026年已成为事实标准。2026年4月,AAIF在纽约举办了MCP Dev Summit北美站,约1200人参会。Salesforce的Headless 360平台通过MCP路由客户和Agent交互,到5月已处理450万次MCP调用。OpenAI、Google、Microsoft均已采纳MCP作为Agent与外部工具通信的标准协议。

但MCP当前的设计存在一个关键缺陷:它是为同步调用模式设计的。MCP规范没有协议级session概念,服务器不能依赖隐式的逐连接状态来关联连续的tool call。这意味着当前的MCP调用是阻塞式的——Agent发出tool call后,必须等待结果返回才能继续推理,GPU在此期间闲置。

这正是本文提出的异步化重构的核心价值所在。MCP Gateway应作为独立的异步I/O子系统存在,与推理调度内核解耦。当Agent发出MCP请求时,调度器不应等待——而应挂起该推理舱,切换到下一个就绪的推理舱。MCP完成时通过事件回调通知调度器恢复。这一设计与操作系统中的AIO(异步I/O)+ 中断处理机制高度同构。


四、 工作流编排:宏观确定性DAG + 微观不确定性图

“Reasoning Graph"取代DAG在单一Agent内部是成立的,但在分布式容错系统中不可行(无法做死锁检测和幂等重试)。

架构修正:双层编排模型

  1. 宏观层(编排层 - 确定性)

    • 使用**严格的DAG(有向无环图)**定义业务阶段(如:数据清洗 → 特征提取 → 多路推理 → 裁决聚合)。
    • DAG保证每个节点的幂等性可重试性,是分布式系统稳定性的基石。
    • Temporal框架在2026年已成为这一层的事实标准。其核心洞见:将编排代码(确定性,在Temporal worker上执行,定义workflow逻辑)与活动代码(非确定性,执行LLM调用、外部API调用)分离。Temporal通过事件历史重放编排代码来恢复故障后的状态——只有活动重新执行。2025年Temporal发布了OpenAI Agents SDK集成,进一步降低了门槛。
    • LangGraph则采用另一种路径:将Agent建模为显式状态图,节点和边直接映射Agent的推理过程。2026年LangGraph与Temporal的争论核心在于——编排逻辑是否应该对非确定性LLM行为透明。
  2. 微观层(执行层 - 非确定性)

    • 仅在单个DAG节点内部,允许Agent进行无限次数的"推理心跳”(Reflection / Self-Correction / Re-Retry)。
    • 节点内部是一个概率性状态机(Probabilistic State Machine),直到其输出的置信度(Confidence)达标,或者迭代次数耗尽,才将控制权交还给宏观DAG。

2026年产业界的共识正在向这一双层模型收敛。Temporal的技术博客明确指出:Workflow代码必须确定性,但AI Agent可以基于非确定性的LLM输出做决策——关键区分是编排层确定、执行层不确定。这恰恰是"宏观确定性DAG + 微观不确定性图"的工程映射。


五、 事务与一致性:基于"置信度"的MVCC(多版本并发控制)

传统数据库Commit的是数据状态;AI系统Commit的必须是**“推理结果的有效性”**。

  • 读阶段:推理舱读取Context和Memory,生成推理结果与置信度分数(Confidence Score)
  • 决策阶段
    • 若置信度 ≥ 阈值(如0.85):Commit。将本次修改的Memory持久化,输出最终Action。
    • 若置信度 < 阈值:触发软回滚(Soft Rollback)。丢弃本轮生成的KV Cache,恢复至上一次Checkpoint,尝试调整Prompt或Temperature重新推理(Retry)。
    • 若Retry超过最大次数:触发硬回滚(Hard Rollback),标记该DAG节点失败,由宏观编排引擎执行补偿事务(Compensation)。

工程意义:未来的AI OS内核必须内置**“置信度门控(Confidence Gate)”**,这是区别于传统OS最显著的标志。

2026年的学术界正在为这一设计奠定理论基础。ICML 2026接收了"Agentic Confidence Calibration"论文(Zhang et al.),系统性地研究了LLM Agent在工具调用场景下的置信度校准问题。同期还有多项关键工作:

  • ReDAct(arXiv:2604.07036, 2026年4月)提出了不确定性感知的延迟策略:Agent配备小模型和大模型,用小模型的不确定性信号决定何时升级到大模型。在ALFWorld和MiniGrid基准上,仅延迟15%的决策到大模型即可匹配大模型的完整性能。这直接验证了"置信度门控"的工程价值——不是每次推理都需要同等算力。

  • UALA框架(Uncertainty-Aware Language Agent)将不确定性量化与Agent-外部世界的交互编排在一起,研究表明不确定性感知的Agent调度相比Agent微调有更大的潜力。

  • “Confidence Laundering in Agent Systems”(Shi et al., 2026)提出了"潜在不确定性载体"的概念,指出Agent多步决策中的不确定性需要在决策交接时显式传递,而非逐步估算。这与本文的MVCC模型中"置信度作为Commit门控"的设计高度契合。

然而,2025年的实证研究也揭示了一个严峻现实:RLHF训练的大模型在知识密集任务上的期望校准误差(ECE)可达0.30以上——即模型自报的置信度比实际准确率高出30个百分点。这意味着"置信度门控"不能仅依赖模型的口述置信度,而需要外部不确定性量化方法(如语义熵、一致性投票)作为独立校验信号。


六、 最终体系栈总结(六层物理架构)

基于上述修正,未来的AI原生计算栈应定义为:

层级功能描述关键组件/技术
1. 业务应用层业务逻辑与用户体验前端、业务API
2. 宏观编排引擎确定性DAG调度、容错、幂等重试Temporal / LangGraph / Workflow-as-Code
3. Agent运行时(微内核)管理Agent生命周期、Memory挂起/恢复、事件循环AIOS Kernel / Letta Agent Runtime / 自研State Manager
4. 推理调度内核(核心)Continuous Batching管理、Token时间片分配、KV Cache换入换出vLLM V1 / SGLang / TensorRT-LLM + Sarathi-Serve调度器
5. 异步I/O子系统MCP异步执行、外部工具调用、中断回调MCP Gateway + Event Broker(待建设)
6. 加速器硬件层GPU/NPU算力供给、HBM显存管理、RDMA网络CUDA / ROCm / NPU + Mooncake Transfer Engine + NVMe pSLC

AIOS(COLM 2025正式接收)为第3层提供了学术原型:其内核包含调度器、上下文管理器、内存管理器、存储管理器、工具管理器和访问管理器六个模块,在Agent应用层和底层LLM/工具提供者之间充当抽象层。实验显示AIOS可使不同框架构建的Agent执行速度提升2.1倍。2026年AIOS进一步扩展了Tool Manager模块,引入虚拟机控制器和MCP Server,为计算机使用Agent创建沙盒环境。

但AIOS尚未解决第4层和第5层的深度耦合——这正是本文提出的异步双核模型的核心贡献。第4层(推理调度内核)和第5层(异步I/O子系统)必须是物理隔离的两个子系统,通过事件循环而非同步调用耦合。当前vLLM和SGLang已在第4层建立了坚实的工程基础,但第5层的MCP Gateway + Event Broker仍是产业空白。


七、 2026年技术验证矩阵

以下是本文架构主张与2026年最新技术实践的映射验证:

架构主张验证技术来源关键数据
物理原子=Forward PassContinuous Batching + PagedAttentionvLLM (SOSP 2023)内存浪费从60-80%降至<4%
Token Time-Slice调度Sarathi-Serve chunked-prefillsOSDI 20242.6x服务容量提升
KV Cache可换出至L1PagedAttention swap/recomputevLLM V1recompute比swap更快(256 tokens)
KV Cache可跨实例共享Mooncake分布式KV Cache池FAST 2025 Best Paper525%吞吐提升
L2层可压缩至SSDHiFC GPU-to-SSD direct transferNeurIPS 20254.7 GiB/s持续吞吐
前缀复用降低TTFTRadixAttention基数树SGLang (LMSYS, 2024)60%+前缀重叠时75-95%命中率
Prefill/Decode物理分离DistServe + SplitwiseOSDI/ISCA 20247.4x请求量, 12.6x SLO达标
网络感知的解码调度NetKV拓扑感知路由arXiv:2606.03910, 202664-GPU拓扑TTFT降21.2%
推测解码=分支预测EAGLE-3 / Speculative DecodingNVIDIA, vLLM, 20262-4x加速, 接受率>80%
虚拟上下文管理MemGPT / LettaUC Berkeley, 2023→2026无限上下文幻觉的分页实现
置信度门控ReDAct不确定性延迟arXiv:2604.07036, 202615%延迟即匹配大模型性能
确定性DAG编排Temporal workflow replayTemporal, 2026故障后通过事件重放恢复状态
Agent OS内核AIOS六模块内核COLM 20252.1x Agent执行加速

结语

这份概论旨在纠正一个危险的工程倾向:切勿将AI Agent设计为"长事务独占GPU"的怪物

真正的AI原生操作系统,其设计哲学应遵循:

“推理(Forward)是昂贵的、不可抢占的物理心跳;但Agent整体必须是廉价的、可挂起(Suspendable)的逻辑协程。”

以**异步(Async)为血脉,以连续批处理(Batching)为心脏,以置信度(Confidence)**为灵魂——这才是能够承载万亿级Token调用的未来体系架构。

2026年的技术图景已经为此提供了强有力的验证:Mooncake证明了KV Cache可以像虚拟内存页一样在分布式池中流转;Sarathi-Serve证明了prefill和decode可以在同一Forward中混合编排;HiFC证明了SSD可以成为KV Cache的有效扩展层;ReDAct证明了置信度门控可以在不损失质量的前提下大幅降低算力消耗。缺失的一环——第5层的MCP异步I/O子系统——是下一个值得投入的工程前沿。

“推理即心跳"定义了灵魂,而上述分层定义了承载灵魂的血肉与骨架。