2026 年 8 月 4 日,硅谷101 播了一期对谈,嘉宾是盛颖。节目页给的头衔有三个:开源推理引擎 SGLang 的发起人、xAI 前推理团队负责人、RadixArk 联合创始人兼 CEO。这期还有一份近四万字的文字稿,发在硅谷101 的头条号上,本文引用的原话都出自那里。
她现在的公司拿了 1 亿美元种子轮,估值 4 亿美元。访谈里更耐看的是另外一部分:她怎么从九江走到斯坦福,为什么愿意把代码放出去,以及她怎么讲那些平时没人摆到台面上说的事。这几段放在一起,背后有一条共同的判据,她要把「对不对」从感觉变成可验证的东西:数学用证明,系统用指标,组织用规则。
落到产品上,SGLang 回答的是一个很实际的问题:同一批卡,做同一件事,凭什么有的团队能多跑出几倍的量。
1. 来路
1.1 九江、上海,和一笔违约金
盛颖是江西九江人,中学读九江一中。当地公众号说她 2011 年拿过全国信息学奥赛银牌,是江西二十多年里第一个拿到这个成绩的选手。这个细节我只找到二手转述,官方获奖名单没查到。她本科在上海交大 ACM 班,之后去哥伦比亚大学读硕士,再到斯坦福读博士。
本科毕业那年,申请不顺。美国学校一直没有消息,她先接了香港中文大学的博士录取。双方有个君子协议,截止到 4 月 15 日,就在截止第二天,哥伦比亚大学发来一封很普通的硕士录取通知。她打电话回家问父亲,能不能毁掉前面那份博士录取,毁约要交一笔违约金。父亲想了不到一分钟,说「好,你去」。访谈章节里反复出现的「违约金」,说的就是这件事。
1.2 纽约与斯坦福:从理论到形式化验证
纽约那几年她过得放松。用她的话说,没有人盯着她看,没有人在乎她穿什么、想什么,也不需要评判别人。哥大硕士期间她做理论,方向是测试函数和线性回归的数学性质,一度想过以后去做数学。
到斯坦福读博,导师配得并不顺。博士有轮转机制,前几轮都没匹配上,第四轮才遇到 Clark Barrett,方向是形式化验证:把人写的代码映射到底层数学逻辑,再用 SMT 求解器证明代码满足规范。她的工作在求解器本身,跟效率、正确性、语义定义都有关系。后来她解释自己为什么适合做 infra,给的理由是数学和代码这两件事她都很熟。
| 时间 | 论文 | 做的事 |
|---|---|---|
| 2020 年 4 月 | Politeness for the Theory of Algebraic Datatypes | 证明代数数据类型的 SMT 理论能和其他理论组合 |
| 2022 年 5 月 | Reasoning About Vectors using an SMT Theory of Sequences | IJCAR 2022,用序列理论给向量程序建模 |
| 2023 年 3 月 | FlexGen | 单张 16GB 显卡跑 OPT-175B,吞吐第一次到 1 token/s |
| 2023 年 11 月 | S-LoRA | 统一分页加定制 kernel,一张卡服务上千个 LoRA 适配器 |
| 2023 年 12 月 | SGLang | RadixAttention 加压缩有限状态机,吞吐最高提升 6.4 倍 |
| 2023 年 12 月 | Fairness in Serving Large Language Models | 用虚拟 token 计数器 VTC 定义请求排队的公平 |
1.3 纸面上的三年,和每年九个月的空窗
这份清单看着密,她自己的账本不是这样。三篇论文分布在三年里,每篇真正推下去只花了三个月,剩下九个月她不知道自己在做什么。第一篇论文之后她进入过一年左右的低谷,赶上疫情,几乎没做事,回国待了半年。那段时间 Clark Barrett 没给产出压力,也没断过经费。2022 年那篇序列理论的论文,证明写了 20 多页,中途两次全部推翻重写,因为开头的基点错了,后面所有推理都得跟着重推。也是在这段时间,她靠 ADHD 这件事理解了自己,结论是不要逆着天性做事。
探索期本来就不产生结论,用产出数量去衡量它,得到的自我评价一定是错的。
1.4 从 Two Sigma 到 xAI
之后的职业路线走得比较杂。哥大毕业那年,她在 Two Sigma 待了半年,那段经历让她第一次看到一家组织良好的公司长什么样:业务稳定,变化少,工程师可以长期做维护。2022 年暑假她去谷歌实习,做 AI for code。她本来就想转 AI,试过几个纯 AI 岗位都没拿到机会,最后靠程序分析的背景进了这个组,实习结束时的判断是大模型已经把传统程序分析那套技术覆盖掉了。
博士毕业前后她去了 Databricks,待了 5 个月,想给 SGLang 找个能安心开发的地方,这次尝试不成功。她的复盘是,刚毕业的研究员在成熟公司里没有多少权力,她也不知道怎么在成熟企业里推动一个大项目。
2024 年 10 月她加入 xAI,和丈夫 Lianmin Zheng 一起从零搭推理技术栈。xAI 给了她两样东西,support 和 freedom,她说这两样同时出现的只有 xAI。她在那里还学到一句话,两位联合创始人 Tony Wu 和 Guodong Zhang 分别跟她说过:authority 和 responsibility 要匹配。她在 xAI 只有很小的权力,所以也负不了更大的责任。
2025 年她离开 xAI,创办 RadixArk。xAI 的股权有一年 cliff,她走的时候待了 10 个月,再等两个月就能拿到第一年兑现。她说等不了了,5 月就已经受不了,撑到 7 月。钱对她「有必须性,没有重要性」。
选机会的时候,支持和自由度是可以分开看的两个变量,只有其中一个,事情大概率做不成。这也是她那句话的另一面:想让别人对结果负责,先得把对应的决定权交出去。
2. 开源、平权,和要被解释的赢
2.1 被陌生人教会的编程
她做开源的理由和别人不太一样,因为她是被互联网上的陌生人教会的。江西那时的编程资源很少,她能找到的教材大多来自随机的帖子、博客、CSDN 和在线评测网站。教她的人在世界上的哪个地方,她不知道,她只是把代码拿走、回家研究。用她的话说,自己是被这样一群人养起来的,所以分享对她像空气一样自然,有想法、做了东西不分享才奇怪。
2.2 开源的两个面,和引擎的归属
她对开源生态的判断分两面。愿意开源的人越来越多,资本也开始认可开源,这是好的一面;追捧里混进了功利主义者,这些人会破坏开源原本让人相信的东西,还会让本来不功利的人分不清哪些是纯粹的、哪些不是。开闭源问题上她不站队,认为两种模式会共存,也不认为所有东西都该开源,完全放开会把人性里的恶放大。她真正反对的是中心化:希望闭源模型存在,但不希望它集中在少数人手里,做法是提供一套能造出最好闭源模型的工具链。
SGLang 不属于 RadixArk,它在 LMSYS 和社区手里。RadixArk 的贡献全部开源,公司没有私有分支。她说过公司的命脉不在引擎的差异化上,所以引擎可以被所有人用,包括潜在的竞争对手。这个安排有实际好处,判断引擎该往哪里优化时,不需要先考虑会不会削弱自家产品的壁垒。
2.3 平权,和那些要被解释的赢
LMSYS 的组织方式也和她的经历有关。她说 LMSYS 想孵化那些没有背景、没有品牌的团队做的项目,把功劳分给真正做事的人,保护还没建立声望的开发者对项目的掌控权。这个动机来自她自己的体会:同样一个人,在低谷期和高峰期做出来的东西质量可能差不多,被看到、被记住的程度差很多。
她讲性别歧视的时候先加了个限定:学界可能都还没到「不平等」的程度,但很多微妙的意识层面的不对称无处不在。例子是竞赛。她从小竞赛打得好,如果她是男生,别人会说他是个天才;她是女生,别人夸她努力、听话、用功,或者说她运气好。那一年的成绩,她比同校同龄人好很多,身边的人却找出一堆理由解释她为什么好,因为在他们眼里她赢是不应当的。她的总结是,一个人赢本来不需要解释,但她的每一场赢都要被解释,解释的永远是她为什么赢,而不是对手为什么输。
这些解释没有恶意,但让人窒息。到了读博士、做项目的阶段,类似的模式还在继续,合作方是男性或者已经成名的人,就有人怀疑这个想法是不是她的。单个例子拎出来都很小,真实的影响要把那件小事乘上一亿倍,再放大到整个群体。她的个人答案很直接,让女性真正拥有权力,进入能做决定的圈层;至于制度层面,她承认这是结构性问题,一个人改变不了,但如果能改变 1%,她愿意用一生去改变这 1%。
评审和署名跟着贡献走,而不是跟着声望走,这一条在团队里可以直接执行。她描述的那些不对称,很大一部分就是归属被声望劫持之后的结果。
3. SGLang 的设计:前端一门语言,后端一棵树
SGLang 的全名是 Structured Generation Language,结构化生成语言。它一开始不是引擎,而是一门用来写大模型程序的编程语言,外加配套的运行时。2023 年那篇论文的出发点很具体:当时的应用已经开始把多次生成调用、提示技巧、控制流、外部工具调用和结构化输出串在一起,但没有一套系统专门为这类程序做优化。
1 | ┌─ SGLang 的分层 |
3.1 前端:一门嵌在 Python 里的语言
前端是一套嵌在 Python 里的 DSL。你可以用 fork 开并行分支,用 gen 发起一次生成并把结果存进变量,用 choices 约束输出的可选项,最后用 run 把整个函数跑起来。这段程序可以解释执行,也可以先被追踪成数据流图,再用编译器模式跑,后面这条路给指令选择、代码搬移、自动调参留了空间。文档里的例子是一个作文评审函数:把文章按多个维度拆开并行评价,再合并结果给出总评。这个语言的后端不限于本地模型,也可以接 OpenAI、Anthropic、Gemini。她说这门语言最初想解决的,是人和 AI 之间那个交互界面,后来后端的挑战更突出,开发精力才大量转移到运行时;她自己认为,这个方向以后还会被重新捡起来。
3.2 后端:RadixAttention 与一棵基数树
SGLang 最有名的部分是后端,核心叫 RadixAttention。
大模型解码时,每一层都会把历史 token 映射成 Key 和 Value 张量,也就是 KV cache。同一段文字如果被反复送进模型,这段 KV cache 每次都要重算。复杂程序里这种重复到处都是:少样本示例、自洽采样里的同一个问题、多轮对话的历史、思维树里的搜索记录,都是可以共享的前缀。
RadixAttention 的做法是别把算完的 KV cache 扔掉。它把 prompt 和生成结果一起留在基数树里,树上每个节点对应一段 token 序列,值是对应的 KV cache 张量,张量在显存里按分页布局存放,一页等于一个 token。树的结构放在 CPU,维护开销很小。请求进来时,前端把完整 prompt 交给运行时,运行时自己做前缀匹配、复用和缓存,不需要用户手动配置。显存不够时按最近最少使用淘汰,从叶子节点往上递归回收,同时有缓存感知的调度策略把前缀相同的请求排在一起,提高命中率。这套机制和连续批处理、PagedAttention 兼容,多模态模型里的图像 token 也能接进同一棵树。
1 | ┌─ 一次请求走完一遍缓存 |
她的讲法比论文更直白。请求进来先对前缀关系建索引,算好的 KV cache 存在内存池里,再把索引和内存池映射起来。剩下的问题就是调度:能不能把前缀相近的请求安排在一起,显存不够时淘汰谁,下一个请求该发到哪张卡上。缓存存着却命不中,是这类系统最常见的浪费。
3.3 结构化输出:把语法编译成状态机
论文里和 RadixAttention 并列的另一项优化是结构化输出。JSON、正则、语法这类约束会被编译成压缩后的有限状态机,解码时按状态机排除不合法的 token,不必每生成一个字都把完整语法比对一遍。它和缓存复用解决的是同一类毛病,都是重复劳动。
4. 这套机制什么时候划算,代价是什么
4.1 收益,以及这些数字的适用条件
先说收益。它换来的是更高的吞吐和更低的首 token 延迟。论文在 Llama-7B(单张 A10G)和 Mixtral-8x7B(8 张 A10G)上测了九类负载,包括 5-shot MMLU、20-shot HellaSwag、ReAct Agent、思维树、JSON 抽取、长短对话、DSPy 的 RAG 管线,以及 LLaVA 的多模态任务,对比 vLLM、Guidance、Hugging Face TGI,吞吐最高提升 5 倍;同一批作者的论文里这个数字是 6.4 倍,两版的基线不完全一样。这些数字要连着实验条件看:2024 年初的测试,A10G 的卡,7B 到 8x7B 量级的模型,跟今天线上跑几百 B 模型不是一回事。消融实验还发现,一次缓存都没命中的时候,这套机制的额外开销可以忽略,所以他们干脆默认打开。
4.2 边界与代价
再说哪些负载划算。系统提示词、工具描述、检索到的文档在多轮之间会被反复重发,所以多轮对话和 Agent 工作流里,前缀缓存的收益最大;一次性长文档摘要、创意写作这类请求之间没有公共前缀,收益有限。她对后者的回应是,只要进入多轮,后面的对话必然复用前面的历史,所以复杂场景里几乎总有前缀可以共享。
代价有两处。一是显存,KV cache 存下来就不会立刻释放,上下文一长、并发一高,显存会先成为瓶颈,这也是淘汰策略必须存在的原因。二是调度,缓存存着不等于命中,请求得被安排到存着这段前缀的实例上,引擎为此要做缓存感知的调度和路由,复杂度从使用方转移到了引擎内部。
4.3 优势的时效性
优势也不是永久的。vLLM 靠 PagedAttention 起家,把操作系统的分页思路搬到了 KV cache 上,强调通用部署;SGLang 从执行流程出发,强调计算复用和系统级协同。她把时间维度放进来讲这件事:好东西一定会互相学习,两个项目最后的形态会趋同,眼下的差别是阶段性的侧重,SGLang 更早做大规模服务,vLLM 更早在社区覆盖和长尾模型上铺开。这两篇奠基论文她都署了名,PagedAttention 她排在第四位,SGLang 她排在最后并标了星号。
5. SGLang 现在在解决什么
两年前的那篇论文解决的是前缀复用,现在的 SGLang 要处理的是模型架构本身的碎片化。
5.1 混合注意力下的统一前缀缓存
混合注意力是眼下最麻烦的一件事。全注意力需要沿匹配到的前缀保留完整 KV;滑动窗口注意力需要复用边界之前的连续窗口;MAMBA 这类状态空间模型则需要边界处的一份循环状态快照。三种结构的复用规则不同,传统那棵为全注意力设计的基数树装不下。SGLang 的做法是统一前缀缓存,一棵树、每个组件一个槽位,让同一段前缀在 GPU 显存、主机内存和外部存储三级之间保持同一套身份。公开的测试里,带 Mooncake 三级存储的多轮对话命中率接近 98%,会话感知的淘汰策略把 SWE-bench 的首 token 延迟最多压低 16.6%,用 Rust 重写的树核心把滑动窗口场景的首 token 延迟最多压低 42%。
5.2 kernel 与 day-0
另一条线是 kernel 和执行的衔接。Breakable CUDA Graph 解决图捕获和动态控制流打架的问题,官方记录是图构建快 5 倍、prefill 快 1.93 倍。DeepSeek-V4.1 Flash 的 day-0 支持更像一份工程日志:4 张 GB300、batch size 为 1 的纯解码,从第一版能跑通的 35 tokens/s 一路优化到 873 tokens/s,手段包括 MXFP8 GEMM、算子融合、把 MoE 切成 TP4 并补 padding、打开投机采样并优化验证环节。很多底层的算子实现基本重写,因为这一代模型的架构和之前的差别太大。
她对 day-0 的解释很务实:这件事重要,是市场觉得它重要。用户希望新东西第一天就能用上,这个愿望从用户传到推理服务商,再传到引擎团队,最后传到模型厂商。开源项目哪些事重要,不完全由自己定义。
5.3 调度:把等待消掉
调度这块的演进方向就是把等待消掉。最早的推理引擎是排队制,一个请求算完再算下一个;后来改成凑一批一起算;现在主流是连续批处理,算完的请求立刻下车,新请求随时上车,硅谷101 的稿子给的量级是吞吐提升 2 到 4 倍。再往下是读题和答题的分工:prefill 阶段处理整段输入,吃的是算力;decode 阶段一个字一个字往外蹦,吃的是显存带宽。把这两个阶段拆到不同的卡上,也就是业内说的 PD 分离,各自配硬件,中间通过高速网络传结果,SGLang 是最早支持大规模分离部署的引擎之一。投机采样走的是另一条路,先让小模型猜几个 token,大模型一次性验证,猜对了就一次生成多个字,最好情况下能把生成速度提到 2 到 3 倍。
5.4 硬件、规模与 Miles
硬件侧的位置也在变。朱邦华在硅谷101 的视频里说,新的 GPU 发布时,厂商会公布它在 SGLang 上的性能表现,SGLang 团队也几乎在同一时间完成支持,引擎慢慢变成了硬件评测的基准之一。这件事对 AI Infra 的意义在于,推理引擎正在变成模型和芯片之间的通用层:同一套框架能跑在英伟达、AMD 以及更多新兴芯片上,模型换硬件时不需要重写上层。
仓库的体量也能说明它现在的使用范围。2024 年 1 月 8 日创建,Apache-2.0 协议,目前 3.6 万 star。RadixArk 的融资公告里写着,SGLang 每天为 Google、微软、英伟达、Oracle、AMD、LinkedIn、xAI、Thinking Machines Lab 等公司处理数万亿 token。
推理之外还有 Miles,2026 年 8 月发布 v0.1 的强化学习框架。这两件事的关系比看上去近,因为强化学习里很大一部分挑战来自奖励引擎,而奖励引擎本身就是推理引擎。SGLang 在推理端产出样本,Miles 在训练端更新权重,新权重再回到下一轮生成。系统层面的重叠让它们可以共享相当多的实现。
6. AI Infra 的四层结构
6.1 一种拆法:从电到调度
AI Infra 是个很宽的概念。硅谷101 在那期视频的文字稿里把它拆成四层,这是个方便讲清楚的人为切分,不是行业标准;那期嘉宾来自 RadixArk,他们判断哪一层更值得投入时带着自己的立场,看的时候要把这层算进去。四层大致是:
- 能源:电和散热,决定 GPU 能不能持续稳定地跑
- 硬件:GPU、HBM、NVLink、InfiniBand,决定算力的理论上限
- 系统软件:CUDA、编译器、通信库、算子库,决定一次计算能不能贴着硬件的物理极限
- 服务编排:推理引擎、请求调度、资源管理,决定哪些任务先跑、哪些计算能合并
1 | ┌─ 一条推理请求要穿过的四层 |
6.2 GPU 为什么会空转
后两层为什么值得投入人力,有一篇可以直接查到的论文,我把硅谷101 的说法和原文对了一遍。CMU 的 The Energy Cost of Execution-Idle in GPU Clusters 从 2026 年 2 月起对某学术集群做了 31 天逐秒遥测,覆盖六代共 756 块 GPU,从 A6000 到 B200。他们把「GPU 已经分配出去、程序也已经加载,但可见活动接近零」的状态命名为 execution-idle,测出来它占执行时间的 19.7%、能耗的 10.7%;在线推理最吃亏,61% 的执行时间和 48% 的能耗都落在这种状态里。论文还用公开的工业 trace 做了 30 分钟回放,模型是 Llama-13B,卡是单张 L40S,Azure Code 那组是 76% 的时间和 65% 的能耗,BurstGPT 的 Chat 流量是 72% 和 52%。硅谷101 说的「Azure Code 65%、OpenAI Chat 52%」就是这两组数,量级对得上,区别是它们来自回放实验,不是生产集群的实测。
GB200 那笔账是陈震林在视频里算的:一台 GB200 NVL72 机柜,软件栈没做好调度和优化,实际利用率可能只有 50%,等于一半的投入没换成算力。他给的采购价是 400 万美元,这个数字我没有找到对应的报价来源。可比的一手拆解里,GB300 机柜的 ODM 采购成本被估到约 399 万美元,所以 GB200 报 400 万偏高。利用率那部分倒是行业里反复出现的现象,跟上面那篇论文讲的是同一件事。
6.3 这门生意长什么样
把优化空间翻译成工程问题,要回答的就是四句话:哪些计算不用重新做,哪些等待可以消除,哪些算力没有吃满,哪些资源各自为战。vLLM 和 SGLang 都在回答这四个问题。
她对竞争格局的判断是「这个游戏里面没有输家」。推理市场一直在长,Fireworks、Together 这些公司做了好几年,新的推理公司还在不停出现,但没有谁因为竞争消失。节目里提到,vLLM 团队商业化成立的 Inferact 拿了 1.5 亿美元融资、估值 8 亿美元,Baseten、Fireworks、Together 也都在大额融资,云厂商同时在提供托管推理。Inferact 那组数字跟财联社、机器之心等媒体 2026 年 1 月的报道一致。她看到的两个趋势是投入从训练转向推理,以及推理公司往强化学习扩张。
RadixArk 刻意避开了这条赛道。她说 SGLang 属于社区,公司不靠引擎的差异化赚钱,命脉也不在推理这里,推理只是起点。客户倒是分得很直白:数据中心、新云和超大规模云服务商,推理服务商,用 AI 训练或部署模型的 AI 公司,以及想用 AI 改造原有业务的传统企业。
7. 关于「要相信」
节目最后她讲了自己怎么面对那些不讲逻辑的事,这段最容易被当成鸡汤,但她的说法很具体。
她复盘了三段波折:读博前几年找导师不顺,融资过程曲折,开源项目做起来也被打击过,而这三段的终点都很好。她找到了教科书般的导师,组起了有热情又团结的团队,最后进来的投资人也是她理想中的那种关系。刚出来融资的时候,她连 term sheet、估值、种子轮、pitch deck 是什么都不知道,只能从书里现学,而书里写的创始人和投资人关系过于美好。结果她真的遇到了那一版关系。
她的结论是那些美好的描述都没有骗人,纯粹的好导师、好投资人、好采访者都存在。问题在于大多数人没有坚持到把那个跌宕的过程走完,就在中间开始怀疑、放弃,或者不再相信。她说,你要相信到你身边没有这样的人你还相信他,然后有一天,那个跟你一样相信的人会跟你相遇。
支撑这句话的不是心态,是正反馈。她第一次等几个月就被验证,下一次等几年又被验证,再下一次等了 10 年还是被验证,所以后面她能等得越来越久。她也承认很多人没有见过这种正反馈,不能要求所有人都坚持。
她说自己是很情绪化的人,很多微小的事都会造成很大的情绪波动,但她把情绪和价值观分开了:看到不想看到的事情发生会不高兴,这不会让她认为那是正常的。她接受割裂,哪怕整个人生都是割裂的,也不打算妥协。结尾她补了一句限定,没有绝对的正确,她也不宣称自己是正确的人,唯一重要的是你是在按自己的想法认知和行动,还是被别人牵着走。
8. 参考
- 硅谷101 · 对话盛颖(访谈全文) · 四万字文字稿,本文引用的经历、开源立场与性别相关表述均出自这里
- 硅谷101 · E247 节目页 · 官方简介、章节时间轴与嘉宾头衔
- 硅谷101 公众号 · 榨出硅的极限 · 「四层架构」拆法与 GB200 机柜的账都出自这里,属于编辑口径与嘉宾估算
- The Energy Cost of Execution-Idle in GPU Clusters · CMU 对 756 块 GPU 的 31 天遥测,execution-idle 占执行时间 19.7%、能耗 10.7%,以及各条工业 trace 的回放结果
- LMSYS · SGLang 首发博文 · RadixAttention 的机制、前端原语与 5 倍吞吐的基准测试
- SGLang 论文 · 压缩有限状态机、6.4 倍吞吐与作者署名
- SGLang 博客 · Unified Radix Cache · 混合注意力下的统一前缀缓存与三级存储命中率
- SGLang 博客 · DeepSeek-V4.1 Flash · 4 张 GB300 上从 35 到 873 tokens/s 的优化记录
- sgl-project/sglang · Apache-2.0 协议、仓库创建时间与 star 数
- B 站 · 对话盛颖视频版 · 附精校字幕;AI Infra 技术对谈 是配套视频
- RadixArk 官网、1 亿美元种子轮公告 · 使命陈述、投后估值与客户名单
- FlexGen、S-LoRA、Fairness in Serving Large Language Models · 单卡跑 175B、多 LoRA 并发服务、VTC 公平调度
- Politeness for the Theory of Algebraic Datatypes、Reasoning About Vectors using an SMT Theory of Sequences · 形式化验证阶段的两篇论文
- LMSYS 官方 About · 非营利身份、officer 与顾问名单、2023 年的多校起源
- 公众号「江西人在北京」 · 九江一中与 2011 年信息学奥赛银牌的说法,只找到这一处转述,官方获奖名单未找到