快一点!再快一点!快到世界能实时生成|和生数科技张金涛聊:Vidu S1、推理加速、实时交互视频

快一点!再快一点!快到世界能实时生成|和生数科技张金涛聊:Vidu S1、推理加速、实时交互视频

July 19, 2026 · 41 min

About this episode

本期节目探讨了推理加速技术及其在实时交互视频中的应用,特别是Vidu S1模型的创新与挑战。

🚥 没人喜欢等待。 模型越强,推理加速就越重要。 这一期,我们聊「推理加速」。 本周「十字路口」的嘉宾是生数科技的张金涛。 月初,他带队发布了 Vidu S1——一个实时交互视频模型:上传一张照片,无论是人物、动漫角色,还是一只宠物,都能变成一个可以和你实时视频通话的 AI 角色。 Vidu S1 很快,快到生成速度超过播放速度,并且支持无限时长。这是怎么做到的? 金涛在播客中分享了自己这几年一条清晰的技术主线:从 SageAttention(GitHub 3.5K 星标)、TurboDiffusion(GitHub 3.6K 星标),到 TurboServe——一整套系统级方案,为 S1 实时交互提供底层支撑。 此外,金涛也分享了他对整个 AI「推理加速」领域的观察和判断。 其实这期有意思的,不只是技术。 金涛今年 26 岁,还是清华在读博士。真正把他带进「推理加速」的,是一个很朴素的判断——当大家都默认 FlashAttention 已经把 Attention 算子做到极致时,他却发现:显卡上明明还有更快的计算单元没被用起来 ——「这么明显的收益,为什么没人做?」 所以这期节目,你也可以把它当成一份「年轻研究者样本」来听:在变化极快的 AI 领域,怎么找到自己的方向、怎么判断什么才是「最正确的事」,又怎么把它一路做到最前沿。 🎬 我们的视频播客将同步上线于 @Koji杨远骋 的视频号、 抖音 、 小红书 、 哔哩哔哩 、 Youtube 等平台。 📒 文字版将发布于 @十字路口Crossing 公众号。 🟢 01:40 快问快答: 年龄、毕业院校、MBTI 与星座、Vidu S1,以及在生数科技负责的工作 🟢 02:48 硬件上明明有更快的计算单元 “为什么没有人做?这是很明显的一个收益。” 当大家认为 FlashAttention 已接近极致,张金涛发现 GPU 上仍有更快的计算单元没有用于 Attention。 语言模型早期的 Attention 更受显存传输限制,视频生成模型却严重受计算速度限制。 SageAttention 要同时解决底层 GPU Kernel 编程和低比特计算的精度损失,最终成为即插即用的加速方案。 🟢 06:15 从 SageAttention 到 Vidu S1:三层加速 算子层:让 Attention、线性层等计算尽可能逼近硬件上限。 模型层:通过步数蒸馏和稀疏 Attention,把 Diffusion 去噪从约 50 步降到 4 步。 部署层:解决多卡并行、通信与计算重叠、用户请求调度。 SageAttention 后来成为事实上的行业标准;TurboDiffusion 推进模型加速,TurboServe 负责流式视频的集群部署。 🟢 11:24 Vidu S1 不只是快…

People in this episode

Host: Koji

Guest: 张金涛

Topics covered

Keywords

Mentioned in this episode

Organizations: 生数科技, 清华

Products: Vidu S1

More episodes of 十字路口Crossing

Explore listener stats, chart rankings, contacts and more on the 十字路口Crossing podcast page.