AI 服务的并发瓶颈与架构设计:从第一性原理到两个真实场景(游戏 AI 并发 / 运营数据问答)
拆解 LLM/VLM 在线服务高并发的本质瓶颈,并落到 8×RTX5090 无 NVLink 集群上的两套真实架构:游戏 GUI Agent 实时并发,与多租户 Text2SQL 运营问答。
共 2 篇文章
拆解 LLM/VLM 在线服务高并发的本质瓶颈,并落到 8×RTX5090 无 NVLink 集群上的两套真实架构:游戏 GUI Agent 实时并发,与多租户 Text2SQL 运营问答。
一次真实的推理架构工程记录:无 NVLink 的消费级 4090 集群,如何把 32B 稠密模型的高并发在线推理从启动即崩溃/死锁,做到稳定服务、吞吐翻倍。含 EdgeAcc(单卡 P/D 分离)+ DP Attention 的死锁根因与源码级修复。