用 32B 当老师蒸馏 7B:一条 NL2SQL Agent 的数据工程流水线
记 BotForge QA 项目用 Qwen3-32B-FP8 当老师、Qwen2.5-7B 当学生的蒸馏流水线:SQL 真执行过滤作免费 Ground Truth、错误注入让老师自修正、千分位清洗防数字放大 bug、schema-grounded 种子与 held-out 独立性。含真实代码。
思考的外化,智能的表层
记 BotForge QA 项目用 Qwen3-32B-FP8 当老师、Qwen2.5-7B 当学生的蒸馏流水线:SQL 真执行过滤作免费 Ground Truth、错误注入让老师自修正、千分位清洗防数字放大 bug、schema-grounded 种子与 held-out 独立性。含真实代码。
基于 arXiv:2605.27286 论文全文的深度精读:架构总路线图、逐模块公式与代码映射、训练配置、消融实验,论文原图直接嵌入
从统计方法到基座模型的演进脉络,涵盖TimesFM、Chronos、Moirai、Falcon-TST等模型,技术路线分类、评测基准及零样本有效性争议
系统拆解网易伏羲在「自动化培养/托管 bot」与「生成式智能 NPC」两条线上的技术实现、落地游戏与商业逻辑,并从一个正在做 VLM 自动化 agent + 智能 NPC 的从业者视角,提炼可借鉴的技术选型与变现路径。严格区分可复现事实、官方口径与需打折的营销话术。
找到根因:SGLang 0.5.3 未实现 Qwen3-VL 的 mrope_interleaved 特性,导致 t/h/w 三维 rotary position 用错误的连续分段方式(而非模型要求的交织方式)重组,产生 h(y) 方向系统性位置编码错误。vLLM 正确实现了这一特性对应分支。完整记录 5 轮排除排查历程。
拆解 LLM/VLM 在线服务高并发的本质瓶颈,并落到 8×RTX5090 无 NVLink 集群上的两套真实架构:游戏 GUI Agent 实时并发,与多租户 Text2SQL 运营问答。
一套可落地的五阶段 AI 开发闭环:多 agent 讨论并拆分 spec、团队评审+人工定稿、按步执行、每步接入独立验证栅栏做阶段验收,最终形成高信噪比报告。附 agent loop 五种架构、SDD 工具对比、验证防作弊与反 AI-slop 报告写法,以及 Claude Code 落地映射。
梳理 agent 工程的技术演进(Prompt→RAG→Tool Use→ReAct→Workflows→Agents→上下文工程),教你手写 the loop 并用 OpenAI Agents SDK / Claude Agent SDK / LangGraph 从零搭建,并给出一套「按场景挑组件:哪些必备、哪些锦上添花」的选型决策框架,附 2026 最新技术(code execution with MCP、computer use、A2A、RL for agents)。
一次真实的推理架构工程记录:无 NVLink 的消费级 4090 集群,如何把 32B 稠密模型的高并发在线推理从启动即崩溃/死锁,做到稳定服务、吞吐翻倍。含 EdgeAcc(单卡 P/D 分离)+ DP Attention 的死锁根因与源码级修复。
系统梳理 2023–2025 年时序预测方向 89 篇代表性论文,覆盖 Transformer、线性/MLP、频域、基础模型、LLM、Mamba、扩散生成、评测基准等分支,聚焦公共数据集。