百万Token解决的是“能否放入”,不是“是否值得全部放入”

DeepSeek-V4预览版将上下文窗口提升至100万Token并开放模型。长代码仓库、连续Agent轨迹和大量技术资料可以在一次请求中提供给模型,但超长输入会增加预填充时间、KV缓存和计费Token,也可能让真正相关的信息被大量背景稀释。

基础设施瓶颈随之变化

短对话主要受逐Token生成速度影响,百万Token请求则更依赖GPU显存、内存带宽、缓存组织和数据传输。并发用户同时提交长文本时,KV缓存容量可能迅速耗尽,调度器需要设置长度分组、优先级、最大并发与抢占策略。

企业应用不应放弃检索

更长窗口不能替代文档切分、权限过滤和证据追踪。实际系统应比较“全文直接输入”与“检索后输入”的正确率、首Token时间和成本,并保存引用片段。只有确实需要跨越整份代码库或长时间轨迹的任务,才应使用百万Token配置;普通问答继续采用高质量检索通常更经济。

来源、翻译与版权说明

来源:国内AI厂商与开源生态。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。

原文语言
ZH-CN
原文更新时间
2026-04-24
许可证
未登记