长上下文窗口竞赛:谁能先突破1000万token
大模型领域正在进行一场激烈的"长上下文竞赛"。从早期的2K token到如今的200万token,上下文窗口的长度在不到两年时间里增长了1000倍。各家公司的目标越来越明确:谁能率先突破1000万token的关卡。
长上下文能力的意义不言而喻。在法律服务中,律师需要让AI阅读整份合同(可能超过10万字)来找出潜在风险。在投研分析中,分析师需要让AI处理上百页的年报和财报。在代码开发中,程序员需要让AI理解整个代码库的上下文。这些场景都需要极长的上下文支持。
月之暗面的Kimi是目前长上下文领域的领先者,支持200万字的上下文输入。其核心技术是改进的注意力机制和高效的KV缓存管理。但Kimi在长文本任务中的实际表现仍有提升空间,特别是在处理跨文档推理时,准确性会随着文本长度的增加而下降。
Google的Gemini 1.5 Pro声称支持1000万token的上下文,但这是在特定测试条件下的结果,实际使用中并不能完全发挥。Google正在研发下一代长上下文技术,目标是让1000万token成为实际可用的功能。
Anthropic的Claude 3.5支持20万token的上下文,虽然长度不是最长的,但在长文本理解的质量上获得了不少好评。Anthropic采用了一种称为"上下文压缩"的技术,可以在不丢失关键信息的情况下处理更长的文本。
技术上,实现超长上下文主要面临两个挑战。一是内存限制,注意力机制的内存消耗与上下文长度成平方关系,1000万token的上下文需要TB级别的显存。二是注意力稀释,当上下文过长时,模型难以准确定位到相关信息。
解决这些挑战的可能路径包括:更高效的注意力算法(如线性注意力、稀疏注意力)、外部记忆机制、以及分层处理策略。一些研究者认为,未来的长上下文处理可能不再是单一模型的任务,而是多个模型协作完成。
对于用户来说,长上下文能力的提升将大大扩展AI的应用场景。能够"读一本书"的AI和只能"读一页"的AI,在实用性上有着本质的区别。