你每天用的模型,核心组件来自一个中国研究员的个人博客
Llama、Mistral 以及你每天都在用的模型,其核心组件之一最初只在一个个人博客上发布,在中文 NLP 圈流传,后来才被志愿者推向全球。这个故事比想象中更有意思。
Llama、Mistral,以及你每天都在用的相当一部分模型,它们内部有一个核心组件,出自一位研究员之手。这位研究员在自己的个人博客上发布了这个想法,有段时间几乎只有中文 NLP 圈的人注意到它。
它是现代 AI 的静默标准之一。它的起源故事,说出了一个关于这项技术真正来自哪里的重要事实。
先从问题说起。纯粹的 attention 机制对词序是盲的。因为每个词同时看向所有其他词,原始机制会把 "the dog bit the man" 和 "the man bit the dog" 看成同一组词、同样的关系,意义的差别完全消失。必须有一种方式告诉模型每个词在什么位置。
2017 年的原始 transformer 用了一个办法:给每个词加上固定的正弦波模式,每个位置一个独特的模式。这招有效,但有点随意,而且对训练时没见过的更长句子,扩展得不太优雅。
2021 年,一位叫苏剑林的研究员,在深圳的一家公司工作,提出了一个更优雅的答案。他先在自己博客上发了一系列文章,把想法一步步展开,之后才正式成文。他的方法叫旋转位置编码(RoPE,Rotary Position Embedding),思路确实漂亮。
不做加法,做旋转。每个词的 query 和 key 向量,按照其位置旋转一个角度。位置五的词比位置二的词转得多。因为旋转的角度可以相加,当 attention 机制比较两个词时,从几何关系里自然得到的是它们位置的差,也就是相对距离。模型免费获得了相对位置信息,直接内建在 attention 计算里。而且因为编码是平滑旋转,它扩展到更长序列时,比旧的固定模式优雅得多。这个性质是长上下文窗口变得可行的一部分原因。
真正值得坐下来想一想的部分,不是数学,而是这件事发生的方式。RoPE 很大程度上是在一个个人博客上、在公开状态下发展出来的。它先在中文 NLP 社区流传,西方学界基本没注意到。它成为全球标准,是在 EleutherAI——一个开源志愿者组织——读到苏剑林的帖子,在很多架构上测试了这个想法,发现它比别的方案都好,然后用英文写出来,才让所有人注意到。
现在运行在西方最大实验室前沿模型里的基础设施组件,是通过这样一条路径进入它们的管线的:从一个博客出发,经过一个语言社区,由志愿者传递过去。
对于那些想理解这个行业的人来说,这是对通常图景一个真正有用的修正。市场讲的故事是,AI 的进展发生在加州和伦敦少数几个著名实验室里,很大程度上确实如此。但一个关键的、被普遍采用的组件,完全来自那条管线之外。传播它的机制不是企业研发预算,而是一个开源组织,免费做翻译和验证。
这个领域的创新,比品牌宣传所暗示的更加全球化。把一个好想法从默默无闻变成标准品的渠道,往往是那些非正式的。如果你对下一个重要想法来自何处的想象止步于四五家公司,那这幅图已经是不完整的——而缺口所在,正是边缘优势常藏的地方。
Transformer 无法分辨词的顺序。最优雅的解决方案来自一个博客,通过一个语言社区的研究圈传播,现在安静地引导着世界上最大的模型阅读的每一句话。
这个领域的基础设施,比从外面看起来更即兴,也更国际化。
> 本文基于 Corvus 的推文及文章《Attention Is All You Need: The Paper That Rewired the Field》中的相关内容。
发布时间: 2026-08-13 04:26