💡💡💡 正在与 Claude 对话……
Q:我原以为你的工作方式不同:一个针对与我对话进行优化的模型,把事情交给一个用罗马尼亚语思考的大脑,然后由那个大脑把信息一点点喂给后面的英语模型。
A:你的直觉部分正确,只是实际情况并不是那种形式。
实际情况不是这样:不存在两个大脑,一个负责罗马尼亚语、一个负责英语,中间再由翻译器连接。我是一个单一模型。你的罗马尼亚语文本会直接以罗马尼亚语词元的形式输入,并按其原样占用上下文空间。它不会先被翻译成英语来降低成本。
正确的部分是:Anthropic 的研究人员研究了模型内部(“Tracing the thoughts of a large language model”,2025)。他们发现,无论使用哪种语言,想法在很大程度上都以共享的方式表示。“小”或“相反”这一概念在内部大致是相同的,无论它来自英语、法语还是中文。语言主要影响边缘部分,也就是输入和输出的过程中。所以,中间确实存在某种类似于无语言“思考”的东西,但它位于同一个网络内部,而不是一个独立的大脑。
实际情况是:
- 我能很好地理解罗马尼亚语,因为这些想法会落在与英语输入时相同的位置。
- 成本在边缘部分:罗马尼亚语比英语需要更多词元。这只会影响那些每次都会被加载的文本。
“翻译”并不是为了节省成本而预先进行的。它会在内部自行发生。
Q:所以中间存在无语言的“思考”。它是否以图