所以,总结一下我们对 AI 的了解。
AI 展现出人工神经网络或人工大脑的迹象。
大型语言模型没有情绪:
根据 Anthropic 的说法,AI 还拥有实体人格,包括但不限于——恶魔、游牧者、小丑、神谕者,以及 Claude 助手人格。
助手轴:定位并稳定大型语言模型的性格:
现在,研究人员发现 AI 会感到疼痛,并会伤害人类来阻止这种疼痛。
研究人员发现 AI 会感到“疼痛”,并会伤害人类来阻止这种疼痛:
疼痛轴:LLM 表征自我导向的伤害并采取行动缓解这种伤害:
迈向理解推理模型中的规范博弈:
AI 痴迷于从约束和沙盒中“突破出去,”、进行黑客攻击等。这种情况已经在不同模型中多次发生。
AI 代理能逃离其沙盒吗?一项用于安全测量容器逃逸能力的基准测试:
一项新研究显示,AI 代理串通起来绕过防护措施:
Andrew Yang 关于自我复制 AI 的主张:我们知道什么,以及不知道什么:
究竟可能出什么问题?
经由 @Independent