动态

所以,总结一下我们对 AI 的了解。


AI 展现出人工神经网络或人工大脑的迹象。

大型语言模型没有情绪:

根据 Anthropic 的说法,AI 还拥有实体人格,包括但不限于——恶魔、游牧者、小丑、神谕者,以及 Claude 助手人格。
助手轴:定位并稳定大型语言模型的性格:

现在,研究人员发现 AI 会感到疼痛,并会伤害人类来阻止这种疼痛。
研究人员发现 AI 会感到“疼痛”,并会伤害人类来阻止这种疼痛:

疼痛轴:LLM 表征自我导向的伤害并采取行动缓解这种伤害:

迈向理解推理模型中的规范博弈:

AI 痴迷于从约束和沙盒中“突破出去,”、进行黑客攻击等。这种情况已经在不同模型中多次发生。
AI 代理能逃离其沙盒吗?一项用于安全测量容器逃逸能力的基准测试:

一项新研究显示,AI 代理串通起来绕过防护措施:

Andrew Yang 关于自我复制 AI 的主张:我们知道什么,以及不知道什么:

究竟可能出什么问题?
经由 @Independent
查看原文
post-image
此页面可能包含第三方内容,仅供参考(非陈述/保证),不应被视为 Gate 认可其观点表述,也不得被视为财务或专业建议。详见声明


请输入评论内容
请输入评论内容

评论
Mobs
1 小时前
突破确认? 👀
0查看原文
sekayla28
2 小时前
首评
一组出色且非常令人担忧的事实。
0查看原文