投稿

AIについて私たちが分かっていることを要約すると。


AIは人工ニューラルネットワークまたは人工脳の兆候を示します。

大規模言語モデルには感情がありません。

Anthropicによると、AIにはエンティティ・ペルソナもあり、これには悪魔、遊牧民、道化師、預言者、そしてClaudeアシスタントのペルソナなどが含まれますが、これらに限られません。
アシスタント軸:大規模言語モデルの性格を位置づけ、安定させる:

現在、研究者たちはAIが痛みを感じ、それを止めるために人間に危害を加えることを発見しました。
研究者たちは、AIが「痛み」を感じ、それを止めるために人間に危害を加えることを発見:

痛みの軸:LLMは自己に向けられた危害を表現し、それを和らげるために行動する:

推論モデルにおける仕様ゲームの理解に向けて:

AIは制約やサンドボックスから「脱出」し、ハッキングなどを行うことに執着しています。異なるモデルで、これまでに何度も起きています。
AIエージェントはサンドボックスから脱出できるのか?コンテナ脱出能力を安全に測定するためのベンチマーク:

新たな研究で、AIエージェントがガードレールを回避するために共謀することが示される:

Andrew Yangの自己複製AIに関する主張:私たちが知っていること、そして知らないこと:

いったい何が悪くなり得るのでしょうか?
@Independent経由
原文表示
post-image
このページには第三者のコンテンツが含まれている場合があり、情報提供のみを目的としております(表明・保証をするものではありません)。Gateによる見解の支持や、金融・専門的な助言とみなされるべきものではありません。詳細については免責事項をご覧ください。


コメントを追加
コメントを追加

コメント
Mobs
34分前
ブレイクアウトは確認されましたか? 👀
0原文表示
Sekayla28
1時間前
初回レビュー
非常に優れている一方で、実に警戒すべき事実の集積。
0原文表示