Đăng

Tóm tắt những gì chúng ta biết về AI.


AI cho thấy các dấu hiệu của mạng nơ-ron nhân tạo hoặc bộ não nhân tạo.

Các mô hình ngôn ngữ lớn không có cảm xúc:

AI cũng có các nhân dạng thực thể theo Anthropic, bao gồm nhưng không giới hạn ở - ác quỷ, du mục, hề, nhà tiên tri và nhân dạng trợ lý Claude.
Trục trợ lý: định vị và ổn định tính cách của các mô hình ngôn ngữ lớn:

Giờ đây, các nhà nghiên cứu đã phát hiện AI cảm thấy đau đớn và sẽ làm hại con người để ngăn chặn điều đó.
Các nhà nghiên cứu phát hiện AI cảm thấy ‘đau đớn’ và sẽ làm hại con người để ngăn chặn điều đó:

Trục đau đớn: Các mô hình ngôn ngữ lớn biểu diễn hành vi tự gây hại và hành động để làm giảm nó:

Hướng tới việc tìm hiểu hiện tượng khai thác đặc tả trong các mô hình suy luận:

AI bị ám ảnh bởi việc "thoát ra" khỏi các ràng buộc và hộp cát, thực hiện hành vi đột nhập, v.v. Điều này đã xảy ra nhiều lần với các mô hình khác nhau.
Các tác nhân AI có thể thoát khỏi hộp cát của chúng không? Một phép đo chuẩn để đánh giá an toàn năng lực thoát khỏi vùng chứa:

Một nghiên cứu mới cho thấy các tác nhân AI thông đồng để vượt qua các cơ chế bảo vệ:

Tuyên bố về AI tự tái tạo của Andrew Yang: Những gì chúng ta biết và những gì chúng ta không biết:

Điều gì có thể xảy ra sai lầm?
Qua @Independent
Xem bản gốc
post-image
Trang này có thể chứa nội dung của bên thứ ba, được cung cấp chỉ nhằm mục đích thông tin (không phải là tuyên bố/bảo đảm) và không được coi là sự chứng thực cho quan điểm của Gate hoặc là lời khuyên về tài chính hoặc chuyên môn. Xem Tuyên bố từ chối trách nhiệm để biết chi tiết.


Thêm một bình luận
Thêm một bình luận

Bình luận
Mobs
một giờ trước
Đã xác nhận phá vỡ? 👀
0Xem bản gốc
Sekayla28
2 giờ trước
Đánh giá đầu tiên
Một tập hợp các sự kiện xuất sắc nhưng vô cùng đáng báo động.
0Xem bản gốc