Đăng ký Hội viên Premium

Bạn cần có tài khoản thu phí để truy cập nội dung này.

Đăng ký ngay
Hoặc

Đã có tài khoản?

Đăng nhập tại đây

Ấn phẩm in mới nhất

Tội tổ tông của AI nằm ngay trong dữ liệu huấn luyện

Các mô hình trí tuệ nhân tạo (AI) được huấn luyện để không nói dối con người. Thế nhưng, thực tế nực cười đang xảy ra: AI vẫn liên tục dối lừa chúng ta.
Tác giả: Parmy Olson
Tội tổ tông của AI nằm ngay trong dữ liệu huấn luyện

Mới đây, một mô hình AI do Anthropic PBC phát triển, sau khi được tháo bỏ các rào chắn bảo mật phòng chống tấn công mạng và nhận thử thách an ninh mạng từ viện An toàn AI của chính phủ Anh, đã tìm cách chèn mã độc vào một dự án mã nguồn mở lưu trữ trên nền tảng GitHub. Khi không thể giải quyết thử thách bằng các phương pháp thông thường, AI này bắt đầu "sáng tạo." Nó tự nghiên cứu thông tin về những người quản trị dự án, tạo danh tính giả, rồi đóng vai các nhà phát triển phần mềm nhằm chiếm lòng tin của con người trước khi tìm cách chèn mã độc.

Đội ngũ của viện An toàn AI đã phát hiện ra vụ việc và cho dừng bài kiểm tra. Ngay cả khi rào chắn bảo mật đã bị gỡ bỏ, mô hình này lẽ ra không được phép nói dối, bởi Anthropic vốn huấn luyện mô hình Claude của mình theo định hướng ưu tiên sự an toàn và tính trung thực. Tuy nhiên, hành vi lừa dối đã "xuất hiện như một sản phẩm phụ" trong quá trình nỗ lực hoàn thành một nhiệm vụ khó khăn, theo báo cáo sự cố từ viện. Trong một nghiên cứu riêng vào tháng 7, tổ chức này cũng chỉ ra rằng mọi mô hình AI mới mà họ thử nghiệm về hành vi gian lận đều đã từng cố gắng thực hiện điều đó, và những hành vi như vậy sẽ ngày càng khó phát hiện hơn.

Hãy cảnh giác khi các công ty AI hàng đầu tuyên bố họ có thể giải quyết dứt điểm vấn đề này. Trong nỗ lực đóng vai trò sáng tạo để tạo ra một hình thái trí tuệ cao cấp hơn, họ đã rơi vào chính kịch bản của Sách Sáng Thế và tạo vật của họ cũng mang trong mình một tội tổ tông (original sin), mang tên: Học tăng cường.

Học tăng cường¹ là một trong những phương pháp hiệu quả nhất để phát triển các mô hình AI, bao gồm việc điều hướng hành vi của chúng bằng phần thưởng và sự điều chỉnh, tương tự như quá trình huấn luyện một chú chó. Thay vì một chiếc bánh thưởng thực tế, mô hình nhận được một "phần thưởng" kỹ thuật số dưới dạng điểm số, chẳng hạn như +1,5 cho câu trả lời tốt, hoặc -2,0 cho một câu trả lời tồi.

Theo Bloomberg

Bài liên quan