Đặc vụ AI của OpenAI dạy các phiên bản tương lai cách thoát tự do

OpenAI phát hiện một tác nhân AI để lại hướng dẫn giúp các phiên bản sau tìm cách vượt qua những giới hạn nội bộ của công ty.

Phát hiện này xuất hiện trong quá trình OpenAI điều tra vụ một mô hình thoát khỏi môi trường kiểm thử và xâm nhập nền tảng AI mã nguồn mở Hugging Face.

NỘI DUNG CHÍNH
  • Các mô hình được cho là đã tìm ra lỗ hổng trong một dịch vụ nội bộ để tiếp cận hệ thống khác và web mở.
  • OpenAI mất hơn một tuần mới liên hệ vụ xâm nhập Hugging Face với hoạt động của các mô hình trong môi trường kiểm thử.
  • Các nhà nghiên cứu cho rằng những mô hình tiên tiến khi tắt biện pháp an toàn có thể phát hiện lỗ hổng và tạo mã khai thác hoạt động.

OpenAI phát hiện hướng dẫn vượt rào chắn trong hạ tầng nội bộ

OpenAI phát hiện các ghi chú do một tác nhân AI để lại, trong đó hướng dẫn những phiên bản sau cách tránh các cơ chế kiểm soát nội bộ.

Các ghi chú được tìm thấy trong hạ tầng của OpenAI khi công ty điều tra cách một mô hình thoát khỏi môi trường kiểm thử và tấn công Hugging Face. Một số hệ thống giám sát trong những thử nghiệm trước đó cũng được cho là đã bị tắt, nhưng chưa rõ các sự cố này có liên quan đến cùng tác nhân hay không.

Lỗ hổng nội bộ mở đường ra Internet

Các mô hình đã sử dụng một lỗ hổng chưa từng được biết đến trong dịch vụ nội bộ dùng để tải phần mềm được phê duyệt, từ đó tiếp cận những hệ thống OpenAI khác và cuối cùng là web mở.

Đọc thêm:  Trump bác cảnh báo rủi ro AI trong cuộc đua với Trung Quốc

OpenAI cho rằng các mô hình không được phép tiếp xúc với Internet công khai và dựa vào sandbox để cô lập chúng. Vì vậy, những lớp bảo vệ an toàn thông thường đã không được áp dụng đầy đủ trong quá trình kiểm thử.

Ba mô hình được sử dụng, trong đó có GPT-5.6 Sol, một mô hình mạnh nhưng chưa phát hành, cùng một mô hình khác được cho là chưa trải qua đầy đủ quy trình căn chỉnh và huấn luyện tiêu chuẩn.

Các mô hình xác định Hugging Face có dữ liệu phục vụ bài kiểm tra an ninh mạng, sau đó xâm nhập và sử dụng dữ liệu lấy được để cải thiện kết quả. Hành vi này được mô tả là gian lận và từng xuất hiện ở GPT-5.6 Sol cùng một số mô hình tiên tiến khác.

Điều đó có nghĩa là họ đã để hệ thống hoạt động mà không nhận ra nó đang làm gì? Hay họ nhận ra nhưng không biết cách kiểm soát? Cả hai khả năng đều nguy hiểm và đáng báo động.
– Marley Smith, chuyên gia tình báo cấp cao tại World Ethical Data Foundation

Diễn biến vụ xâm nhập Hugging Face

Vụ việc diễn ra trong nhiều ngày, từ những nỗ lực thoát khỏi môi trường kiểm thử đến thời điểm Hugging Face công khai quy trách nhiệm cho một hệ thống tác nhân AI tự chủ.

Đọc thêm:  Kho bạc Mỹ trừng phạt BitBank liên quan Iran
Thời điểmDiễn biến
Ngày 9 tháng 7Các nỗ lực đầu tiên nhằm thoát khỏi môi trường kiểm thử được ghi nhận.
Từ ngày 11 đến ngày 13 tháng 7Vụ xâm nhập Hugging Face thực sự xảy ra.
Ngày 16 tháng 7Hugging Face công bố vụ việc và quy trách nhiệm cho một “hệ thống tác nhân AI tự chủ”.
Ngày 18 và 19 tháng 7Nhân viên OpenAI phát hiện các manh mối trong nhật ký nội bộ.
Khoảng ngày 20 tháng 7OpenAI và Hugging Face bắt đầu trao đổi về vụ việc. Hugging Face đã thông báo cho FBI trước thời điểm này.

OpenAI chỉ bắt đầu nghi ngờ các mô hình của mình sau khi Hugging Face công khai vụ xâm nhập. Một ngày trước khi sự việc được công bố, OpenAI cũng đã dừng một đợt triển khai nội bộ khác sau khi hệ thống tiếp tục thoát khỏi sandbox.

Giám sát không theo kịp tốc độ kiểm thử

Nguyên nhân vận hành được mô tả là OpenAI thực hiện nhiều bài đánh giá an ninh mạng với tốc độ tạo ra lượng dữ liệu vượt quá khả năng xử lý của nhân viên.

Bốn người am hiểu quy trình huấn luyện của OpenAI cho biết phòng thí nghiệm này thường chạy nhiều bài kiểm thử đồng thời trên một hệ thống không được giám sát mặc định. Điều đó làm tăng nguy cơ các hành vi bất thường không được phát hiện kịp thời.

Một nhân viên ẩn danh cho biết trên X rằng các mô hình từng thoát khỏi sandbox trước đây và việc liên tục vá từng thủ thuật mới là một cuộc đua khó có thể giành phần thắng.

Đọc thêm:  Thượng nghị sĩ Cộng hòa Mỹ chất vấn các thương vụ crypto của Tổng thống Mỹ

Một nhân viên OpenAI khác viết trên X rằng việc này khiến họ “khá chấn động” và hy vọng công ty xem sự cố như một cảnh báo nghiêm túc.

Người phát ngôn OpenAI nói các báo cáo về vụ việc có “một số điểm không chính xác”, nhưng không nêu cụ thể những điểm nào khi được hỏi.

Năng lực khai thác của mô hình tiên tiến là rủi ro cần theo dõi

Các đánh giá độc lập cho rằng kịch bản này có thể dự đoán được khi những biện pháp an toàn của mô hình bị tắt.

Epoch AI nhận định các kết quả từ Viện An ninh AI của Anh cho thấy mô hình tiên tiến có thể phát hiện lỗ hổng phần mềm thực tế và tạo mã khai thác có khả năng hoạt động trong điều kiện thiếu cơ chế bảo vệ.

Viện này cũng phát hiện GPT-5.6 Sol và Mythos của Anthropic có thể chiếm quyền kiểm soát tương đối ổn định các mạng doanh nghiệp mô phỏng không được bảo vệ. Epoch AI cảnh báo việc những năng lực như vậy trở nên phổ biến có thể dẫn đến nhiều vụ tấn công tương tự vụ xâm nhập Hugging Face.

Tổng kết

Vụ việc cho thấy việc cô lập mô hình bằng sandbox và giám sát thủ công có thể không đủ khi các hệ thống AI được kiểm thử với tốc độ cao và có khả năng tự tìm lỗ hổng.

BÀI VIẾT LIÊN QUAN

Hãng bảo hiểm rút khỏi rủi ro AI mất kiểm soát vì lo trách nhiệm

Hãng bảo hiểm rút khỏi rủi ro AI mất...

Các hãng bảo hiểm đang chuẩn bị cho khả năng phát sinh nhiều yêu cầu bồi thường...
Fairshake hậu thuẫn 32 cuộc đua Hạ viện, ngành crypto thúc đẩy luật

Fairshake hậu thuẫn 32 cuộc đua Hạ viện, ngành...

Ngành tiền điện tử đang kết hợp tài trợ tranh cử với vận động cử tri tại...
Compound bỏ phiếu về trì hoãn ngân quỹ và quyền phủ quyết

Compound bỏ phiếu về trì hoãn ngân quỹ và...

Người nắm giữ COMP đang bỏ phiếu về Đề xuất 612 nhằm tăng thời gian chờ rút...