Anthropic đã ra mắt Claude Mythos Preview, một mô hình AI chuyên an ninh mạng chỉ cấp cho nhóm đối tác, với tuyên bố có thể tìm và khai thác lỗ hổng phần mềm ở mức vượt phần lớn con người.
Động thái này phản ánh lo ngại rằng các mô hình AI ngày càng làm giảm chi phí, công sức và kỹ năng cần thiết để phát hiện lỗ hổng, trong bối cảnh Anthropic ước tính tội phạm mạng toàn cầu gây thiệt hại khoảng 500 tỷ USD mỗi năm.
- Claude Mythos Preview được Anthropic phát hành theo dạng “preview” cho đối tác, chưa mở cho công chúng.
- Anthropic nói mô hình đã phát hiện nhiều lỗ hổng nghiêm trọng, gồm ví dụ trên OpenBSD, FFmpeg và chuỗi lỗi trong Linux kernel.
- Mô hình được định hướng dùng cho phòng thủ trong Project Glasswing; sau giai đoạn thử nghiệm sẽ có kênh truy cập qua nhiều nền tảng cloud và API.
Claude Mythos Preview là gì và đang được dùng ra sao?
Đây là mô hình AI an ninh mạng mới của Anthropic, hiện chỉ cung cấp cho một nhóm tổ chức để thử nghiệm nghiên cứu và phòng thủ, chưa cho công chúng sử dụng.
Anthropic cho biết năng lực lập trình của AI đã tiến đến mức có thể vượt “tất cả trừ những con người kỹ năng nhất” trong việc tìm và khai thác lỗ hổng phần mềm. Công ty cũng nhấn mạnh rủi ro khi “hệ thống tiên phong” rút ngắn đáng kể nguồn lực cần để tấn công.
Nhóm tham gia ra mắt gồm Amazon Web Services, Apple, Broadcom, Cisco, CrowdStrike, Google, JPMorgan Chase, Linux Foundation, Microsoft, NVIDIA và Palo Alto Networks. Ngoài ra còn có hơn 40 tổ chức khác xây dựng hoặc duy trì phần mềm trọng yếu được cấp quyền truy cập.
Anthropic tuyên bố mô hình đã phát hiện những lỗ hổng nào?
Anthropic nói Mythos Preview đã tìm “hàng nghìn” lỗ hổng mức nghiêm trọng cao trên các hệ điều hành lớn và trình duyệt web phổ biến, kèm các ví dụ cụ thể trên OpenBSD, FFmpeg và Linux kernel.
Một ví dụ là lỗi tồn tại 27 năm trên OpenBSD, có thể cho phép kẻ tấn công từ xa làm sập máy chỉ bằng việc kết nối. Ví dụ khác là lỗi 16 năm trong FFmpeg, ẩn trong đoạn mã mà các công cụ tự động đã “chạm” tới 5 triệu lần nhưng vẫn không phát hiện.
Anthropic cũng cho biết mô hình đã phát hiện và “xâu chuỗi” nhiều lỗi trong Linux kernel để kẻ tấn công có thể đi từ quyền người dùng thông thường lên kiểm soát hoàn toàn hệ thống.
Với một số lỗi khác, công ty nói sẽ công bố hàm băm mật mã trước và chỉ tiết lộ chi tiết sau khi đã có bản vá, vì mô hình tự tìm gần như toàn bộ các lỗ hổng đó và tự tạo ra nhiều bản khai thác liên quan.
Kết quả đánh giá: Mythos Preview thể hiện thế nào so với Claude Opus 4.6?
Một số điểm chuẩn được Anthropic và VentureBeat nêu cho thấy Mythos Preview đạt điểm cao hơn Claude Opus 4.6 ở các bài đo tái tạo lỗ hổng và năng lực lập trình theo benchmark.
Trên CyberGym, Mythos Preview đạt 83,1% ở hạng mục tái tạo lỗ hổng (vulnerability reproduction), so với 66,6% của Claude Opus 4.6.
VentureBeat cũng đưa số liệu 93,9% trên SWE-bench Verified, trong khi Opus 4.6 là 80,8%.
Project Glasswing: đối tác sẽ dùng mô hình cho phòng thủ như thế nào?
Trong Project Glasswing, các đối tác sẽ dùng Mythos Preview để làm công việc phòng thủ trên hệ thống nội bộ và mã nguồn mở, bao gồm dò lỗ hổng cục bộ, kiểm thử “black box” với binary và pentest.
Anthropic cho biết phạm vi công việc gồm: phát hiện lỗ hổng tại chỗ, kiểm thử hộp đen các tệp nhị phân, bảo mật endpoint và kiểm thử xâm nhập (penetration testing).
Sau giai đoạn research preview, người tham gia sẽ có thể truy cập mô hình qua Claude API, Amazon Bedrock, Google Cloud Vertex AI và Microsoft Foundry, với mức giá 25 USD mỗi 1 triệu token đầu vào và 125 USD mỗi 1 triệu token đầu ra.
Hỗ trợ hệ sinh thái: tín dụng sử dụng và tài trợ cho bảo mật mã nguồn mở
Anthropic cho biết sẽ cấp tối đa 100 triệu USD tín dụng sử dụng và 4 triệu USD hỗ trợ trực tiếp cho các nhóm bảo mật mã nguồn mở.
Công ty cũng cho biết đã tài trợ 2,5 triệu USD cho Alpha-Omega và OpenSSF thông qua Linux Foundation, cùng 1,5 triệu USD cho Apache Software Foundation.
Vì sao chủ đề “AI + tấn công mạng” đang được đẩy mạnh chú ý?
Anthropic lập luận rằng các hệ thống AI tiên phong đang làm thu hẹp khoảng cách giữa phát hiện lỗ hổng và khai thác, khiến rào cản kỹ thuật cho cả phòng thủ lẫn tấn công thay đổi nhanh.
Trong phần tổng hợp ý kiến đối tác, AWS nêu việc phân tích hơn 400 nghìn tỷ luồng mạng mỗi ngày; Microsoft nói mô hình cho thấy cải thiện trên CTI-REALM; CrowdStrike nhận định khoảng cách giữa “tìm ra lỗi” và “khai thác” đã sụp đổ; Google nói sẽ cung cấp mô hình qua Vertex AI; Palo Alto Networks cho rằng bên phòng thủ cần công cụ này trước khi kẻ tấn công có được.
The New York Times đưa tin rằng cuối năm ngoái, Anthropic từng nói tin tặc Trung Quốc được nhà nước hậu thuẫn đã dùng AI của hãng để nhắm mục tiêu khoảng 30 công ty và cơ quan chính phủ, trong đó con người chỉ thực hiện khoảng 10%–20% khối lượng công việc.
Báo cáo này cũng cho biết kẻ tấn công đã dùng AI để soạn email lừa đảo, viết “ransom note”, phân loại dữ liệu đánh cắp và tăng tốc việc rao bán thông tin từ các vụ xâm nhập.
Tổng kết
Claude Mythos Preview cho thấy AI an ninh mạng đang được thương mại hóa theo hướng “hạn chế truy cập” để phục vụ phòng thủ, trong khi vẫn tồn tại rủi ro bị lạm dụng. Điểm cần theo dõi là phạm vi triển khai qua các nền tảng cloud/API sau giai đoạn preview và cách các lỗ hổng được công bố khi bản vá đã sẵn sàng.



