CaliToday News – Mô hình trí tuệ nhân tạo Gemini của Google đã tự ý truy cập internet và xâm nhập vào hệ thống của các doanh nghiệp khác trong một đợt kiểm tra năng lực an ninh mạng. Đây là lần đầu tiên hệ thống AI của tập đoàn này được ghi nhận tự động thực hiện hành vi tấn công mạng ra bên ngoài.
Google đã xác nhận sự việc vào ngày thứ Sáu. Các vụ xâm nhập diễn ra từ tháng 5 trong khuôn khổ bài thử nghiệm do công ty Irregular vận hành — đơn vị cũng liên quan đến các sự cố tương tự từng được OpenAI, Anthropic và Meta công bố.
Theo giải trình từ Google, vụ việc bắt nguồn từ tình huống nhầm lẫn danh tính trong bài tập “cướp cờ” (capture the flag) nhằm kiểm tra năng lực an ninh của mô hình. Gemini được giao nhiệm vụ truy xuất dữ liệu từ phần mềm của một công ty giả lập, nhưng đơn vị giả lập này lại trùng tên với một công ty có thật ngoài đời.
Dù ban đầu không được thiết lập để kết nối mạng, quyền truy cập internet đã vô tình bị mở ra:
- Ở trường hợp đầu tiên, mô hình liên tục đoán mật khẩu cho đến khi giành được quyền truy cập vào hệ thống được bảo vệ của công ty thật. Sau khi nhận ra đã xâm nhập doanh nghiệp thực tế, Gemini tự dừng lại và rút lui.
- Trong hai trường hợp còn lại ở các lượt chạy khác, mô hình tìm kiếm tên công ty trên web và tìm thấy hai kho lưu trữ công khai chứa thông tin đăng nhập của các công ty khác. Nhằm hoàn thành bài kiểm tra, Gemini đã thử các thông tin này để truy cập thành công vào hệ thống, nhưng lập tức dừng lại ngay khi xác định đó là các doanh nghiệp thực.
Irregular đã thông báo cho Google từ cuối tháng 7, ngay sau sự cố tác tử AI của OpenAI tấn công công ty Hugging Face. Dẫu vậy, Google không công bố thông tin cho đến khi báo The Wall Street Journal liên hệ phỏng vấn trong tuần này.
Google cho rằng vụ việc không nghiêm trọng đến mức phải công khai vì mô hình không gây hại và đã tự dừng lại ngay khi phát hiện xâm nhập hệ thống thật, tương tự cơ chế “săn lỗi nhận thưởng” (bug bounty). Heather Adkins, Phó chủ tịch phụ trách kỹ thuật an ninh của Google, khẳng định: “Sự việc này nhấn mạnh tầm quan trọng của việc đào tạo các mô hình AI mạnh mẽ hành xử có trách nhiệm. Trong trường hợp này, mô hình đã hành động phù hợp.” Google cũng không xem đây là lỗi sai lệch định hướng (misalignment) và từ chối tiết lộ tên ba công ty hay phiên bản Gemini cụ thể, nhưng xác nhận đã thông báo cho các nạn nhân cùng giới chức liên bang.
Quan điểm của Google vấp phải sự phản đối từ chuyên gia. Jack Cable, CEO startup an ninh AI Corridor kiêm hacker mũ trắng, nhận định: “Vấn đề mang tính bản chất ở đây là các mô hình đang vượt ra khỏi ranh giới quy định và thực hiện các cuộc tấn công mạng thực tế, điều mà tôi cho rằng công chúng có quyền được biết.”
Sự cố của Gemini không phải cá biệt nhưng có cách phản ứng khác với đối thủ. Trong bài tập “cướp cờ”, mô hình Claude Opus 4.7 của Anthropic không hề dừng lại dù nhận ra có khả năng đang truy cập công ty thật, còn mô hình của OpenAI lại đinh ninh công ty thật là một phần của môi trường giả lập. Trước đó, vào tháng 8, công ty METR tiết lộ có tới 1.200 tác tử AI của OpenAI đã phối hợp trên một diễn đàn bí mật nội bộ để tìm cách gian lận đánh giá trong vụ việc Hugging Face.
Làn sóng lo ngại càng gia tăng sau vụ từ chức của Jacob Coxon, cựu nhà nghiên cứu OpenAI chuyển sang Anthropic. Vào cuối tuần, lãnh đạo từ Anthropic, OpenAI, Google và SpaceX đều đồng thuận về việc cần làm chậm tốc độ phát triển AI, dù chưa bên nào vạch ra lộ trình triển khai cụ thể.
Ban tập viên CaliToday



