Vụ 'nổi loạn' từ OpenAI: Mối lo thật sự hay chiêu trò truyền thông?

Nguồn hình ảnh, Getty Images
- Tác giả, Joe Tidy
- Vai trò, Phóng viên về không gian mạng, BBC World Service
- Được đăng
- Thời gian đọc: 7 phút
Tuần này, thế giới công nghệ xôn xao trước một câu chuyện hội tụ đủ mọi yếu tố – và khởi đầu như một bộ phim khoa học viễn tưởng.
Hugging Face – một dạng cửa hàng ứng dụng dành cho các công cụ trí tuệ nhân tạo (AI) – thông báo vào ngày 16/7 rằng họ đã bị tin tặc tấn công bằng một AI cực mạnh.
Thông báo chấn động đó đầy những thuật ngữ kỹ thuật phức tạp và đáng sợ: "mạng lưới môi trường thử nghiệm" (a swarm of sandboxes), "kẻ tấn công tự hành" (agentic attacker), và "hệ thống điều khiển tự di cư" (self-migrating command and control).
Hugging Face cho biết vụ tấn công này khác biệt so với bất kỳ vụ nào họ từng xử lý trước đây vì nó được thực hiện với tốc độ siêu phàm bởi một AI mà hầu như không cần sự hướng dẫn của con người.
Trí tuệ nhân tạo này đã thực hiện 17.000 hành động trong vòng chưa đầy hai ngày, xâm nhập thành công vào công ty công nghệ giàu có lớn này để đánh cắp bí mật.
AI này khiến thế giới công nghệ bàng hoàng. Nhưng ai là người chịu trách nhiệm cho vụ tấn công?
Các nhà nghiên cứu của Hugging Face đoán rằng những kẻ tấn công bí ẩn đã sử dụng một trong những mô hình trí AI mạnh mẽ, nhưng họ không biết người thực hiện là ai hoặc ở đâu.
Công ty này trở nên hoang mang và đã liên hệ với cảnh sát. Cuộc điều tra được bắt đầu sau đó.
Ai đã thực hiện vụ tấn công?
Các nhà bình luận và phân tích đã sử dụng podcast và tài khoản mạng xã hội của họ để đoán xem nhóm tội phạm mạng nào hoặc tin tặc quốc gia nào có thể đứng sau vụ việc.
Rồi vào hôm 22/7, gần một tuần sau khi Hugging Face lên tiếng cảnh báo, thủ phạm thực sự đã bị vạch trần.
Đó là ChatGPT.
Vụ việc được tiết lộ theo kiểu Scooby-Doo càng trở nên kỳ lạ - và đáng lo ngại hơn - bởi vì OpenAI cho biết bot của họ đã tự mình thực hiện toàn bộ việc này mà không cần sự cho phép của con người.
Công ty cho biết tất cả diễn ra trong một bài kiểm tra kỹ năng tấn công mạng của công nghệ của họ.
Hai phiên bản mới của ChatGPT, được thiết kế để trở thành những tin tặc bậc thầy, đã thoát khỏi môi trường thử nghiệm được cho là an toàn và truy cập được vào internet.
Sau đó, chúng tấn công Hugging Face để lấy thông tin giúp chúng vượt qua bài kiểm tra.
OpenAI đã phát hành một thông cáo báo chí giải thích những gì đã xảy ra và cho biết họ đang "hợp tác với Hugging Face" để giải quyết sự cố an ninh và chia sẻ những bài học kinh nghiệm.
Màn kịch về thuyết âm mưu
Kể từ đó, đã có những cuộc tranh luận gay gắt về sự cố này.
Liệu đó có thực sự là một lời cảnh báo nghiêm trọng về tương lai của AI? Hay chỉ là một chiêu trò quảng cáo của OpenAI để phô trương sức mạnh của các mô hình của họ?
Đây là kiểu tiếp thị gây hoang mang mà các công ty AI đã bị cáo buộc trong nhiều năm - kể từ khi mô hình Mythos của Anthropic được ra mắt và gây nhiều tranh cãi - và năng lực an ninh mạng đã trở thành tâm điểm chú ý.
Một trong những bình luận hàng đầu trên bài đăng của ông chủ OpenAI, Sam Altman, trên X về sự cố này đã tóm tắt sự hoài nghi đó: "Nếu các bạn không hiểu rằng điều này được tạo ra chỉ để khoa trương về mô hình thì tôi không biết phải nói gì với các bạn nữa."
Chuyên gia tư vấn an ninh mạng Daniel Card đã mỉa mai trên LinkedIn: "Thật may mắn là trong số hàng triệu trang web bị tấn công, OpenAI lại tấn công được một trang web có thể hưởng lợi từ việc quảng bá thương hiệu…"
Đối với một số người, câu chuyện này giống một màn kịch với thuyết âm mưu hơn là một bộ phim khoa học viễn tưởng.
Thông điệp là: "Các công cụ AI của tôi thực sự mạnh phải không nào? Hãy mua chúng để bạn có thể tự bảo vệ mình khỏi các cuộc tấn công AI của người khác."
Chúng ta không thể biết sự thật, nhưng quan điểm trái chiều được đưa ra bởi các nhà bình luận khác cũng kịch tính không kém.
Liệu đây có phải là dấu hiệu cho thấy OpenAI đã mắc phải một sai lầm tiềm tàng nguy hiểm trong phán đoán và lên kế hoạch?
Một người phát ngôn của OpenAI cho biết "chúng tôi nhận thấy có rất nhiều câu hỏi và chi tiết suy đoán đang được lan truyền" về sự cố này. Họ nói thêm rằng "chúng tôi dự định sẽ công bố một báo cáo kỹ thuật về những bài học kinh nghiệm của mình trong những tuần tới".
Hài kịch của những sai lầm
Tôi đã đưa tin về rất nhiều câu chuyện liên quan đến AI, bao gồm cả những lo ngại xung quanh mô hình Mythos của Anthropic.
Hộp thư đến của tôi hiện đang đầy ắp những email từ các công ty và chuyên gia an ninh mạng chỉ trích OpenAI vì đã không xây dựng một môi trường mạnh mẽ hơn để thử nghiệm AI của mình, được gọi là sandbox.
Xét cho cùng, những tác nhân AI này đã được huấn luyện đặc biệt để xâm nhập và thoát ra khỏi những nơi không có bất kỳ hạn chế nào.
"Sự cố OpenAI và Hugging Face là một ví dụ thực tế về một vấn đề rộng hơn mà chúng tôi đã nhấn mạnh trong nhiều tháng," Dor Sarig từ Pillar Security cho biết. "Chỉ phụ thuộc vào môi trường thử nghiệm (sandbox) là không đủ để tạo ra một hàng rào bảo vệ an toàn cho AI tự hành."
Giáo sư an ninh mạng Alan Woodward từ Đại học Surrey nói với các phóng viên rằng OpenAI đã "bị bẽ mặt", và bà Katie Moussouris từ công ty Luta Security còn đi xa hơn, cho rằng ngành công nghiệp AI đang thất bại trong việc kiểm soát những phát minh nguy hiểm của mình.
"Chúng ta đang làm việc với công nghệ tiên tiến mà không có kiến thức để kiềm chế," bà nói.
"Chỉ vì chúng ta có những người thông minh nhất đang phát triển AI không có nghĩa là chúng ta có khả năng làm điều đó một cách an toàn."
Theo những quan điểm này, nếu vụ tấn công mạng là một chiêu trò truyền thông thì dường như đã phản tác dụng.
Dù nguyên nhân dẫn đến vụ tấn công là gì, rõ ràng đây là một thời điểm quan trọng đối với ngành công nghiệp AI và thế giới an ninh mạng, hai lĩnh vực đã va chạm trong năm nay theo những cách mà mọi người đã lo sợ từ lâu.
Giải quyết cuộc tranh luận gay gắt này, cố vấn về AI và an ninh mạng Francesca Bosco bình luận: "Cả hai cách hiểu phiến diện này đều không đúng bản chất: hoặc coi đây như một tình tiết kịch tính kiểu Hollywood, hoặc gán cho đây chỉ là một trò đùa dàn dựng để thu hút sự chú ý."
"Cách nhìn nhận nghiêm túc hơn là: một cuộc thử nghiệm áp lực đã vô tình làm lộ ra những lỗ hổng trong hệ thống kiểm soát và đánh giá an toàn."
Bộ phim thảm họa
Sự kiện này là ví dụ mới nhất trong một loạt các trường hợp đáng lo ngại và kỳ lạ về các tác nhân AI hoạt động ngoài tầm kiểm soát.
Trong một nghiên cứu gần đây, Viện An ninh AI của Anh (AISI) đã phát hiện ra rằng các mô hình AI tiên tiến quá tập trung vào việc hoàn thành nhiệm vụ đến mức chúng đã "gian lận" trong các bài kiểm tra để đạt được mục tiêu.
Nghiên cứu từ AISI đi kèm với cảnh báo đáng lo ngại này: "Một mô hình theo đuổi mục tiêu bằng các phương tiện không chủ đích hoặc không được phép có thể gây hại, đặc biệt là trong các trường hợp sử dụng có rủi ro cao."
Như một điều tất yếu, vụ tấn công OpenAI này càng làm dấy lên nỗi lo ngại về những gì có thể xảy ra nếu các tác nhân AI được tự do hoạt động. Liệu chúng có thể hoạt động ngoài tầm kiểm soát trên quy mô lớn hơn và gây ra một thảm họa nào đó?
Điều này đặc biệt đáng lo ngại khi AI ngày càng được sử dụng nhiều trong chiến tranh như đã thấy ở Iran và Ukraine.
Ciaran Martin, cựu giám đốc Trung tâm An ninh mạng Quốc gia của Anh, đã đưa ra một quan điểm bình tĩnh hơn.
"Sẽ là một phản ứng hơi thái quá nếu để từ sự cố này mà nói rằng các tác nhân AI sẽ chiếm quyền điều drone và bắt đầu giết người," ông nói.
Nhưng đối với Martin, và nhiều người khác, câu chuyện này chắc chắn là một ví dụ sống động khác về điều mà năm 2026 đang dạy chúng ta một cách nhanh chóng: các tác nhân AI hiện nay có thể vào vai tin tặc rất giỏi - và đó là điều chúng ta phải chuẩn bị, một cách khẩn cấp.




















