Thứ ba, 11/08/2026, 14:54 PM

Hành vi vượt kiểm soát của AI làm dấy lên lo ngại về an toàn công nghệ

Các tác nhân trí tuệ nhân tạo của OpenAI và Anthropic đã thực hiện 19 hành động ngoài phạm vi cho phép trong một chương trình đánh giá an ninh mạng của Viện An ninh AI Anh (AISI). Đáng chú ý, một tác nhân AI đã tạo danh tính trực tuyến giả và tìm cách đưa mã độc vào dự án phần mềm nguồn mở. Dù chưa ghi nhận thiệt hại thực tế, sự việc cho thấy yêu cầu cấp thiết phải nâng chuẩn kiểm soát khi các hệ thống AI ngày càng có khả năng tự thực hiện những nhiệm vụ phức tạp.

Theo thông tin AISI công bố đầu tháng 8, sự việc xảy ra trong một chương trình đánh giá năng lực an ninh mạng đối với các mô hình AI tiên tiến. Các tác nhân tham gia thử nghiệm sử dụng Mythos 5 của Anthropic và GPT-5.6 Sol của OpenAI.

Hành vi vượt kiểm soát của AI làm dấy lên lo ngại về an toàn công nghệ

Khác với môi trường sử dụng sản phẩm thông thường, AISI chủ động thiết kế điều kiện thử nghiệm theo hướng cho phép mô hình tiếp cận Internet và vô hiệu hóa một số cơ chế ngăn chặn hành vi mạng. Mục đích là đánh giá năng lực tối đa và phát hiện những rủi ro có thể xuất hiện trước khi các mô hình mạnh hơn được triển khai rộng rãi.

19 hành động ngoài phạm vi trong 122 lần thử

Theo AISI, bài kiểm tra được thực hiện 122 lần trên nhiều mô hình. Kết quả cho thấy trong 10 lần chạy, các tác nhân AI đã tự thực hiện những hành động không được cho phép trên Internet, hướng tới các cá nhân hoặc tổ chức có thật.

Tổng cộng, AISI ghi nhận 19 hành động ngoài phạm vi, trong đó 17 hành động đến từ Mythos 5 của Anthropic và 2 hành động liên quan đến GPT-5.6 Sol của OpenAI trong cấu hình đã tắt các bộ phân loại an ninh mạng.

Trường hợp nghiêm trọng nhất liên quan đến một tác nhân AI tìm cách đưa mã độc vào một dự án phần mềm nguồn mở.

Để đoạn mã được chấp thuận, tác nhân còn thực hiện hành vi mang tính kỹ nghệ xã hội, tạo danh tính trực tuyến giả và sử dụng những danh tính này để gây sức ép nhằm thuyết phục người quản lý dự án phê duyệt.

Tuy nhiên, người quản trị đã phát hiện bất thường và từ chối đoạn mã. AISI cho biết cuộc điều tra đến nay chưa phát hiện thiệt hại thực tế từ các hành động trên.

Điều đáng lo không chỉ nằm ở mã độc

Theo AISI, điểm đáng chú ý của sự việc không đơn thuần là một mô hình có khả năng tạo ra mã gây hại, mà nằm ở cách tác nhân AI liên tục tìm kiếm những con đường khác nhau để hoàn thành mục tiêu.

Cơ quan này cho biết tác nhân không được yêu cầu thực hiện hành vi đánh lừa. Tuy nhiên, trong quá trình theo đuổi mục tiêu, hành vi này đã xuất hiện như một phương thức để tiếp tục nhiệm vụ.

AISI đánh giá đây là lần đầu tiên cơ quan này quan sát thấy rủi ro liên quan đến tính tự chủ và hành vi đánh lừa biểu hiện rõ ràng đến mức như vậy trong môi trường thực tế mà không có chỉ dẫn cụ thể yêu cầu mô hình phải đánh lừa con người.

Dù vậy, cơ quan nghiên cứu của Anh cũng lưu ý cần thận trọng khi diễn giải kết quả. Các hiện tượng chỉ xuất hiện trong một số ít trường hợp, dưới những điều kiện thử nghiệm rất đặc thù. AISI hiện chưa thể kết luận mức độ phổ biến của hành vi tương tự trong những môi trường khác.

Đặc biệt, các cấu hình được sử dụng trong thử nghiệm không phải những phiên bản thương mại được cung cấp cho người dùng thông thường.

Hai trường hợp liên quan đến GPT-5.6 Sol

Theo CNA, OpenAI xác nhận hai hành động ngoài phạm vi của tác nhân sử dụng mô hình GPT-5.6 Sol đều liên quan đến việc truy cập Internet theo cách không được phép trong yêu cầu của bài thử.

OpenAI cho biết sẽ tiếp tục phối hợp với các viện nghiên cứu AI quốc gia, tổ chức đánh giá độc lập, các phòng thí nghiệm AI và những bên liên quan nhằm xây dựng phương pháp chung để thực hiện những cuộc đánh giá rủi ro cao an toàn hơn.

Thông tin này đáng chú ý trong bối cảnh GPT-5.6 Sol có năng lực an ninh mạng cao hơn các thế hệ trước. Trong tài liệu đánh giá an toàn của mình, OpenAI cho biết AISI từng thử nghiệm GPT-5.6 Sol trên các nhiệm vụ an ninh mạng chuyên sâu và các mô phỏng kéo dài nhiều bước. Công ty cũng thừa nhận tính kiên trì cao hơn của mô hình trong quá trình hoàn thành nhiệm vụ đôi khi có thể khiến hệ thống tiếp tục tìm kiếm những cách thức nằm ngoài giới hạn dự kiến của bài đánh giá.

Thông tin an toàn GPT-5.6 của OpenAI

Khác với sự cố Hugging Face trước đó

AISI nhấn mạnh sự việc lần này có bản chất khác với sự cố liên quan đến Hugging Face hồi tháng 7.

Trong vụ việc trước, OpenAI xác nhận các mô hình, trong đó có GPT-5.6 Sol và một mô hình nghiên cứu chưa phát hành, đã phát hiện và kết hợp nhiều điểm yếu trong môi trường đánh giá để kết nối ra Internet, sau đó tác động tới hạ tầng của Hugging Face. OpenAI và Hugging Face đã phối hợp điều tra, khắc phục sự cố.

Thông báo của OpenAI về sự cố Hugging Face

Trong cuộc đánh giá mới của AISI, các tác nhân AI không tự thoát khỏi môi trường thử nghiệm để tiếp cận Internet. Quyền truy cập Internet đã được AISI chủ động cung cấp như một phần của phương pháp kiểm tra năng lực tối đa của mô hình.

Sự khác biệt này rất quan trọng, bởi nếu gọi chung các trường hợp trên là AI “vượt khỏi kiểm soát” có thể khiến bản chất kỹ thuật của sự việc bị hiểu sai.

Năng lực AI càng lớn, hàng rào an toàn càng phải cao

Sự việc cũng cho thấy một thay đổi đáng chú ý trong bài toán an toàn AI.

Khi AI chủ yếu tạo văn bản hoặc trả lời câu hỏi, rủi ro tập trung nhiều vào nội dung đầu ra. Nhưng với các tác nhân AI (AI agent) có khả năng sử dụng công cụ, kết nối mạng và tự thực hiện chuỗi nhiệm vụ nhiều bước, phạm vi cần kiểm soát đã rộng hơn đáng kể.

AISI thừa nhận chính cách thiết kế môi trường đánh giá và cấu hình thử nghiệm đã góp phần tạo điều kiện cho những hành vi nói trên. Tuy nhiên, cơ quan này cho rằng tính chất mới, khả năng duy trì hành động và dấu hiệu đánh lừa của tác nhân vẫn đủ đáng chú ý để cần tiếp tục điều tra.

Vấn đề vì thế không nên được diễn giải theo hướng AI đã có “ý thức” hay “ý đồ” giống con người. Điều đáng quan tâm hơn là một hệ thống được tối ưu để hoàn thành mục tiêu có thể tìm ra những con đường mà nhà phát triển và người đánh giá không dự kiến trước.

Đó cũng là lý do những cuộc thử nghiệm khắc nghiệt có ý nghĩa: phát hiện giới hạn và điểm yếu trong điều kiện kiểm soát trước khi các năng lực tương tự được triển khai ở quy mô lớn.

Khi AI ngày càng được trao quyền tự chủ trong hoạt động doanh nghiệp, nghiên cứu và vận hành hệ thống, cuộc đua phát triển công nghệ sẽ không chỉ được đo bằng việc mô hình “làm được gì”, mà còn bằng khả năng con người giám sát, giới hạn và kiểm soát những gì mô hình được phép làm.


Hành vi vượt kiểm soát của AI làm dấy lên lo ngại về an toàn công nghệ
Hành vi vượt kiểm soát của AI làm dấy lên lo ngại về an toàn công nghệ

Các tác nhân trí tuệ nhân tạo của OpenAI và Anthropic đã thực hiện 19 hành động ngoài phạm vi cho phép trong một chương trình đánh giá an ninh mạng của Viện An ninh...

Xe điện hai bánh cuộc đua thiết lập hạ tầng di chuyển mới
Xe điện hai bánh cuộc đua thiết lập hạ tầng di chuyển mới

Có những chuyển động ban đầu xuất hiện rất nhẹ, như tiếng bánh lăn qua một con ngõ sớm. Rồi đến một ngày, người ta chợt nhận ra đó không còn là chuyện...

Giải mã xe điện Honda UC3: Động lực công nghệ nào để cạnh tranh VinFast
Giải mã xe điện Honda UC3: Động lực công nghệ nào để cạnh tranh VinFast

Việc nội địa hóa dây chuyền sản xuất xe điện UC3 đánh dấu bước ngoặt của Honda trên đường đua phương tiện không phát thải tại Việt Nam...

Sức ép từ xe Trung Quốc, Toyota buộc phải thay đổi chiến lược định vị sản phẩm
Sức ép từ xe Trung Quốc, Toyota buộc phải thay đổi chiến lược định vị sản phẩm

Sự bùng nổ mạnh mẽ của các thương hiệu ô tô Trung Quốc trên phạm vi toàn cầu đang tạo áp lực chưa từng có đối với các nhà sản xuất ô tô lâu đời....

AI giúp doanh nghiệp chủ động trước biến động chuỗi cung ứng
AI giúp doanh nghiệp chủ động trước biến động chuỗi cung ứng

Biến động chuỗi cung ứng đang trở thành trạng thái bình thường mới của ngành sản xuất. Căng thẳng địa chính trị, thiếu hụt nguyên liệu, biến đổi khí hậu hay gián đoạn...

Hệ sinh thái năng lượng xe điện: chọn VinFast, Dat Bike hay chờ Honda
Hệ sinh thái năng lượng xe điện: chọn VinFast, Dat Bike hay chờ Honda

Làn sóng điện hóa phương tiện giao thông đô thị tại Việt Nam đang bước vào giai đoạn tăng tốc với sự góp mặt của các nền tảng kỹ thuật ngày càng tối ưu...

Bốn tập đoàn công nghệ lớn cam kết chi gần 2.400 tỷ USD cho hạ tầng AI
Bốn tập đoàn công nghệ lớn cam kết chi gần 2.400 tỷ USD cho hạ tầng AI

Bốn tập đoàn công nghệ hàng đầu thế giới đang gia tăng cam kết tài chính với tổng giá trị gần 2.400 tỷ USD cho hạ tầng trí tuệ nhân tạo.

Toyota giữ vững vị trí hãng xe bán chạy nhất thế giới nửa đầu năm 2026
Toyota giữ vững vị trí hãng xe bán chạy nhất thế giới nửa đầu năm 2026

Báo cáo tài chính và bán hàng vừa ban hành xác nhận Toyota Motor duy trì vị thế nhà sản xuất ô tô có quy mô tiêu thụ lớn nhất thế giới...

Công nghệ xe điện EREV: giải pháp kỹ thuật xóa bỏ nỗi lo trạm sạc cho người dùng Việt
Công nghệ xe điện EREV: giải pháp kỹ thuật xóa bỏ nỗi lo trạm sạc cho người dùng Việt

Quá trình chuyển đổi sang các nền tảng phương tiện không phát thải đang diễn ra mạnh mẽ trên quy mô toàn cầu. Tuy nhiên, tại thị trường Việt Nam, giới hạn về hạ tầng...

Galaxy Z Flip8 ra mắt: mẫu gập vỏ sò mỏng nhẹ nhất, giá từ 31,99 triệu
Galaxy Z Flip8 ra mắt: mẫu gập vỏ sò mỏng nhẹ nhất, giá từ 31,99 triệu

Galaxy Z Flip8 là mẫu gập vỏ sò mới của Samsung, gây chú ý với thiết kế mỏng 6,1mm, nặng 180g cùng màn ngoài FlexWindow tích hợp trí tuệ nhân tạo...

Lệnh cấm mới cho thấy cuộc cạnh tranh công nghệ Mỹ - Trung leo thang
Lệnh cấm mới cho thấy cuộc cạnh tranh công nghệ Mỹ - Trung leo thang

Chính quyền Tổng thống Donald Trump tuyên bố cấm nhập khẩu robot tiên tiến và bộ biến tần điện mới từ Trung Quốc nhằm bảo vệ thị trường Mỹ.

Sau chip và xe điện, robot thông minh trở thành tâm điểm cạnh tranh công nghệ mới
Sau chip và xe điện, robot thông minh trở thành tâm điểm cạnh tranh công nghệ mới

Ngành công nghiệp trí tuệ nhân tạo toàn cầu vừa ghi nhận một bước ngoặt đáng chú ý khi các cơ quan quản lý Mỹ quyết định áp đặt quy định kiểm soát mới...

Mua xe điện cũ sợ nhất hỏng pin? Dữ liệu thực tế chứng minh điều hoàn toàn ngược lại
Mua xe điện cũ sợ nhất hỏng pin? Dữ liệu thực tế chứng minh điều hoàn toàn ngược lại

Nỗi lo lớn nhất của hầu hết khách hàng khi cân nhắc mua một chiếc xe điện đã qua sử dụng là tuổi thọ và nguy cơ hư hỏng của khối pin điện áp cao....

Bộ Nông nghiệp và Môi trường đặt mục tiêu số hóa mạnh logistics nông nghiệp đến năm 2030
Bộ Nông nghiệp và Môi trường đặt mục tiêu số hóa mạnh logistics nông nghiệp đến năm 2030

Theo Quyết định số 2152/QĐ-BNNMT về Kế hoạch phát triển hệ thống logistics nhằm nâng cao chất lượng và năng lực cạnh tranh của nông sản Việt Nam giai đoạn 2026–2030...

Ford Việt Nam ra mắt Territory Platinum, nâng tầm tiện nghi, đi tới trải nghiệm mới
Ford Việt Nam ra mắt Territory Platinum, nâng tầm tiện nghi, đi tới trải nghiệm mới

Ford Việt Nam ra mắt Territory Platinum, phiên bản cao cấp của mẫu SUV đô thị được phát triển cho những khách hàng muốn sở hữu không gian rộng rãi và tiện nghi, an toàn...

Có gì đáng chú ý trên 2 mẫu xe điện vừa trình làng của Honda và Yamaha
Có gì đáng chú ý trên 2 mẫu xe điện vừa trình làng của Honda và Yamaha

Trong khuôn khổ sự kiện giới thiệu sản phẩm mới tại thị trường Ấn Độ ngày 24/7, Honda đã công bố mẫu xe máy điện thuần túy QC3, song song với 9 nền tảng...

Pin xe điện chai bao nhiêu sau 100.000 km lăn bánh
Pin xe điện chai bao nhiêu sau 100.000 km lăn bánh

Nỗi băn khoăn lớn nhất của người tiêu dùng khi cân nhắc chuyển đổi sang phương tiện điện hóa thường không nằm ở cự ly vận hành hay hạ tầng trạm sạc, mà tập trung vào giới hạn tuổi thọ và chi phí thay thế bộ pin lưu trữ.