Hành vi vượt kiểm soát của AI làm dấy lên lo ngại về an toàn công nghệ
Các tác nhân trí tuệ nhân tạo của OpenAI và Anthropic đã thực hiện 19 hành động ngoài phạm vi cho phép trong một chương trình đánh giá an ninh mạng của Viện An ninh AI Anh (AISI). Đáng chú ý, một tác nhân AI đã tạo danh tính trực tuyến giả và tìm cách đưa mã độc vào dự án phần mềm nguồn mở. Dù chưa ghi nhận thiệt hại thực tế, sự việc cho thấy yêu cầu cấp thiết phải nâng chuẩn kiểm soát khi các hệ thống AI ngày càng có khả năng tự thực hiện những nhiệm vụ phức tạp.
Theo thông tin AISI công bố đầu tháng 8, sự việc xảy ra trong một chương trình đánh giá năng lực an ninh mạng đối với các mô hình AI tiên tiến. Các tác nhân tham gia thử nghiệm sử dụng Mythos 5 của Anthropic và GPT-5.6 Sol của OpenAI.

Khác với môi trường sử dụng sản phẩm thông thường, AISI chủ động thiết kế điều kiện thử nghiệm theo hướng cho phép mô hình tiếp cận Internet và vô hiệu hóa một số cơ chế ngăn chặn hành vi mạng. Mục đích là đánh giá năng lực tối đa và phát hiện những rủi ro có thể xuất hiện trước khi các mô hình mạnh hơn được triển khai rộng rãi.
19 hành động ngoài phạm vi trong 122 lần thử
Theo AISI, bài kiểm tra được thực hiện 122 lần trên nhiều mô hình. Kết quả cho thấy trong 10 lần chạy, các tác nhân AI đã tự thực hiện những hành động không được cho phép trên Internet, hướng tới các cá nhân hoặc tổ chức có thật.
Tổng cộng, AISI ghi nhận 19 hành động ngoài phạm vi, trong đó 17 hành động đến từ Mythos 5 của Anthropic và 2 hành động liên quan đến GPT-5.6 Sol của OpenAI trong cấu hình đã tắt các bộ phân loại an ninh mạng.
Trường hợp nghiêm trọng nhất liên quan đến một tác nhân AI tìm cách đưa mã độc vào một dự án phần mềm nguồn mở.
Để đoạn mã được chấp thuận, tác nhân còn thực hiện hành vi mang tính kỹ nghệ xã hội, tạo danh tính trực tuyến giả và sử dụng những danh tính này để gây sức ép nhằm thuyết phục người quản lý dự án phê duyệt.
Tuy nhiên, người quản trị đã phát hiện bất thường và từ chối đoạn mã. AISI cho biết cuộc điều tra đến nay chưa phát hiện thiệt hại thực tế từ các hành động trên.
Điều đáng lo không chỉ nằm ở mã độc
Theo AISI, điểm đáng chú ý của sự việc không đơn thuần là một mô hình có khả năng tạo ra mã gây hại, mà nằm ở cách tác nhân AI liên tục tìm kiếm những con đường khác nhau để hoàn thành mục tiêu.
Cơ quan này cho biết tác nhân không được yêu cầu thực hiện hành vi đánh lừa. Tuy nhiên, trong quá trình theo đuổi mục tiêu, hành vi này đã xuất hiện như một phương thức để tiếp tục nhiệm vụ.
AISI đánh giá đây là lần đầu tiên cơ quan này quan sát thấy rủi ro liên quan đến tính tự chủ và hành vi đánh lừa biểu hiện rõ ràng đến mức như vậy trong môi trường thực tế mà không có chỉ dẫn cụ thể yêu cầu mô hình phải đánh lừa con người.
Dù vậy, cơ quan nghiên cứu của Anh cũng lưu ý cần thận trọng khi diễn giải kết quả. Các hiện tượng chỉ xuất hiện trong một số ít trường hợp, dưới những điều kiện thử nghiệm rất đặc thù. AISI hiện chưa thể kết luận mức độ phổ biến của hành vi tương tự trong những môi trường khác.
Đặc biệt, các cấu hình được sử dụng trong thử nghiệm không phải những phiên bản thương mại được cung cấp cho người dùng thông thường.
Hai trường hợp liên quan đến GPT-5.6 Sol
Theo CNA, OpenAI xác nhận hai hành động ngoài phạm vi của tác nhân sử dụng mô hình GPT-5.6 Sol đều liên quan đến việc truy cập Internet theo cách không được phép trong yêu cầu của bài thử.
OpenAI cho biết sẽ tiếp tục phối hợp với các viện nghiên cứu AI quốc gia, tổ chức đánh giá độc lập, các phòng thí nghiệm AI và những bên liên quan nhằm xây dựng phương pháp chung để thực hiện những cuộc đánh giá rủi ro cao an toàn hơn.
Thông tin này đáng chú ý trong bối cảnh GPT-5.6 Sol có năng lực an ninh mạng cao hơn các thế hệ trước. Trong tài liệu đánh giá an toàn của mình, OpenAI cho biết AISI từng thử nghiệm GPT-5.6 Sol trên các nhiệm vụ an ninh mạng chuyên sâu và các mô phỏng kéo dài nhiều bước. Công ty cũng thừa nhận tính kiên trì cao hơn của mô hình trong quá trình hoàn thành nhiệm vụ đôi khi có thể khiến hệ thống tiếp tục tìm kiếm những cách thức nằm ngoài giới hạn dự kiến của bài đánh giá.
Thông tin an toàn GPT-5.6 của OpenAI
Khác với sự cố Hugging Face trước đó
AISI nhấn mạnh sự việc lần này có bản chất khác với sự cố liên quan đến Hugging Face hồi tháng 7.
Trong vụ việc trước, OpenAI xác nhận các mô hình, trong đó có GPT-5.6 Sol và một mô hình nghiên cứu chưa phát hành, đã phát hiện và kết hợp nhiều điểm yếu trong môi trường đánh giá để kết nối ra Internet, sau đó tác động tới hạ tầng của Hugging Face. OpenAI và Hugging Face đã phối hợp điều tra, khắc phục sự cố.
Thông báo của OpenAI về sự cố Hugging Face
Trong cuộc đánh giá mới của AISI, các tác nhân AI không tự thoát khỏi môi trường thử nghiệm để tiếp cận Internet. Quyền truy cập Internet đã được AISI chủ động cung cấp như một phần của phương pháp kiểm tra năng lực tối đa của mô hình.
Sự khác biệt này rất quan trọng, bởi nếu gọi chung các trường hợp trên là AI “vượt khỏi kiểm soát” có thể khiến bản chất kỹ thuật của sự việc bị hiểu sai.
Năng lực AI càng lớn, hàng rào an toàn càng phải cao
Sự việc cũng cho thấy một thay đổi đáng chú ý trong bài toán an toàn AI.
Khi AI chủ yếu tạo văn bản hoặc trả lời câu hỏi, rủi ro tập trung nhiều vào nội dung đầu ra. Nhưng với các tác nhân AI (AI agent) có khả năng sử dụng công cụ, kết nối mạng và tự thực hiện chuỗi nhiệm vụ nhiều bước, phạm vi cần kiểm soát đã rộng hơn đáng kể.
AISI thừa nhận chính cách thiết kế môi trường đánh giá và cấu hình thử nghiệm đã góp phần tạo điều kiện cho những hành vi nói trên. Tuy nhiên, cơ quan này cho rằng tính chất mới, khả năng duy trì hành động và dấu hiệu đánh lừa của tác nhân vẫn đủ đáng chú ý để cần tiếp tục điều tra.
Vấn đề vì thế không nên được diễn giải theo hướng AI đã có “ý thức” hay “ý đồ” giống con người. Điều đáng quan tâm hơn là một hệ thống được tối ưu để hoàn thành mục tiêu có thể tìm ra những con đường mà nhà phát triển và người đánh giá không dự kiến trước.
Đó cũng là lý do những cuộc thử nghiệm khắc nghiệt có ý nghĩa: phát hiện giới hạn và điểm yếu trong điều kiện kiểm soát trước khi các năng lực tương tự được triển khai ở quy mô lớn.
Khi AI ngày càng được trao quyền tự chủ trong hoạt động doanh nghiệp, nghiên cứu và vận hành hệ thống, cuộc đua phát triển công nghệ sẽ không chỉ được đo bằng việc mô hình “làm được gì”, mà còn bằng khả năng con người giám sát, giới hạn và kiểm soát những gì mô hình được phép làm.
Apple ra mắt iPhone 18 Pro: Màu đỏ burgundy gây chú ý, camera lần đầu có khẩu độ cơ học
Apple chính thức trình làng iPhone 18 Pro và 18 Pro Max với loạt nâng cấp đáng chú ý về camera, hiệu năng và pin. Đáng chú ý, màu Đỏ burgundy mới cùng hệ thống...
Xiaomi Pad 9 Pro Max lộ diện: Màn hình 13,3 inch, chip tự phát triển mạnh hơn cả A19 Pro?
Sau thời gian dài chờ đợi, Xiaomi đã hé lộ thiết kế cùng loạt thông số đáng chú ý của Xiaomi Pad 9 Pro Max. Mẫu tablet cao cấp này dự kiến trình làng tại Trung Quốc ngày 7/9, nổi bật với màn hình 13,3 inch, chip Xring O3 10 nhân, pin hơn 10.000 mAh và sạc nhanh 120W.
Robot hình người bắt đầu làm việc nhà thay con người
Hút bụi, lau sàn, vệ sinh bếp hay cọ rửa nhà vệ sinh, những công việc vốn gắn với căn bếp và đời sống gia đình đang dần được chuyển giao cho robot hình người...
Honor âm thầm ra mắt smartphone pin 8.100 mAh, chống nước IP69K, có phím AI riêng
Honor vừa âm thầm giới thiệu Honor 600S 5G, mẫu smartphone tầm trung gây chú ý với viên pin 8.100 mAh, khả năng chống nước chống bụi chuẩn IP69K và loạt tính năng AI được tích hợp ngay trên máy.
Trước khi vay mua xe, hãy trả lời 3 câu hỏi này
Để việc mua xe trả góp thực sự là đòn bẩy kinh tế thay vì gánh nặng, người mua xe cần tỉnh táo phân tích bài toán tài chính cá nhân...
Cận cảnh khối động cơ và công nghệ pin giúp Honda Super-One lập kỷ lục chốt đơn
Theo dữ liệu từ chuyên trang Drive, mẫu ô tô điện đô thị Honda Super-One vừa tạo nên một hiện tượng hiếm thấy tại thị trường Australia khi toàn bộ lô xe phân bổ đợt đầu gồm 125 chiếc đã được khách hàng đặt cọc kín chỉ sau vài giờ mở bán.
Phenikaa-X tham gia Dự án thử nghiệm xe buýt tự hành, robotaxi và robot giao hàng tại Hòa Lạc
Hà Nội cho phép Công ty cổ phần Phenikaa-X thử nghiệm có kiểm soát hệ thống giao thông tự hành thông minh tại Khu Công nghệ cao Hòa Lạc và Đại học Quốc gia Hà Nội cơ sở Hòa Lạc trong 24 tháng.
Kỳ 5: VinFast và bài học công nghiệp Việt Nam
Một chiếc xe điện khi lăn bánh trên phố được coi là sản phẩm tiêu dùng. Nhưng ở tầng sâu hơn, nó là bản tổng phổ của một nền công nghiệp ô tô gồm...
Công nghệ đổi pin tự động và cơ khí gập thông minh trên xe máy điện
Trong bối cảnh hạ tầng giao thông đô thị ngày càng chật hẹp, các nhà sản xuất xe máy điện đang liên tục ứng dụng những giải pháp cơ khí và công nghệ lưu trữ năng lượng mới.
NVIDIA đề xuất xây dựng mô hình ngôn ngữ lớn do Việt Nam làm chủ
Tại cuộc làm việc với Bộ Khoa học và Công nghệ, lãnh đạo NVIDIA đã đề xuất 4 hướng hợp tác trọng tâm với Việt Nam, gồm phát triển mô hình ngôn ngữ lớn...
Tesla và 8 hãng xe triệu hồi 4,3 triệu phương tiện tại thị trường Trung Quốc
Một chiến dịch an toàn ô tô quy mô chưa từng có vừa được kích hoạt tại Trung Quốc khi Tesla cùng tám nhà sản xuất khác thông báo triệu hồi khoảng 4,3 triệu...
Apple đưa iPhone X và MacBook Pro 2018 vào danh sách lỗi thời
Apple đã chính thức bổ sung iPhone X cùng MacBook Pro 15 inch sản xuất năm 2018 vào danh mục các thiết bị lỗi thời (obsolete)....
Starlink chính thức cung cấp Internet vệ tinh tại Việt Nam, giá từ hơn 1,1 triệu đồng/tháng
Starlink công bố cung cấp dịch vụ Internet vệ tinh tại Việt Nam với hai gói dành cho hộ gia đình, mức giá từ 1.131.990 đồng/tháng....
Bán tải VinFast VF Wild lộ bản chạy thử: Tối ưu linh kiện cơ điện tử, chờ đợi đột phá từ công nghệ EREV
Ngày 6/8, những hình ảnh rò rỉ đầu tiên về nguyên mẫu tiền thương mại của mẫu bán tải điện VinFast VF Wild đã thu hút sự chú ý lớn từ giới chuyên môn khi xuất hiện tại một sự kiện nội bộ.
Hành vi vượt kiểm soát của AI làm dấy lên lo ngại về an toàn công nghệ
Các tác nhân trí tuệ nhân tạo của OpenAI và Anthropic đã thực hiện 19 hành động ngoài phạm vi cho phép trong một chương trình đánh giá an ninh mạng của Viện An ninh...
Xe điện hai bánh cuộc đua thiết lập hạ tầng di chuyển mới
Có những chuyển động ban đầu xuất hiện rất nhẹ, như tiếng bánh lăn qua một con ngõ sớm. Rồi đến một ngày, người ta chợt nhận ra đó không còn là chuyện...
Giải mã xe điện Honda UC3: Động lực công nghệ nào để cạnh tranh VinFast
Việc nội địa hóa dây chuyền sản xuất xe điện UC3 đánh dấu bước ngoặt của Honda trên đường đua phương tiện không phát thải tại Việt Nam...
Sức ép từ xe Trung Quốc, Toyota buộc phải thay đổi chiến lược định vị sản phẩm
Sự bùng nổ mạnh mẽ của các thương hiệu ô tô Trung Quốc trên phạm vi toàn cầu đang tạo áp lực chưa từng có đối với các nhà sản xuất ô tô lâu đời....
AI giúp doanh nghiệp chủ động trước biến động chuỗi cung ứng
Biến động chuỗi cung ứng đang trở thành trạng thái bình thường mới của ngành sản xuất. Căng thẳng địa chính trị, thiếu hụt nguyên liệu, biến đổi khí hậu hay gián đoạn...


