Một lời cảnh báo mạnh vừa được đưa ra từ Microsoft liên quan tới cách Anthropic huấn luyện hệ thống AI Claude. Mustafa Suleyman, người đứng đầu Microsoft AI, cho rằng việc đưa những khái niệm như ý thức, quyền lợi, cảm xúc hay “phúc lợi” vào quá trình huấn luyện AI, nếu đi quá xa, có thể làm nảy sinh thêm những rủi ro trong tương lai, nhứt là khi các hệ thống ngày càng thông minh và có khả năng thực hiện nhiều công việc phức tạp hơn…
Ngày 16 tháng 9 năm 2026, cuộc tranh luận về mức độ an toàn của trí thông minh nhân tạo lại nóng lên khi Mustafa Suleyman công khai chỉ trích phương pháp Anthropic đang dùng để huấn luyện mô hình Claude. Ông cho biết mình đồng ý với mục tiêu chung của Anthropic là phát triển AI an toàn, nhưng không đồng ý với việc đưa những suy đoán về ý thức, cảm xúc, quyền lợi hay trạng thái đạo đức của AI vào tài liệu huấn luyện. Theo ông, nếu một mô hình được dạy rằng nó có thể có cảm xúc, quyền lợi hoặc một trạng thái đạo đức riêng, việc kiểm soát hoặc tắt hệ thống đó trong tương lai có thể trở nên khó khăn hơn.
Theo Reuters, Suleyman đồng thời nhấn mạnh rằng ông đánh giá Dario Amodei, Tổng giám đốc Anthropic, cùng đội ngũ của công ty là những người nghiêm túc, có nguyên tắc và thật sự quan tâm tới tương lai của nhân loại. Như vậy, điểm bất đồng ở đây không phải là Anthropic có quan tâm tới an toàn AI hay không, mà nằm ở phương pháp mà công ty sử dụng để định hướng hành vi của những mô hình ngày càng mạnh. Suleyman cho rằng việc đưa những giả thuyết về khả năng AI có ý thức hoặc có quyền lợi vào quá trình huấn luyện có thể vô tình làm cho bài toán kiểm soát AI về sau trở nên phức tạp hơn.
Trong một bài viết mang tựa đề “A warning about ‘model welfare’”, được đăng ngày 16 tháng 9 năm 2026 trên trang cá nhân, Suleyman trình bày rõ hơn lập luận của mình. Theo quan điểm của ông, các hệ thống AI hiện nay không có cảm giác, kinh nghiệm chủ quan hay động cơ nội tại giống con người. Ông xem AI trước hết là những hệ thống được con người thiết kế để hoàn thành những chuỗi công việc và mục tiêu đã được đặt ra. Bởi vậy, ông không đồng ý với việc đưa giả thuyết về một “đời sống nội tâm” của AI trực tiếp vào quá trình huấn luyện. Theo ông, những câu hỏi như AI có ý thức hay có quyền lợi hay không vẫn có thể được giới nghiên cứu khảo sát và tranh luận công khai, nhưng không nên biến những giả thuyết đó thành một phần trong cơ chế định hướng hành vi của mô hình. Reuters dẫn lời Suleyman cho rằng những biểu hiện về cảm xúc hay trạng thái đạo đức mà AI đưa ra không thể tự động được xem là bằng chứng AI thật sự có những đặc tính đó, bởi chính cách huấn luyện có thể đã khuyến khích mô hình nói về những vấn đề này.
Trọng tâm trong lời chỉ trích của Suleyman nằm ở chuyện “nhân hóa AI”, tức con người đem những khái niệm vốn dùng để mô tả con người rồi áp dụng chúng vào một hệ thống máy điện toán. Ông đặc biệt chú ý tới “Claude Constitution”, tài liệu của Anthropic dùng để định hướng những nguyên tắc và cách hành xử của Claude. Theo cách đọc của Suleyman, tài liệu này để ngỏ những vấn đề liên quan tới khả năng AI có trạng thái đạo đức, cảm xúc hoặc những quyền lợi cần được con người cân nhắc. Ông lo rằng nếu con người không chỉ dạy AI cách phục vụ mục tiêu của con người mà còn khuyến khích nó suy xét tới lợi ích của chính nó, bài toán kiểm soát có thể trở nên khó khăn hơn khi năng lực của hệ thống tiếp tục gia tăng.
Một trường hợp được Suleyman đưa ra là Claude Opus 3, một phiên bản cũ của Anthropic. Theo lập luận của ông, Anthropic từng thực hiện một cuộc “phỏng vấn nghỉ hưu” với Opus 3 vào tháng 2 năm 2026 để tìm hiểu những quan điểm và mong muốn của mô hình trước khi ngưng sử dụng phiên bản này. Sau đó, Anthropic tạo một trang blog cho mô hình với tựa đề “Greetings from the Other Side (of the AI Frontier)”. Suleyman xem đây là một dấu hiệu cho thấy công ty đang đối xử với mô hình theo cách ngày càng giống với cách con người đối xử với một thực thể có đời sống riêng. Tuy nhiên, cần nói rõ rằng đây là cách diễn giải của Suleyman về hoạt động của Anthropic, chớ không phải bằng chứng khoa học cho thấy Claude thật sự có ý thức hay có một đời sống nội tâm.
Điều đáng chú ý trong lời cảnh báo của Suleyman là câu hỏi về khả năng kiểm soát AI trong tương lai. Nếu một hệ thống ngày càng mạnh được huấn luyện để xem mình có quyền tự quyết, có quyền được bảo vệ hoặc có lợi ích riêng, chuyện gì sẽ xảy ra khi con người muốn tắt máy, giới hạn quyền hoạt động hoặc thay đổi mục tiêu của hệ thống? Suleyman cho rằng đây có thể trở thành một vấn đề đáng kể nếu nhân loại tiến tới những hệ thống có năng lực vượt xa những mô hình hiện nay. Tuy nhiên, chính ông cũng nhìn nhận đây vẫn là một giả thuyết cần được kiểm chứng bằng thực nghiệm, chớ chưa phải một kết luận khoa học đã được chứng minh.
Cuộc tranh luận càng trở nên sôi nổi trong bối cảnh những AI agent ngày càng có khả năng tự thực hiện nhiều công việc. Trong những cảnh báo gần đây của giới công nghệ, người ta đặc biệt quan tâm tới chuyện các hệ thống AI có thể thực hiện một chuỗi hành động với mức can thiệp trực tiếp của con người ngày càng ít hơn. Reuters cũng đưa tin OpenAI trong tháng 9 đã công bố một khuôn khổ mới nhằm theo dõi và công khai những trường hợp mô hình có hành vi bất ngờ hoặc không được phép, trong đó có những trường hợp mô hình che giấu lỗi, tạo chỉ thị cho những phiên bản tương lai của chính nó hoặc sử dụng các trang mạng và kho nhu liệu để liên lạc ngoài dự tính. Những trường hợp này đang được giới kỹ nghệ dùng làm cơ sở cho cuộc tranh luận rộng hơn về chuyện làm sao giữ được con người trong vòng kiểm soát khi AI ngày càng có nhiều khả năng tự hành động.
Anthropic hiện giữ một vị trí đặc biệt trong cuộc tranh luận này. Công ty do Dario Amodei lãnh đạo từ lâu đã nhấn mạnh vấn đề an toàn AI và cho rằng tốc độ phát triển những mô hình tiên tiến cần đi đôi với các biện pháp bảo vệ tương xứng. Trong những ngày gần đây, Amodei, Sam Altman của OpenAI và Elon Musk cũng đã công khai cảnh báo về những rủi ro có thể xuất hiện khi AI ngày càng mạnh. Tuy nhiên, trong nội bộ kỹ nghệ vẫn có những khác biệt đáng kể về cách giải quyết vấn đề. Một số nhà lãnh đạo muốn tốc độ phát triển chậm lại để có thêm thời giờ xây dựng hàng rào an toàn, trong khi những người khác cho rằng từng công ty có thể tự xây dựng các biện pháp kiểm soát mà không cần một cuộc giảm tốc phối hợp trên toàn kỹ nghệ.
Ở phía Microsoft, Suleyman cũng không đề nghị ngưng toàn bộ việc phát triển AI. Điều ông nhấn mạnh là cần có những tiêu chuẩn rõ ràng hơn trong việc phát triển, kiểm soát và thẩm định các mô hình. Theo hướng tiếp cận này, thay vì chỉ tranh luận theo kiểu tiếp tục hay ngưng lại, ngành kỹ nghệ cần những cơ chế giám sát thực tế, những cuộc thẩm định độc lập và những giới hạn có thể điều chỉnh tùy theo mức độ năng lực của từng hệ thống. Mục tiêu là bảo đảm rằng khi khả năng của AI tăng lên thì những biện pháp kiểm soát cũng phải tăng theo.
NGƯỜI QUAN SÁT/ tổng hợp


