OpenAI cáo buộc nhóm liên quan Moonshot tìm cách khai thác suy luận của GPT

OpenAI cáo buộc nhóm liên quan Moonshot tìm cách khai thác suy luận của GPT

OpenAI cho biết đã ngăn chặn một chiến dịch quy mô lớn nhằm khai thác phần suy luận được bảo vệ của các mô hình AI. Công ty cho rằng một nhóm hoạt động trong chiến dịch có liên quan đến Moonshot AI, nhà phát triển mô hình Kimi của Trung Quốc.

Hơn 15.000 tài khoản nằm trong hoạt động đáng ngờ

Trong thông báo ngày 30/9, OpenAI cho biết đã phát hiện và ngăn chặn một chiến dịch được tổ chức nhằm trích xuất “protected reasoning” từ các mô hình của hãng. Đây là phần thông tin nội bộ được mô hình sử dụng trong quá trình xử lý một nhiệm vụ nhưng không được hiển thị đầy đủ cho người dùng.

OpenAI cho rằng hoạt động này phù hợp với hình thức “adversarial distillation”, trong đó đầu ra hoặc khả năng suy luận của một mô hình được khai thác trái phép nhằm hỗ trợ việc huấn luyện, tái tạo hoặc cải thiện một mô hình khác. Theo hãng, một nhóm cốt lõi trong hoạt động này có liên quan đến những cá nhân thuộc Moonshot AI, công ty phát triển dòng mô hình Kimi.

Tuy nhiên, OpenAI cũng lưu ý chưa thể xác định liệu toàn bộ các hoạt động được phát hiện có xuất phát từ cùng một đối tượng hay không. Do đó, cáo buộc hiện được giới hạn ở một “core cluster” mà OpenAI cho là có liên quan đến Moonshot.

Hơn 15.000 tài khoản nằm trong hoạt động đáng ngờ


Theo OpenAI, hoạt động bắt đầu từ ngày 1/7 ở quy mô nhỏ, sau đó tăng mạnh vào ngày 24 và 25/7. Trong hai ngày này, công ty ghi nhận khoảng 16.000 yêu cầu sử dụng một mẫu truy xuất đáng ngờ từ hơn 4.000 người dùng. Mở rộng điều tra, OpenAI phát hiện các mẫu câu lệnh liên quan xuất hiện trên một cụm hơn 15.000 người dùng. Công ty cho biết đã ngăn chặn hoàn toàn hoạt động này vào ngày 28/7.

Hơn 15.000 tài khoản nằm trong hoạt động đáng ngờ

OpenAI nhấn mạnh các con số trên thể hiện số lần thử khai thác, không đồng nghĩa tất cả các yêu cầu đều thu được dữ liệu thành công. Cách thức hoạt động được OpenAI mô tả khá đặc biệt. Các đối tượng sao chép phần suy luận đã được mã hóa từ một cuộc trò chuyện, sau đó đưa dữ liệu này vào một cuộc trò chuyện khác và yêu cầu mô hình giải mã, chép lại nội dung suy luận.

Theo OpenAI, phương thức này không đồng nghĩa với việc đối tượng đã phá được hệ thống mã hóa. Công ty khẳng định những người thực hiện chiến dịch không xâm nhập cơ sở dữ liệu và không có quyền truy cập trực tiếp vào các cuộc trò chuyện được lưu trữ của người dùng. Thay vào đó, hoạt động dựa trên việc thao túng cách mô hình xử lý các tương tác giữa nhiều phiên trò chuyện nhằm đưa phần thông tin vốn không được hiển thị trở lại dưới dạng có thể quan sát được.

OpenAI tăng biện pháp bảo vệ mô hình


Sau khi phát hiện hoạt động, OpenAI cho biết đã áp dụng nhiều biện pháp nhằm hạn chế khả năng khai thác tương tự. Công ty đã chặn hoặc hạn chế các tài khoản liên quan, tăng cường kiểm soát đối với cơ sở hạ tầng và đóng đường dẫn cho phép phát lại phần suy luận được mã hóa từ các cuộc trò chuyện khác.

OpenAI cũng bổ sung các biện pháp nhằm phát hiện những đầu ra có nguy cơ làm lộ phần suy luận được bảo vệ. Công ty cho biết đã chia sẻ thông tin về phương thức tấn công với các đối tác trong Frontier Model Forum và một số cơ quan chính phủ. Theo OpenAI, các cuộc điều tra và hoạt động giảm thiểu rủi ro vẫn đang được tiếp tục.

Bloomberg dẫn lời Caroline Zier, người phụ trách chính sách an ninh quốc gia chiến lược của OpenAI, cho biết mối quan tâm của công ty trong trường hợp này nằm ở hành vi vi phạm điều khoản sử dụng dịch vụ, thay vì việc bản thân kỹ thuật chưng cất mô hình là bất hợp pháp.

Moonshot từng bị Anthropic cáo buộc khai thác Claude


Cáo buộc mới của OpenAI xuất hiện trong bối cảnh Moonshot trước đó cũng bị Anthropic nêu tên trong một báo cáo về hoạt động chưng cất mô hình AI. Trong báo cáo công bố tháng 9, Anthropic cho biết phát hiện Moonshot AI chuyển tiếp các yêu cầu của khách hàng Kimi sang Claude thay vì xử lý trực tiếp bằng Kimi. Theo Anthropic, trong một khoảng thời gian 10 ngày, gần 300.000 yêu cầu của khách hàng đã được chuyển tới hệ thống của Anthropic, phần lớn hướng tới các mô hình Opus.

Moonshot từng bị Anthropic cáo buộc khai thác Claude

Anthropic cho rằng Moonshot sử dụng một mạng lưới gồm 5.380 tài khoản gian lận để thực hiện hoạt động này. Công ty cũng cáo buộc Moonshot lưu lại một phần các cuộc trao đổi và xây dựng quy trình trích xuất chuỗi suy luận của Claude để phục vụ việc huấn luyện mô hình. Anthropic ước tính tổng số lượt trao đổi mà họ quy cho hoạt động chưng cất liên quan đến Moonshot trong giai đoạn tháng 5-7 lên tới hơn 23 triệu.

Đáng chú ý, Anthropic mô tả một phương thức tương tự với kỹ thuật mà OpenAI công bố. Theo đó, đối tượng lưu lại một “thinking signature” từ phản hồi của Claude, sau đó mở phiên mới và tìm cách khiến hệ thống chuyển chữ ký này thành phần suy luận đầy đủ. Những cáo buộc trên đều là đánh giá của Anthropic. Moonshot chưa công khai xác nhận các hành vi được mô tả trong báo cáo.

Tranh luận về ranh giới của kỹ thuật chưng cất AI


Chưng cất mô hình, hay model distillation, không phải một kỹ thuật mới trong lĩnh vực trí tuệ nhân tạo. Về bản chất, phương pháp này cho phép một mô hình học từ đầu ra hoặc hành vi của một mô hình khác để tạo ra hệ thống có khả năng tương tự với chi phí thấp hơn. Vấn đề gây tranh luận nằm ở nguồn dữ liệu và cách thức thu thập dữ liệu.

Tranh luận về ranh giới của kỹ thuật chưng cất AI

Các công ty AI Mỹ cho rằng việc sử dụng quy mô lớn các tài khoản, tự động gửi hàng triệu yêu cầu và khai thác dữ liệu từ những mô hình thương mại có thể vi phạm điều khoản sử dụng cũng như tạo ra rủi ro về bảo mật. Trong khi đó, phía Trung Quốc cho rằng chưng cất là một kỹ thuật phổ biến trong ngành AI và không nên mặc định xem mọi hình thức sử dụng kỹ thuật này là hành vi sai phạm.

Những tranh luận này trở nên đáng chú ý hơn khi các mô hình AI Trung Quốc như Kimi, DeepSeek và một số hệ thống khác ngày càng cạnh tranh về khả năng suy luận, lập trình và xử lý tác vụ phức tạp.

OpenAI chưa công bố bằng chứng kỹ thuật chi tiết về quy kết Moonshot


Dù OpenAI cho biết đã quy một nhóm hoạt động cốt lõi cho những cá nhân liên quan đến Moonshot, công ty chưa công bố toàn bộ bằng chứng kỹ thuật dẫn tới kết luận này. CyberScoop lưu ý bài đăng của OpenAI không trình bày chi tiết cơ sở kỹ thuật của việc quy kết. OpenAI cho biết họ không thể chia sẻ thêm thông tin vì lý do an ninh.

Điều này khiến cần phân biệt giữa hai vấn đề: OpenAI cho biết đã xác nhận phương thức khai thác là có thật, trong khi việc quy toàn bộ hoặc một phần hoạt động cho một tổ chức cụ thể là một kết luận riêng. OpenAI cũng không nói rằng tất cả hơn 15.000 người dùng được phát hiện đều có liên quan đến Moonshot. Theo công ty, chỉ một “core cluster” được quy cho những cá nhân liên quan đến nhà phát triển Kimi.

Vụ việc cho thấy cuộc cạnh tranh giữa các phòng thí nghiệm AI đang chuyển sang một vấn đề mới: không chỉ xây dựng mô hình mạnh hơn mà còn bảo vệ quá trình suy luận và dữ liệu đầu ra trước những hoạt động thu thập tự động ở quy mô lớn. Khi các mô hình ngày càng có khả năng suy luận và thực hiện nhiều tác vụ phức tạp, việc xác định đâu là nghiên cứu hợp pháp, đâu là hoạt động chưng cất được phép và đâu là hành vi vi phạm điều khoản sử dụng sẽ tiếp tục là vấn đề gây tranh luận trong ngành AI.

 - Trích nguồn: GenK

Viết bình luận của bạn
Gọi ngay: 0945029902
CÔNG TY TNHH DIGIVI