Một nghiên cứu mới tiết lộ rằng phong cách văn bản của DeepSeek AI có mức tương đồng lên đến 74,2% so với ChatGPT của OpenAI.
Công bố trên arXiv.org ngày 3/3, báo cáo do Copyleaks – công ty chuyên phân tích và so sánh các mô hình AI – thực hiện, đặt ra nghi vấn về việc DeepSeek có thể đã được đào tạo dựa trên dữ liệu đầu ra của ChatGPT. Forbes nhận định phát hiện này có thể tác động sâu rộng đến quyền sở hữu trí tuệ, các quy định về AI cũng như định hướng phát triển của trí tuệ nhân tạo trong tương lai.

Copyleaks đã sử dụng công nghệ sàng lọc tiên tiến và bộ phân loại thuật toán để xác định “dấu vân tay” trong phong cách viết của nhiều mô hình ngôn ngữ, bao gồm OpenAI, Claude, Google Gemini, Meta Llama và DeepSeek. Kết quả cho thấy, hầu hết các mô hình có thể dễ dàng được phân biệt, nhưng đáng chú ý, phần lớn nội dung do DeepSeek tạo ra lại bị hệ thống nhận diện là sản phẩm của OpenAI.
Shai Nisan, Giám đốc khoa học dữ liệu tại Copyleaks, so sánh quy trình này với việc một chuyên gia chữ viết tay cố gắng xác định tác giả của một bản thảo bằng cách so sánh nét chữ với nhiều mẫu có sẵn. “Trong trường hợp này, kết quả không chỉ gây ngạc nhiên mà còn mang nhiều ý nghĩa sâu sắc,” Nisan nói với Forbes. “DeepSeek có sự tương đồng lớn về phong cách với OpenAI, điều mà chúng tôi không thấy ở các mô hình khác.”
Phát hiện này đặt ra câu hỏi quan trọng về cách DeepSeek được đào tạo và liệu có khả năng nó đã sử dụng đầu ra từ các mô hình OpenAI hay không. “Mặc dù những điểm tương đồng này chưa thể chứng minh chắc chắn rằng DeepSeek là một sản phẩm phái sinh, nhưng chúng đặt ra nghi vấn về quy trình phát triển của mô hình này,” Nisan nhận định. “Xét đến vị thế dẫn đầu của OpenAI, phát hiện này cho thấy cần có thêm cuộc điều tra về kiến trúc, dữ liệu đào tạo và phương pháp phát triển của DeepSeek.”

Nếu DeepSeek thực sự đã sử dụng dữ liệu từ OpenAI mà không có sự cho phép, vấn đề bản quyền và sở hữu trí tuệ có thể trở nên phức tạp. Theo Copyleaks, sự thiếu minh bạch trong nguồn dữ liệu đào tạo AI là một thách thức lớn, và có thể thúc đẩy các cơ quan quản lý yêu cầu các công ty AI công khai thông tin về tập dữ liệu và phương pháp huấn luyện của họ.
Nisan cũng nhấn mạnh rằng, dù các mô hình AI có thể dần hội tụ về phong cách nếu sử dụng tập dữ liệu chồng chéo, phương pháp phân tích của Copyleaks được thiết kế để phát hiện các khác biệt tinh tế. Điều này cho thấy sự tương đồng giữa DeepSeek và OpenAI không chỉ đơn thuần là do trùng lặp dữ liệu mà có thể liên quan đến cấu trúc hoặc cách thức đào tạo.
DeepSeek và OpenAI vẫn chưa đưa ra phản hồi về kết luận này.
Trước đó, vào cuối năm 2023, mô hình DeepSeek V3 từng bị phát hiện tự nhận là ChatGPT trong một số truy vấn. Theo TechCrunch và một số người dùng mạng xã hội, DeepSeek V3 đã khẳng định mình là GPT-4 của OpenAI. Khi được yêu cầu giải thích, nó tiếp tục xác nhận là một phiên bản của ChatGPT, làm dấy lên nghi vấn về nguồn gốc của mô hình này.

Tháng 1/2024, OpenAI chia sẻ với Financial Times rằng họ đã phát hiện dấu hiệu cho thấy DeepSeek có thể đã sử dụng kỹ thuật “chưng cất” – một phương pháp giúp các mô hình nhỏ tái tạo khả năng của mô hình lớn bằng cách học từ đầu ra của chúng. Dù đây là một kỹ thuật phổ biến trong AI, nếu DeepSeek thực sự đã sử dụng dữ liệu của OpenAI mà không được phép, điều này có thể vi phạm điều khoản dịch vụ của OpenAI. Tuy nhiên, DeepSeek vẫn chưa đưa ra bình luận về cáo buộc này.
