Nghiên cứu chỉ ra những "thói quen hành văn" đặc trưng của Claude và GPT
Khảo sát từ 10.000 văn bản của hãng Graphite cho thấy dù đã hạn chế các từ quen thuộc như "delve" hay dấu gạch ngang, các mô hình AI tiên tiến như Claude Opus 5.5 và OpenAI Astra vẫn vô tình để lộ những cấu trúc câu lặp đi lặp lại rất dễ nhận biết.
Nghiên cứu quy mô lớn vạch trần thói quen hành văn của AI
Khi nội dung do các mô hình ngôn ngữ lớn (LLM) tạo ra ngày càng tràn ngập trên mạng, việc nhận biết đâu là bài viết của con người và đâu là sản phẩm của AI trở thành mối quan tâm lớn. Dù các "dấu vết" sơ khai như từ "delve" hay việc lạm dụng dấu gạch ngang dài (em-dash) đã dần biến mất, các mô hình biên giới hiện nay vẫn mang những thói quen hành văn rất riêng biệt.
Một nghiên cứu mới từ công ty tiếp thị Graphite đã tiến hành phân tích phong cách viết của các mô hình hàng đầu hiện nay. Bằng cách thiết lập nhóm đối chứng gồm 10.000 bài viết xuất bản trước thời điểm ChatGPT ra mắt, các nhà nghiên cứu yêu cầu nhiều mô hình AI viết lại các nội dung này dựa trên bản tóm tắt nhằm hạn chế tối đa thiên kiến từ văn bản gốc. Kết quả so sánh cho thấy Graphite đã xác định được tới 13.000 cụm từ xuất hiện trong văn bản AI với tần suất cao ít nhất gấp đôi so với văn bản do con người viết – tiêu chuẩn mà nhóm nghiên cứu định nghĩa là một "dấu vết nhận diện" (tell).
Đáng chú ý, ông Greg Druck, Giám đốc AI của Graphite, chia sẻ với TechCrunch rằng trong khi dòng mô hình Claude của Anthropic đang ngày càng tiến gần hơn đến phân phối từ ngữ tự nhiên của con người qua thời gian, thì dòng mô hình GPT của OpenAI lại có xu hướng ngày càng rời xa phân phối này.
Claude thích nhấn mạnh tầm quan trọng, Astra chuộng lập luận phản biện
Theo kết quả phân tích, mỗi hệ thống AI lại bộc lộ những thiên kiến từ vựng và cú pháp đặc thù:
- Claude Opus 5.5 (Anthropic): Dấu hiệu từ vựng rõ nét nhất là từ "dependable", xuất hiện với tần suất cao gấp 23 lần so với bài viết của con người. Mặc dù phiên bản này đã tránh được cấu trúc quen thuộc "it’s not X, it’s Y" (không phải là X, mà là Y), mô hình lại chuyển sang ưa chuộng kiểu câu "is more than an X, it’s a Y" (không chỉ dừng lại ở X, đó là Y). Đặc biệt, Opus 5.5 rất thích thuyết phục người đọc về mức độ quan trọng của vấn đề: cụm từ "this matters" xuất hiện nhiều gấp 116 lần và "why X matters" xuất hiện nhiều gấp 92 lần so với người viết thông thường.
- Astra (OpenAI): Mô hình này có xu hướng liên tục nhắc đến "another dimension" (một khía cạnh/chiều kích khác) của chủ đề đang bàn luận, đồng thời thường xuyên sử dụng cách nói rào đón, giảm nhẹ mức độ khẳng định như "may provide" (có thể đem lại) hoặc "can provide". Điểm nhận diện lớn nhất của Astra là lối diễn đạt định khung hiệu chỉnh (corrective framing) – mô tả một vấn đề theo kiểu "not simply X" (không đơn thuần là X) hoặc đưa ra giải pháp thay thế như "rather than relying on X" (thay vì dựa vào X). Những cấu trúc này xuất hiện trong văn bản của Astra nhiều hơn tới 100 lần so với bài viết của con người.
Bài toán loại bỏ dấu vết: Sửa tật cũ, mọc tật mới
Các phòng thí nghiệm AI hàng đầu dường như đã lắng nghe phản hồi của người dùng về việc lạm dụng dấu câu. Dữ liệu của Graphite ghi nhận Opus 5.5 giảm tới 99% tần suất dùng dấu gạch ngang dài so với bản Opus 5 tiền nhiệm; Astra dùng dấu này ít hơn 88% so với người thật; trong khi Gemini 3.1 Pro của Google gần như đã loại bỏ hoàn toàn dấu gạch ngang dài khỏi văn bản.
Tuy nhiên, việc triệt tiêu các đặc điểm cũ không đồng nghĩa với việc AI viết giống người hơn về tổng thể. Ông Greg Druck nhận định rằng số lượng dấu vết nhận diện nhìn chung vẫn giữ nguyên: các hãng công nghệ chỉ loại bỏ được những điểm quá lộ liễu được người dùng bàn tán nhiều, nhưng các thói quen mới lại lập tức thế chỗ, và mỗi phiên bản mô hình lại tạo ra những nét riêng.
Dù Anthropic khẳng định Opus 5.5 giao tiếp tự nhiên và mạch lạc hơn các thế hệ trước, còn OpenAI cũng cam kết các phiên bản GPT-6 (Sol và Luna) giảm bớt thuật ngữ và các cách diễn đạt kỳ lạ, việc xóa bỏ hoàn toàn dấu vết AI vẫn là thách thức kỹ thuật rất lớn. Theo đại diện Graphite, việc kiểm soát triệt để các cấu trúc hành văn trên những mô hình chứa hàng trăm tỷ tham số là điều gần như bất khả thi, bởi các bài kiểm tra đánh giá của phòng thí nghiệm luôn có giới hạn và nhiều thói quen ngôn ngữ vô thức vẫn sẽ lọt qua các bộ lọc tinh chỉnh.


