AI RACE— AI Race
Language Models

제거 노력에도 최신 프론티어 AI 모델의 '말버릇' 여전해…연구 결과 발표

마케팅 기업 Graphite의 연구에 따르면 현대 LLM이 유독 자주 사용하는 문구가 1만 3,000개 이상 발견되었으며, 엠대시 같은 과거의 습관은 사라졌지만 새로운 문체적 특징이 계속 나타나는 것으로 확인됐다.

2026. 10. 02. 00:50
Language Models

생성형 AI의 언어적 '지문'을 밝힌 새로운 연구

엠대시(em-dash, —)나 '파고들다(delve)'라는 단어 등 초기 인공지능(AI) 글쓰기의 대표적인 특징들이 점차 자취를 감추고 있지만, 최첨단 대형언어모델(LLM)들은 여전히 독특하고 반복적인 언어적 습관에 의존하고 있는 것으로 나타났다. 마케팅 기업 Graphite는 주요 프론티어 모델의 텍스트를 분석해 인간의 글과 기계가 생성한 합성 텍스트를 구별 짓는 문구 및 문장 구조를 규명했다.

이러한 패턴을 분리하기 위해 Graphite는 ChatGPT 출시 이전에 인간이 작성해 발행한 기사 1만 편으로 대조군 데이터셋을 구축했다. 이어 연구진은 원본 텍스트로부터 유전되는 편향을 최소화하기 위해 요약문만을 바탕으로 최첨단 AI 시스템들에 해당 기사들을 다시 작성하도록 지시했다. 이렇게 짝지어진 결과물을 분석한 결과, Graphite는 기계 생성 텍스트에서 인간 기준치보다 최소 2배 이상 자주 등장한 문구 약 1만 3,000개를 특정했다. 이 회사는 해당 빈도를 AI의 특징적인 흔적인 '텔(tell)'의 기본 정의로 삼았다.

이번 연구 결과는 시간이 흐름에 따라 모델 계열별로 인간의 문체를 모방하는 방식에서 차이를 보인다는 점을 보여준다. Graphite의 최고AI책임자(CAO)인 Greg Druck은 TechCrunch와의 인터뷰에서 "시간이 지날수록 Claude 모델은 실제로 인간의 단어 분포에 점점 더 가까워지는 반면, GPT 모델은 점점 더 멀어지고 있는 것으로 나타났다"고 밝혔다.

Opus 5.5와 Astra가 글 속에서 자신을 드러내는 방식

연구에 따르면 개별 모델들은 매우 뚜렷한 문체적 서명을 드러냈다. Anthropic의 Claude Opus 5.5의 경우 '신뢰할 수 있는(dependable)'이라는 단어에 자주 의존하며, 인간 작성자보다 23배 더 많이 사용했다. 이 모델은 고전적인 "X가 아니라 Y다(it's not X, it's Y)" 형태의 대구법은 대체로 지양했으나, 그 대신 대상이 "X 이상이며, Y다(is more than an X, it's a Y)"라고 주장하는 또 다른 대조 공식을 빈번하게 사용했다. 또한 Opus 5.5는 중요성을 강조하는 압도적인 경향을 보였다. "이것이 중요한 이유다(this matters)"라는 정확한 문구는 인간 대조군보다 116배 더 많이 등장했고, "왜 X가 중요한가(why X matters)"는 92배 더 자주 나타났다.

반면 OpenAI의 Astra 모델은 완전히 다른 어휘 구성을 보였다. Astra는 '또 다른 차원(another dimension)'이라는 표현을 크게 선호했으며, '제공할 수 있다(may provide)' 또는 '제공 가능하다(can provide)'와 같은 추측성 완곡어구(hedge)로 주장을 부드럽게 완화하는 경우가 많았다. 가장 두드러진 특징은 Graphite가 '교정 프레이밍(corrective framing)'이라 부르는 패턴으로, 주제를 "단순히 X가 아니다(not simply X)"로 규정하거나 "X에 의존하기보다는(rather than relying on X)" 대안을 제시하는 구문 구조다. Graphite는 Astra의 텍스트에서 이러한 교정 패턴이 인간 글쓰기보다 100배 이상 더 많이 기록됐다고 밝혔다.

문장 부호 사용 습관 역시 전반적으로 급격히 변화했다. 엠대시 남발에 대한 광범위한 비판을 의식해 프론티어 연구소들은 해당 부호를 피하도록 모델을 튜닝한 것으로 보인다. Opus 5.5는 이전 모델인 Opus 5보다 엠대시 사용 빈도가 99% 감소했다. Astra는 인간 기준치보다 88% 적게 엠대시를 사용했으며, Google의 Gemini 3.1 Pro는 글에서 엠대시를 거의 완전히 배제했다.

거대 모델에서 언어적 특징을 완전히 지우기 어려운 이유

널리 알려진 문체적 단서를 제거하기 위한 맞춤형 업데이트에도 불구하고, Graphite는 AI 특유의 문체적 흔적의 절대적인 양 자체는 대체로 일정하게 유지된다는 사실을 발견했다. 새로운 아키텍처와 파인튜닝 데이터셋이 배포됨에 따라 이러한 특징들은 사라지는 것이 아니라 단순히 다른 형태로 순환할 뿐이다. Druck은 "특징적인 흔적이 줄어드는 것은 아니다"라며 "가장 잘 알려진 흔적은 성공적으로 제거하고 있지만, 다른 것들이 튀어나온다. 그리고 모든 모델 버전마다 고유한 특징이 있다"고 설명했다.

이러한 습관의 지속성은 신규 모델이 더욱 유창하고 자연스럽다고 꾸준히 마케팅해 온 주요 AI 연구소들의 입장과 배치된다. Anthropic은 초기 테스터들이 Opus 5.5의 글이 더 명확하고 이해하기 쉽다고 평가했다는 점을 강조해 홍보했으며, OpenAI 역시 GPT-6 버전인 Sol과 Luna에서 전문 용어를 줄이고 어색한 문구 선택을 줄이겠다고 유사한 약속을 한 바 있다.

Druck은 이러한 문체적 특이점을 완전히 없애는 것이 기존 훈련 기법으로는 역부족일 수 있음을 시사했다. Druck은 "내 일반적인 가설은 연구소들이 생각보다 이러한 요소들을 통제하기 어려워한다는 점"이라며 "이들은 수십억 개 이상의 매개변수를 가진 거대 모델이다. 연구소들이 실행할 수 있는 테스트 횟수는 한정되어 있으며, 그 과정에서 빠져나가는 것들이 생기기 마련"이라고 지적했다.

관련 기사