정적 언어모델부터 생성형AI까지, 텍스트를 다시 쓰는 기술에 대하여 — 조은경, 『한국학과 데이터과학』(서강대학교출판부, 2024) —

From Static Language Models to AI : On the Technique of Rewriting Texts —A Review of Korean Studies and Data Science (Eunkyung Cho, 2024, Sogang University Press) —

초록

조은경의 『한국학과 데이터과학』은 “어문 및 인문학 연구자에게 활용도 높은 데이터 과학적 연구방법론을 안내함으로써” 한국 문학 및 문화 연구를 디지털인문학 방법론 을 수행하고자 하는 연구자에게 실질적인 도움을 줄 수 있는 책이다. 디지털인문학은 데이터 분석의 프로토콜을 포함하지만 단순한 기술 활용을 넘어 철학적, 문화적 전환 을 내포하는 광범위한 개념으로 사용되기도 한다. 이 과정에서 생산되는 관련 논문이 나 논의들은 담론성이 강하게 나타나거나 기술 사용 과정이 간소화되는 경우가 있는 것도 사실이다. 조은경은 ‘데이터과학’이라는 용어를 채택함으로써 한국어 기반 언어 자료를 수집하고 처리하여 분석하는 데 필요한 구체적인 기술과 절차에 보다 초점을 맞추고 있다. 디지털인문학에서 가장 활발하게 수행되는 연구 중 하나는 문자 기반 텍스트에 대한 분석이다. 그렇기 때문에 이 책 또한 “데이터의 양적 분석에 쓰이는 기초 통계량에서 부터 딥러닝에 이르기까지”를 차근차근 설명하고 있다. 비정형 데이터의 비중이 증가 함에 따라 평균, 표준편차, 분산 등 전통적인 기술통계량만으로는 데이터가 내포한 복잡한 의미 구조나 맥락적 관계를 충분히 설명하기 어려운 점이 있으므로 고차원 벡터 기반 지표들을 요청하게 되었으며 더 나아가 딥러닝 언어모델에 기반하여 “문맥에 따라 벡터 값이 변하는 동적 벡터”를 활용, 단어 수준을 넘어 문장, 문맥, 최종적으로 텍스트 수준에서 의미가 생성되는 과정을 다차원 벡터 공간에서 정교하게 표현하려 는 시도들이 이어지고 있다. 또한 GPT와 같은 생성형 언어 모델을 인문학 연구와 결 합하기 위해 RAG이나 온톨로지 기반 모델링을 활용하여 특정 분야의 전문 데이터를 추가학습함으로써 특정 도메인에 특화된 지식 생성의 정확도를 향상하려는 시도가 활발하다. 저자가 서술하는 데이터과학의 방법론적 변화 과정의 흐름을 따라가다 보면 이는 곧 디지털인문학의 자기 갱신 과정임을 알게 된다. 정적 언어 모델에서부터 동적 언어 모델로의 이행, 초대규모 언어 모델의 인문학적 활용 방식에 대한 모색은 인문학 텍 스트가 지닌 의미적 중층성을 중심에 두고 기술을 비판적으로 사유하는 자세에서 비 롯된 것이다. 기술의 발전 속도가 빠르게 변화하는 가운데 인문학 연구자들이 그 속 도를 앞서거나 발맞춰 따라가는 것은 쉬운 일이 아니다. 오히려 조은경은 인문학연구 자가 기술에 대한 풍부한 감각을 확보하고 분석의 맥락에 따라 기술을 사유하는 능력 이 더 중요하다는 점을 보여주고 있다. 텍스트와 기술 사이의 창조적인 매핑을 모색 하고 이를 통해 해석과 판단이 개입된 지식 생산의 실천으로 나아가는 것이 디지털인 문학, 인문데이터과학이 추구하는 방향성이라는 점을 보여준다. 이와 같은 흐름을 따라가며 서평을 쓰는 필자는 추가적으로 데이터셋 구성의 중요성 과 텍스트가 기술, 데이터셋 등을 통해 새롭게 표상됨으로써 열리는 글쓰기의 가능 성, 연구자의 정체성의 변화에 대해 언급하였다. 디지털인문학 연구는 기술과 연구 자, 텍스트와 연구자 등 다양한 차원에서 공동 저작성의 워크플로우를 포함하고 있 다. 또한 기술이 가진 무한한 문장 생성의 가능성을 통해 의미를 끝맺는 기존의 문학 과 예술의 의례에서 이탈하는 글쓰기 양식을 모색할 수 있다. 이 문장들은 때때로 무 의미의 경계를 맴돌며 규범 바깥의 언어조각들로 구성되기도 한다. 의미로 회수되지 않는 언어의 조각들이 무작위로 배치되는 것을 목도하며 그 혼돈 속에서야말로 새로 운 문학을 상상할 수 있는 길이 열림을 감각할 수 있다

키워드

데이터과학 연구방법론디지털인문학정적 언어모델동적 언어모델생성형 언어모 델지식생산모델링텍스트와 기술 간 창조적 맵핑다층적 차원의 공동저작성중단없 는 글쓰기차연(différence)data-scientific research methodsdigital humanitiesstatic language modeldynamic language modelgenerative language modelknowledge production modelingcreative mapping between text and technologymulti-layered co-authorshipunending writingdifférance
제목
정적 언어모델부터 생성형AI까지, 텍스트를 다시 쓰는 기술에 대하여 — 조은경, 『한국학과 데이터과학』(서강대학교출판부, 2024) —
제목 (타언어)
From Static Language Models to AI : On the Technique of Rewriting Texts —A Review of Korean Studies and Data Science (Eunkyung Cho, 2024, Sogang University Press) —
저자
전성규
DOI
10.15797/concom.2025..35.008
발행일
2025-06
저널명
개념과 소통
35
페이지
241 ~ 277