Студентка НГУ проанализировала специфические принципы систем машинной лингвистической разметки китайского текста

Системное сопоставление принципов лингвистического глоссирования и машинной разметки на материале китайского языка впервые в отечественной синологии провела студентка специальности бакалавриата «Востоковедение и африканистика» Гуманитарного института Новосибирского государственного университета Анна Потапова в рамках своей дипломной работы «Специфика систем разметки для машинной обработки текста на материале китайского языка» под научным руководством кандидата филологических наук, старшего преподавателя кафедры востоковедения Марии Дуровой. Анна Потапова выяснила, какие существующие системы разметки лучше подходят для решения различных задач. Результаты ее исследования могут быть полезны специалистам, занятым в сфере машинного перевода, автоматического суммирования и извлечения информации для обучения больших языковых моделей, а также для создания интеллектуальных поисковых систем.

Разметка – это такой процесс, при котором текст разбивается на мелкие части – токены, - и каждому из них присваиваются определенные метки, например, грамматические – например, это слово существительное, в предложении оно выполняет роль такую-то, вот такие-то у него грамматические характеристики – такого рода, падежа и тд.

Глоссирование — это лингвистический метод оформления примеров на иностранных или редких языках, при котором между строкой оригинала и строкой перевода помещается промежуточная строка с пословным или поморфемным разбором, поясняющим грамматическое значение и структуру каждой части слова.

В своей дипломной работе рассматривала насколько существующие системы разметки текста адаптированы под китайский язык, потому что в основном они создавались под языки другого типа, например, индоевропейские, у которых развиты грамматика и словоизменение, а китайский язык изолирующий, у него нет падежного словоизменения и грамматического рода; категория числа обычно не выражается обязательной флексией. Когда данные системы применяются для индоевропейских языков, мы можем каждому слову приписать вот различные грамматические характеристики: падеж, число, род и тд. В китайском языке такие характеристики отсутствуют — слова не изменяются. Их грамматические отношения во многом определяются порядком слов, служебными словами, частицами и контекстом. Чтобы к китайским текстам применить эти системы разметки, требуется учитывать языковую специфику и применять языкоспецифические правила. Метки должны быть стандартизованы, но способ их присвоения следует применить иной. Я проанализировала, как с данной задачей справляются различные системы разметки текста, — рассказала Анна Потапова.

Молодая исследовательница выявила и проанализировала специфические принципы систем машинной лингвистической разметки китайского текста в сопоставлении с традицией лингвистического глоссирования. Лингвистическая разметка текста, как процесс добавления к языковым единицам специальных меток, фиксирующих их морфологические, синтаксические и семантические характеристики, выступает ключевым инструментом подготовки текстов к автоматической обработке, кросс-лингвистическому сопоставлению и созданию электронных ресурсов. От объема и лингвистической точности размеченных данных напрямую зависит качество и эффективность развития технологий обработки естественного языка (Natural Language Processing, NLP) и искусственного интеллекта. Качественно аннотированные корпусы используются при разработке, обучении и оценке ряда моделей обработки естественного языка, а также при создании систем синтаксического анализа, извлечения информации и других специализированных NLP-инструментов. В настоящее время проблема формализованного представления языковых данных особенно актуальна в связи со стремительным развитием цифровых гуманитарных наук и корпусной лингвистики.

Китайский язык относится к языкам изолирующего типа. Он очень сильно отличается от языков, для которых создавались существующие системы разметки для машинной обработки текста. Он относится к изолирующим языкам. В китайских текстах нет пробелов, внешне они представляют собой совокупность иероглифов.  Однако трудность при разметке текстов заключается не только в отсутствии пробелов между словами, но также и в слабо развитом словоизменении. Гипотетически, если бы в языке одни символы всегда обозначали начало слова, а другие – его конец, то выделение слов было бы относительно простой процедурой даже без пробелов. Сложность в том, что в китайском языке нет однозначных показателей границ слов. При этом большинство иероглифов может занимать разные позиции внутри слова, поэтому сам иероглиф не может быть надежным маркером границы слова. Универсальные стандарты разметки вынуждены адаптироваться этим особенностям, что порождает методологические вопросы, которые до настоящего времени остаются недостаточно освещенными в отечественном китаеведении, — пояснила Анна Потапова.

Для обеспечения высокой точности автоматической обработки китайских текстов необходима адаптация универсальных стандартов аннотирования, изначально ориентированных преимущественно на флективные (в которых слова меняют форму с помощью окончаний и суффиксов, чтобы показать связь между собой в предложении. К ним относятся латинский и русский, а также многие индоевропейские) и агглютинативные языки (в которых новые слова и формы образуются путем последовательного присоединения суффиксов и приставок к неизменному корню. Каждый такой элемент отвечает ровно за одно конкретное значение, а границы между ними всегда четкие. К ним относятся тюркские и финно-угорские языки). Китайский язык, обладая изолирующим строем, отсутствием понятных морфологических маркеров и непрерывной иероглифической записью, ставит перед системами машинной аннотации специфические задачи, не имеющие прямых аналогов в языках с развитым словоизменением.

В условиях, диктуемых особенностями китайского языка, универсальные стандарты разметки вынуждены адаптироваться: границы токенов в данном случае определяются не орфографией, а синтаксическими и лексико-статистическими критериями; грамматические категории кодируются не аффиксами, а порядком слов, служебными элементами и контекстуальной позицией. Развитие систем машинной разметки китайского текста способствует созданию новых лингвистических ресурсов и расширению функционала цифровых гуманитарных платформ. В этих условиях теоретическое осмысление принципов машинной разметки и выявление их соответствия реальным задачам обработки китайского языка приобретают не только научно-теоретическое, но и важное прикладное значение. Сравнительный анализ систем машинной разметки на материале китайского языка позволяет выявить, каким образом формальные требования компьютерной лингвистики трансформируют традиционные лингвистические категории, а также показать, в каких аспектах машинная аннотация расходится с человечески ориентированным глоссированием, а в каких – неизбежно к нему приближается, — пояснила молодая исследовательница.  

Специфика применения машинной лингвистической разметки во многом определяется структурными особенностями языка, к которому применяется та или иная схема. Универсальные стандарты задают общий набор категорий и единый способ представления данных, однако конкретная реализация разметки зависит от типологических особенностей языка. Для китайского языка такими особенностями являются аналитический строй, отсутствие развитого словоизменения, отсутствие пробелов между словами, значительная роль служебных слов и омонимия.

В своей работе Анна Потапова представила обзор наиболее значимых систем машинной разметки для китайского языка в зависимости от принципов, применяемых в этих системах. Такой подход позволяет увидеть, как теоретические установки воплощаются в конкретных практиках и как разные схемы отражают различные представления о структуре китайского предложения. Она систематизировала существующие подходы к машинной разметке китайского текста и выявила их методологические основания. Далее последовал сопоставительный анализ принципов Лейпцигского глоссирования и машинной разметки по ключевым параметрам: единица анализа, способ категоризации, кодирование грамматической информации, разрешение неоднозначности, формат репрезентации. В итоге были выявлены специфические адаптации универсальных аннотационных стандартов к изолирующему строю китайского языка и сформулированы критерии выбора аннотационной стратегии в зависимости от цели исследования.

Систематизация существующих систем разметки выявила, что выбор аннотационной схемы напрямую зависит от цели исследования: корпус Penn Chinese Treebank обеспечивает возможность синтаксического анализа, стандарт Universal Dependencies – межъязыковую сопоставимость и кросс-лингвистическое обучение языковых моделей, лексико-ориентированные стандарты – пригодность для частотного анализа и информационного поиска. Сопоставительный анализ пяти ключевых параметров продемонстрировал фундаментальное различие оснований двух традиций: глоссирование ставит в приоритет семантическую прозрачность и линейную наглядность, а машинная разметка – структурную однозначность и алгоритмическую воспроизводимость.

В ходе своего исследования Анна Потапова выяснила, что типологическая специфика китайского языка не препятствует применению универсальных стандартов разметки, но требует их адаптации. Границы токенов должны определяться синтаксико-дистрибутивными критериями, грамматические категории следует кодировать через синтаксические зависимости, а разрешение омонимии следует строить на контекстуальных признаках.

Студентка сделала важный вывод, что лингвистическое глоссирование и машинная разметка не конкурируют, а взаимодополняют друг друга — первое остается оптимальным инструментом для филологического анализа и научных публикаций, а вторая обеспечивает масштабируемость и техническую базу для автоматической обработки.

Также Анна Потапова определила, что выбор аннотационной стратегии должен определяться целью исследования: для типологических сопоставлений предпочтителен Universal Dependencies, для синтаксического анализа – Penn Chinese Treebank, для лексикографических задач – лексико-ориентированные стандарты, а для иллюстративных примеров в публикациях – Лейпцигское глоссирование.

Материал подготовил: Елена Панфило, пресс-служба НГУ
Продолжая использовать сайт, вы даете согласие на использование cookies и обработку своих данных. Узнайте подробности или измените свои настройки cookies.