Множественное число, грамматический род и формальный регистр: лингвистические особенности, которые создают проблемы для искусственного интеллекта при переводе

Множественное число, грамматический род и формальный регистр: лингвистические особенности, которые создают проблемы для искусственного интеллекта при переводе
Содержание

Искусственный интеллект отлично справляется с переводом многих повседневных предложений, но это не значит, что он всегда следует структурным грамматическим правилам каждого языка. Некоторые из самых сложных ошибок связаны не с неуклюжей формулировкой или тоном. Они возникают, когда целевой язык требует определенной грамматической формы, основанной на числе, роде, контексте или отношениях между говорящим и читателем.

Эти крайние случаи особенно заметны на многоязычных веб-сайтах, где короткие строки пользовательского интерфейса и динамический контент часто предоставляют системам перевода очень мало контекста. От русских форм множественного числа до французского согласования рода и формальных местоимений — эти правила могут привести к тому, что даже точный перевод внезапно будет выглядеть как машинный. Читайте дальше, чтобы узнать, где возникают эти ошибки и как вы можете их контролировать.

Ошибки множественного числа в переводе, выполненном с помощью ИИ

Множественное число, грамматический род и формальный регистр: лингвистические особенности, которые создают проблемы для искусственного интеллекта при переводе

В английском языке образование множественного числа кажется простым: к большинству существительных добавляется буква «s», когда число меняется с одного на несколько. Однако во многих языках используются более сложные системы, в которых само число определяет, какая форма существительного появится. Это создает структурную проблему для перевода с помощью ИИ, особенно когда веб-сайты используют динамические переменные. 

Как различаются правила обращения с множественным числом в разных языках

Не во всех языках образование множественного числа рассматривается как простое различие между единственным и множественным числом. В зависимости от языка форма существительного может меняться в зависимости от точного числа, а в некоторых языках существуют также отдельные формы для двух предметов.

Например, для одного и того же базового сообщения пользовательского интерфейса может потребоваться совершенно разная грамматическая логика:

  • Английский: 1 товар / 2 товара
  • Русский язык: формы существительных изменяются в зависимости от числа.
  • В арабском языке могут потребоваться формы единственного, двойственного и множественного числа.

Это важно при переводе динамического контента. Система перевода не всегда может взять английскую модель и заменить существительное его эквивалентом на другом языке. Она должна учитывать число и грамматический контекст, определяющие правильную форму на целевом языке.

Например, для многоязычного сайта электронной коммерции сообщение в корзине не должно хранить один-единственный перевод слова «товар». Системе могут потребоваться разные варианты перевода в зависимости от того, содержит ли корзина один, два или несколько товаров.

Русские формы множественного числа и правила числительного

Русский язык — хороший пример того, почему грамматику, основанную на числе, сложно переводить автоматически. Существительные могут принимать разные формы в зависимости от числа, за которым они следуют. Упрощенный пример с использованием слова «продукт»:

  • 1 товар
  • 2-й
  • 5 ро

Важно отметить, что само существительное меняется в зависимости от числа. Это отличается от английского языка, где основное различие обычно заключается в разнице между 1 товаром и 2 товарами.

Представьте себе корзину интернет-магазина, которая динамически отображает количество товаров. Системе перевода необходимо знать, равно ли {count} единице, находится ли оно в определенном диапазоне чисел или требует другой грамматической формы. Подобная проблема может возникнуть и в результатах поиска:

  • Найдено 1 товар
  • Найдено 2 товара
  • Найдено 5 товаров

Если перевод выполняется без применения правил числительного целевого языка, существительное может остаться в неправильной форме, даже если число, отображаемое пользователю, является правильным.

Арабские формы множественного и двойственного числа

Арабский язык вносит дополнительную сложность, поскольку различает единственное, двойственное и множественное число. В английском языке обычно выражается разница между одним предметом и более чем одним, в то время как в арабском языке может использоваться определенная грамматическая форма для обозначения ровно двух предметов. Поэтому для пользовательского интерфейса, отображающего количество предметов, логика может выглядеть следующим образом:

  • 1 предмет > единственное число
  • 2 предмета > двойной
  • 3+ предмета > множественное число

Это различие становится важным для динамического контента веб-сайта. Строка, например, "У вас {count} элементов", содержит переменную, значение которой может напрямую влиять на грамматическую форму перевода.

Если механизм перевода рассматривает {count} как просто число, вставленное в переведенное предложение, он может упустить грамматическую связь между числом и существительным. В результате предложение может быть понятным, но структурно некорректным.

Ошибки множественного числа в динамических строках пользовательского интерфейса

Динамические строки пользовательского интерфейса особенно уязвимы, поскольку их конечное значение зависит от значений, которые вставляются после преобразования. Распространенные примеры включают количество товаров в корзине, результаты поиска, уведомления, комментарии, загрузки и статистику панели управления. Рассмотрим простое сообщение на английском языке:

  • У вас 1 товар
  • У вас 2 предмета
  • У вас 5 предметов

В английском языке грамматическое изменение относительно простое. Однако в языках с несколькими категориями множественного числа каждое значение может требовать разной формы.

Таким образом, проблема заключается не обязательно в низком качестве перевода. Перевод может быть вполне понятен как предложение, но давать сбой при изменении переменной. Многоязычный веб-сайт должен сохранять грамматическую связь между динамическим значением и переведенным текстом.

Поэтому перевода только видимых слов не всегда достаточно. Динамический контент требует логики перевода, которая понимает, как переменные взаимодействуют с грамматикой целевого языка.

Грамматические ошибки рода в переводе, выполненном искусственным интеллектом

Множественное число, грамматический род и формальный регистр: лингвистические особенности, которые создают проблемы для искусственного интеллекта при переводе

Грамматический род создает еще одну структурную проблему. В языках, где существительные классифицируются как мужские, женские или иногда другие грамматические категории, род одного существительного может влиять на несколько окружающих его слов.

Как грамматический род влияет на перевод

Грамматический род — это не просто обозначение существительного как мужского или женского рода. Род может влиять на грамматическое согласование, то есть родственные артикли, прилагательные, местоимения и другие слова также могут нуждаться в изменении. Упрощенная модель этого соотношения выглядит так:

				
					noun → article → adjective 
				
			

Если система перевода выберет неправильный род для существительного, ошибка может распространиться на всю фразу. Вместо одного неправильного слова, всё выражение может содержать несогласованные грамматические формы.

Это становится особенно сложным, когда фраза из исходного языка не содержит явной информации, необходимой для целевого языка. Поэтому короткая английская фраза может потребовать дополнительного контекста, прежде чем ее можно будет правильно перевести на язык с грамматическим родом.

Французское и испанское гендерное соглашение

Французский и испанский языки наглядно демонстрируют, как род существительных влияет на окружающие слова. Существительные, как правило, имеют грамматический род, и связанные с ними артикли и прилагательные должны согласовываться с этим родом.

Для веб-сайта это может повлиять на фразы, используемые в описаниях товаров, названиях категорий, метках профиля или описаниях услуг. Перевод, в котором неправильно указан род существительного, может, соответственно, привести к неправильному согласованию в остальной части фразы. Например, в процессе перевода может потребоваться определить:

  • Какое существительное описывается?
  • Каков его грамматический род?
  • Какую статью следует к нему приложить?
  • Нужна ли прилагательной соответствующая форма?

Именно поэтому перевод, который кажется правильным, если рассматривать каждое слово по отдельности, может быть грамматически неверным, если слова объединены.

Гендерные ошибки в строках пользовательского интерфейса

Короткие строки пользовательского интерфейса особенно сложны для перевода, поскольку часто содержат мало контекста. Система перевода может получить фразу, например, «новый аккаунт», «обновленный профиль» или «доступная услуга», не зная точно, как это существительное используется в других местах на странице.

Это часто встречается в случае с метками, уведомлениями, призывами к действию, названиями продуктов и многократно используемыми компонентами интерфейса. Ключ перевода может содержать всего несколько слов, в то время как информация, необходимая для определения грамматического соответствия, находится где-то в другом месте приложения. Например, разработчик может повторно использовать общую строку, такую ​​как:

				
					New {item} 


				
			

Правильный перевод может зависеть от того, что представляет собой {item}. Если переменная может относиться к существительным с разным грамматическим родом, один статический перевод может не подойти в каждом контексте.

Таким образом, проблема заключается не просто в том, что ИИ «неправильно перевел слово». Возможно, ему не хватило информации, чтобы определить, какая грамматическая форма требуется в целевом языке.

Исправление грамматических ошибок, связанных с родом

Исправление ошибок, связанных с родом слов, начинается с предоставления системе перевода достаточного контроля над терминологией и контекстом. Вместо того чтобы полагаться исключительно на автоматический вывод, команды могут определять, как важные термины должны переводиться и проверяться. Полезные подходы включают:

  • В глоссарии следует определить гендерно-чувствительную терминологию, чтобы важные существительные последовательно использовали предполагаемую форму.
  • Используйте пользовательские правила перевода для повторяющихся шаблонов или конкретных терминов.
  • Для неоднозначных строк пользовательского интерфейса, в которых исходный текст не раскрывает требуемый пол, необходимо указать дополнительный контекст.
  • Примените ручную постредактирование к важным страницам и строкам, где важна грамматическая согласованность.

Такое сочетание особенно полезно для веб-сайтов с большим количеством многократно используемого контента пользовательского интерфейса, где ручное исправление одной и той же проблемы в нескольких местах быстро станет неэффективным.

Гендерные и лицевые формы существительных

Множественное число, грамматический род и формальный регистр: лингвистические особенности, которые создают проблемы для искусственного интеллекта при переводе

В некоторых лингвистических случаях различия выходят за рамки простого различения мужского и женского рода. В определенных языках грамматические формы могут также зависеть от того, на что указывает существительное, например, на человека, предмет или другую категорию. В таких случаях контекст становится еще более важным для автоматического перевода. 

Формы существительных, изменяющиеся в зависимости от контекста

Слово может иметь разную грамматическую форму в зависимости от его значения или референта в предложении. Это может стать проблемой, когда один и тот же ключ перевода используется в разных частях веб-сайта. Рассмотрим, например, типичный контент веб-сайта:

  • Роли пользователей и учетных записей
  • Категории товаров
  • Типы клиентов
  • Метки, которые могут относиться к человеку или предмету

Короткая метка может выглядеть безобидной на языке оригинала, но требовать дополнительной информации на языке перевода. Например, на панели управления можно использовать общую метку для «клиента» в одном месте и повторно использовать аналогичную структуру для нечеловеческого объекта в другом месте.

Когда контекст отсутствует, механизм перевода может выбрать грамматически правильную форму, которая, тем не менее, не соответствует предполагаемому смыслу. Поэтому короткие, изолированные строки являются одними из наиболее уязвимых частей многоязычного интерфейса.

Польские формы существительных, основанные на лице

Польский язык демонстрирует, как грамматические формы могут зависеть от того, относится ли речь к людям или к нечеловеческим существам. Это означает, что для перевода слова или фразы может потребоваться больше информации, чем, по-видимому, содержит исходная строка.

Рассмотрим панель мониторинга, отображающую количество пользователей, клиентов и товаров. Интерфейс может использовать многократно используемую структуру, например, {count} пользователей или {count} товаров.

Правильная грамматическая обработка может зависеть от того, что именно подсчитывается и к какой грамматической категории относится данный текст. Поэтому механизму перевода необходимо понимать, описывает ли текст людей или предметы, а не рассматривать каждое существительное как взаимозаменяемую метку.

Для разработчиков и владельцев веб-сайтов это подчеркивает важное ограничение изолированного перевода строк: механизму перевода необходим достаточный контекст, чтобы определить, что представляет собой эта строка.

Почему ИИ упускает из виду правила контекстной грамматики

Искусственный интеллект при переводе может испытывать трудности с контекстной грамматикой, когда целевой язык требует информации, отсутствующей в исходной строке. Например, в английском языке часто неявно присутствует грамматическая информация, которая в другом языке может требоваться явно. Распространенные причины включают:

  • Очень короткие строки, практически без какого-либо контекста.
  • Переменные, для которых не указано, что они представляют.
  • Ключи перевода используются повторно в разных разделах веб-сайта.
  • Структуры исходного языка, которые не кодируют информацию, необходимую для целевого языка.

Возьмем, например, такую ​​строку:

				
					{{count}} users 
				
			

Переводчику необходимо понимать, что представляет собой {{count}} и какие грамматические правила применяются к следующему существительному. Аналогично, строка, например:

				
					{{name}} is available 
				
			

Может потребоваться информация о том, на что ссылается {{name}} в языке, где грамматическое согласование зависит от этой информации.

Чем меньше контекста предоставляет строка, тем выше вероятность того, что автоматической системе придётся делать грамматические предположения.

Исправление ошибок, связанных с родом существительных и их формой

Наиболее надежный подход заключается в том, чтобы предоставить процессу перевода больший контроль над строками, где важен грамматический контекст. Автоматический перевод может справиться с первоначальной нагрузкой, а дополнительные средства контроля помогут решить повторяющиеся или неоднозначные случаи. Практический рабочий процесс может сочетать в себе:

  • Контекстно-зависимый перевод строк, смысл которых зависит от их использования.
  • Глоссарии терминов со специфическими грамматическими требованиями.
  • Настраиваемые правила перевода для повторяющихся шаблонов.
  • Проверка человеком неоднозначных или вызывающих сильное впечатление строк кода.
  • Память переводов для сохранения исправленных переводов для дальнейшего использования.

Такой подход позволяет избежать рассмотрения каждого перевода как отдельного предложения. Вместо этого он обеспечивает согласованность важных грамматических решений на всем веб-сайте.

Правила формального и неформального языка

Множественное число, грамматический род и формальный регистр: лингвистические особенности, которые создают проблемы для искусственного интеллекта при переводе

Формальный и неформальный язык также могут создавать структурные проблемы при переводе. В некоторых языках регистр влияет на местоимения, формы глаголов и структуру предложений, поэтому выбор неправильного регистра может изменить грамматику переведенного сообщения. 

Формальные и неформальные местоимения

В некоторых языках различают формальный и неформальный способы обращения к читателю. Подходящая форма зависит от аудитории, характера отношений и контекста. Рассмотрим, например, сообщение пользовательского интерфейса на английском языке: «Пожалуйста, введите ваше имя».

В английском языке не требуется указывать, является ли обращение «вы» формальным или неформальным. Однако в целевом языке такое различие может быть обязательным. Правильный выбор может варьироваться в зависимости от веб-сайта:

  • Оформление заказа в интернет-магазине: может использовать вежливую или формальную форму.
  • Служба поддержки клиентов: может предпочесть вежливое обращение к клиенту.
  • На страницах, посвященных банковским операциям или счетам, может последовательно использоваться формальный язык.
  • В процессе адаптации в SaaS-компании можно выбрать как формальный, так и более разговорный язык общения в зависимости от бренда.

Ключевой вопрос — это согласованность. После того как веб-сайт устанавливает свой грамматический стиль, переведенные строки пользовательского интерфейса должны следовать одному и тому же грамматическому правилу на протяжении всего взаимодействия пользователя с сайтом.

Как регистр изменяет структуру предложения

Регистр может влиять не только на местоимение, используемое для обращения к кому-либо. В языках с формальной и неформальной грамматикой выбор может также влиять на спряжение глаголов или другие части предложения. Например, одно и то же сообщение может встречаться в разных контекстах:

  • В официальном уведомлении для клиента может использоваться уважительная грамматическая структура.
  • Неформальное потребительское приложение может обращаться к пользователям более напрямую.
  • На веб-сайте профессиональных услуг могут постоянно использоваться формальные формы оформления.

Это означает, что регистр следует рассматривать как лингвистическое правило, а не просто как предпочтение стиля письма. Если механизм перевода переключается между формальными и неформальными структурами без явной причины, веб-сайт может казаться непоследовательным, даже если каждое предложение технически понятно.

Регистрация ошибок в пользовательском интерфейсе и сообщениях от клиентов

Несогласованность регистра может наблюдаться во многих областях веб-сайта, особенно когда разные строки переводятся независимо друг от друга. К распространённым примерам относятся:

  • Метки пользовательского интерфейса
  • Сообщения об ошибках
  • Уведомления
  • Транзакционные электронные письма
  • Сообщения службы поддержки клиентов

Представьте себе процесс оформления заказа, в котором клиенты постоянно обращаются к вам формально, а затем появляется уведомление, внезапно переключающееся на неформальное местоимение. Ни одно из сообщений может не содержать очевидной ошибки перевода, но такое изменение создает непоследовательный многоязычный опыт.

Это особенно заметно, когда пользователи перемещаются между различными разделами одного и того же веб-сайта. Система перевода должна сохранять выбранный регистр для связанных строк, а не принимать решение независимо для каждого предложения.

Поддержание единого языкового стиля

Первый шаг — определить предпочтительный регистр для каждого целевого языка и использовать его последовательно на всем веб-сайте. Это дает переводчикам и системам перевода четкую ориентировку, когда в исходном языке это различие не указано явно. Веб-сайт может поддерживать эту согласованность посредством:

  • Рекомендации по переводу, определяющие предпочтительный регистр.
  • Словари важных местоимений и терминов.
  • Настраиваемые правила перевода для повторяющихся языковых шаблонов.
  • Проверка контента, оказывающего наибольшее влияние на восприятие, такого как сообщения на странице оформления заказа и сообщения о транзакциях, специалистами-экспертами.

Благодаря этим механизмам контроля формальные и неформальные решения становятся частью процесса перевода, а не принимаются случайным образом при переходе от одной строки к другой.

Исправление структурных ошибок перевода с помощью ИИ

Множественное число, грамматический род и формальный регистр: лингвистические особенности, которые создают проблемы для искусственного интеллекта при переводе

Используйте пользовательские правила перевода

Настраиваемые правила перевода позволяют лучше контролировать обработку конкретных терминов, шаблонов или строк, когда автоматический перевод не дает требуемого грамматического результата. Например, правила могут помочь в управлении:

  • Динамические модели образования множественного числа
  • Специфическая терминология
  • Последовательные грамматические формы
  • Повторяющиеся строки пользовательского интерфейса

Вместо того чтобы каждый раз вручную исправлять один и тот же перевод, вы можете определить правило, которое будет последовательно применять желаемое поведение. Это особенно полезно для веб-сайтов с динамическими или многократно используемыми компонентами. Linguise также поддерживает пользовательские правила перевода, позволяя точно настраивать конкретные переводы, сохраняя при этом автоматическую обработку остального контента.

Преодолеть языковые барьеры
Попрощайтесь с языковыми барьерами и откройте для себя безграничные возможности! Попробуйте наш сервис автоматического перевода уже сегодня.

Контрольная терминология с глоссариями

Глоссарии помогают контролировать терминологию, которая должна оставаться единообразной при переводе. Они особенно полезны, когда у термина есть несколько возможных переводов или когда важны его грамматические характеристики. Например, глоссарий может определить предпочтительные переводы для:

  • Названия продуктов
  • Терминология бренда
  • Названия ролей
  • Термины с определенным грамматическим родом

Это дает механизму перевода четкую ссылку, вместо того чтобы оставлять каждое упоминание открытым для новой интерпретации. Для многоязычных веб-сайтов это может уменьшить разнообразие терминологии и помочь поддерживать единообразие грамматических правил.

Примените ручную постобработку

В некоторых структурных крайних случаях по-прежнему требуется человеческая лингвистическая оценка, особенно когда необходимый контекст нельзя достоверно вывести из исходной строки. Человеческая постредактирование может быть приоритетным для контента, оказывающего значительное влияние, например:

  • Процесс оформления заказа
  • Юридические и учетные сообщения
  • Важные уведомления
  • Целевые страницы с высокой посещаемостью

Цель состоит не в том, чтобы вручную перевести весь веб-сайт. Вместо этого, проверка человеком может сосредоточиться на исключениях и важных строках, где грамматическая точность напрямую влияет на пользовательский опыт.

Сохраняйте исправления с помощью памяти переводов

После проверки и исправления перевода, внесенные изменения не должны исчезать при следующем переводе аналогичной строки. Память переводов помогает сохранять утвержденные переводы, чтобы их можно было повторно использовать для соответствующего или похожего контента. Упрощенный рабочий процесс выглядит следующим образом:

Перевод с помощью ИИ → ручная коррекция → сохраненный перевод → повторное использование для сопоставления контента.

Это особенно полезно для веб-сайтов с повторяющимися строками пользовательского интерфейса, повторяющейся терминологией или большим количеством похожего контента. После исправления структурной ошибки вы можете применять одно и то же решение каждый раз, вместо того чтобы начинать с нового автоматического перевода. 

Готовы исследовать новые рынки? Попробуйте наш автоматический сервис перевода бесплатно с нашим 1-месячным безрисковым испытанием. Кредитная карта не требуется!

Заключение

Ошибки структурного перевода, создаваемые искусственным интеллектом, могут возникать даже тогда, когда перевод на первый взгляд кажется точным. Множественное число, грамматический род, формы существительных, основанные на лице, а также формальный или неформальный регистр могут вводить правила, неочевидные из исходного английского текста.

Чем сложнее целевой язык, тем важнее контролировать применение автоматического перевода. Linguise сочетает автоматический перевод с такими элементами управления, как пользовательские правила перевода, управление глоссарием, редактирование человеком и память переводов, предоставляя владельцам веб-сайтов возможность обрабатывать эти языковые особенности без ущерба для эффективности автоматического перевода. Попробуйте Linguise , чтобы обеспечить точность и согласованность вашего многоязычного веб-сайта на разных языках.

Вас также может заинтересовать чтение

Не упустите возможность!
Подпишитесь на нашу рассылку

Получайте новости об автоматическом переводе веб-сайтов, международной SEO и многом другом!

Invalid email address
Give it a try. One per month, and you can unsubscribe at any time.

Не уходите без обмена вашим email!

Мы не можем гарантировать, что вы выиграете в лотерее, но мы можем обещать интересные информационные новости вокруг перевода и периодические скидки.

Не упустите возможность!
Invalid email address