复数形式、语法性别和正式语体:人工智能翻译面临的语言学边缘问题

复数形式、语法性别和正式语体:人工智能翻译面临的语言学边缘问题
目录

人工智能翻译 能够出色地处理许多日常用语,但这并不意味着它总能遵循每种语言的结构语法规则。一些最棘手的错误并非源于措辞或语气生硬,而是源于目标语言根据数、性、语境或说话者与读者的关系而要求特定的语法形式。

这些特殊情况在多语言网站上尤为明显 ,因为这类网站上简短的用户界面字符串和 动态内容 往往无法为翻译引擎提供足够的上下文信息。从俄语的复数形式到法语的性别一致和正式代词,这些规则都可能使原本准确的翻译突然看起来像是机器生成的。继续阅读,了解这些错误发生在哪里以及如何避免它们。

人工智能翻译中的复数错误

复数形式、语法性别和正式语体:人工智能翻译面临的语言学边缘问题

英语的复数形式看似简单,大多数名词在数量从1变为多个时只需加“s”即可。然而,许多语言使用更为复杂的系统,其中数量本身决定了名词的复数形式。这给人工智能翻译带来了结构性挑战,尤其是在网站使用动态变量的情况下。. 

不同语言的复数规则有何差异

并非所有语言都将复数形式视为简单的单复数区分。根据语言的不同,名词的形式会根据具体数量而变化,有些语言甚至对两个项目分别使用不同的形式。.

例如,同一条基本的用户界面消息可能需要截然不同的语法逻辑:

  • 英文: 1 件 / 2 件
  • 俄语: 名词形式随单复数而变化。
  • 阿拉伯语: 可能需要单数、双数和复数形式。

在翻译动态内容时,这一点至关重要。翻译引擎并非总能简单地照搬英语模式,将名词替换为目标语言中的对应词。它必须考虑数量和语法语境,这些因素决定了目标语言的正确形式。.

例如,对于多语言电子商务网站,购物车消息不应只存储“商品”一词的单一翻译。系统可能需要根据购物车中包含一件、两件还是多件商品来设置不同的表单。.

俄语复数形式和基于数字的规则

俄语很好地说明了为什么基于数的语法很难自动翻译。名词会根据其后面的数字而呈现不同的形式。以下是一个以“产品”一词为例的简化示例:

  • 1 托瓦尔
  • 2 товара
  • 5 товаров

关键在于名词本身会随着数量的变化而变化。这与英语不同,英语的基本区别通常是区分1个产品和2个产品。.

想象一下,一个电商购物车会动态显示商品数量。翻译系统需要判断 {count} 是否为 1,是否在某个特定的数字范围内,或者是否需要其他语法形式。类似的问题也可能出现在搜索结果中:

  • 找到 1 个产品
  • 找到 2 个产品
  • 找到 5 个产品

如果在生成翻译时没有应用目标语言的数字规则,即使向用户显示的数字是正确的,名词的形式也可能仍然是错误的。.

阿拉伯语复数和双数形式

阿拉伯语的复杂性在于它区分单数、双数和复数。英语通常用一个词来表示一个或多个,而阿拉伯语则可以使用特定的语法形式来表示两个。因此,对于显示项目数量的用户界面,其逻辑可能如下所示:

  • 1 项 > 单数
  • 2 件商品 > 双人
  • 3 件以上 > 复数

这种区别对于动态网站内容至关重要。例如,“您有{count}件商品”这样的字符串包含一个变量,其值会直接影响翻译的语法形式。.

如果翻译引擎将 {count} 仅仅视为插入到翻译句子中的一个数字,它可能会忽略数字和名词之间的语法关系。翻译结果虽然可能通顺易懂,但在结构上却不正确。.

动态 UI 字符串中的复数形式错误

动态用户界面字符串尤其容易受到攻击,因为它们的最终含义取决于翻译后插入的值。常见的例子包括购物车数量、搜索结果、通知、评论、下载量和仪表盘统计信息。考虑以下简单的英文消息:

  • 您有 1 件商品
  • 您有 2 件商品
  • 你有5件商品

在英语中,这种语法变化相对简单。然而,在具有多种复数形式的语言中,每种复数形式可能需要不同的表达方式。.

因此,问题未必出在翻译质量上。翻译中的句子本身可能完全通顺,但当变量发生变化时就会出现问题。多语言网站需要保持动态值与翻译文本之间的语法关系。.

因此,仅仅翻译可见的文字并不总是足够的。动态内容需要翻译逻辑,能够理解变量如何与目标语言的语法相互作用。.

人工智能翻译中的语法性别错误

复数形式、语法性别和正式语体:人工智能翻译面临的语言学边缘问题

语法性别带来了另一个结构上的挑战。在一些将名词分为阳性、阴性或其他语法类别的语言中,一个名词的性别会影响到它周围的几个词。.

语法性别如何影响翻译

语法性别并非仅仅指将名词标记为阳性或阴性。性别会影响语法一致性,这意味着相关的冠词、形容词、代词或其他词语也可能需要随之改变。一个简化的关系如下所示:

				
					noun → article → adjective 
				
			

如果翻译引擎为名词选择了错误的性别,错误可能会蔓延到短语的其余部分。这样一来,就不仅仅是一个词出错,而是整个表达方式都可能出现语法不一致的情况。.

当源语言短语没有明确提供目标语言所需的信息时,翻译就变得尤为困难。因此,一个简短的英语短语可能需要额外的上下文信息才能正确翻译成具有语法性别的语言。.

法国和西班牙的性别协议

法语和西班牙语清晰地展现了名词性如何影响周围词语。名词通常具有语法性,相关的冠词和形容词需要与该语法性保持一致。.

对于网站而言,这会影响产品描述、类别名称、个人资料标签或服务描述中使用的短语。如果名词的性别翻译错误,则可能导致短语其余部分的性别一致性错误。例如,翻译工作流程可能需要确定:

  • 这里描述的是哪个名词?
  • 它的语法性别是什么?
  • 它应该与哪篇文章一起发表?
  • 这个形容词需要有相应的形式吗?

这就是为什么单独来看每个单词都正确的翻译,组合在一起时语法可能仍然错误的原因。.

UI字符串中的性别错误

简短的用户界面字符串尤其难以翻译,因为它们通常缺乏上下文信息。翻译系统可能会收到诸如“新账户”、“个人资料已更新”或“可用服务”之类的短语,但却不清楚这些名词在页面其他地方的具体用法。.

这种情况在标签、通知、行动号召按钮、产品名称和可重用界面组件中很常见。翻译键可能只包含几个词,而用于确定语法一致性的信息则存在于应用程序的其他位置。例如,开发人员可能会重用一个通用字符串,例如:

				
					New {item} 


				
			

正确的翻译可能取决于 {item} 的具体含义。如果该变量可以指代具有不同语法性别的名词,那么单一的静态翻译可能无法在所有情况下都适用。.

因此,问题不仅仅在于人工智能“翻译错误”。它可能没有获得足够的信息来确定目标语言需要哪种语法形式。.

纠正语法性别错误

纠正性别相关的错误,首先要赋予翻译系统对术语和语境足够的控制权。团队不应完全依赖自动输出,而应定义重要术语的翻译和审核方式。一些有效的方法包括:

  • 在词汇表中定义性别敏感术语,以便重要名词始终使用预期形式。.
  • 对重复出现的模式或特定术语使用自定义翻译规则。.
  • 对于源文本无法明确显示所需性别的模糊用户界面字符串,请提供更多上下文信息。.
  • 对语法一致性至关重要的关键页面和字符串进行人工后期编辑。.

这种组合对于拥有大量可重用 UI 内容的网站尤其有用,因为在多个地方手动纠正同一个问题很快就会变得效率低下。.

性别和人称名词形式

复数形式、语法性别和正式语体:人工智能翻译面临的语言学边缘问题

某些语言的特殊情况超越了简单的阴阳性之分。在某些语言中,语法形式还取决于名词所指代的对象,例如人、物或其他类别。这些情况使得语境对于自动翻译而言更加重要。. 

名词形式随语境而变化

一个词根据其在句子中的含义或指称对象,可能需要不同的语法形式。当网站的不同部分重复使用同一个翻译键时,就会出现问题。例如,常见的网站内容包括:

  • 用户和帐户角色
  • 产品类别
  • 客户类型
  • 可以指人或物体的标签

简短的标签在源语言中可能看起来无害,但在目标语言中却需要补充信息。例如,仪表盘可能在某个地方使用通用标签“客户”,而在其他地方则将类似的结构用于非人类实体。.

当缺少上下文信息时,翻译引擎可能会选择语法正确但含义错误的翻译形式。因此,简短的孤立字符串是多语言界面中最容易出错的部分之一。.

波兰语中以人称为基础的名词形式

波兰语表明,语法形式会根据指代对象是人还是非人类实体而有所不同。这意味着翻译一个词或短语可能需要比原文所包含的信息更多。.

设想一个仪表盘,用于显示用户、客户和产品的数量。该界面可以使用可重用的结构,例如 {count} 个用户 或 {count} 个产品。.

正确的语法处理取决于所统计的内容以及相关的语法范畴。因此,翻译引擎需要理解内容描述的是人还是物,而不是将每个名词都视为可以互换的标签。.

对于开发者和网站所有者来说,这凸显了孤立字符串翻译的一个重要局限性,翻译引擎需要足够的上下文来识别字符串所代表的内容。.

为什么人工智能会忽略上下文语法规则

当目标语言需要源字符串中不存在的信息时,人工智能翻译在处理上下文语法时可能会遇到困难。例如,英语通常会隐含一些语法信息,而其他语言可能需要明确表达这些信息。常见原因包括:

  • 非常短的字符串,几乎没有上下文。.
  • 未指明其代表含义的变量。.
  • 网站不同部分重复使用的翻译键。.
  • 源语言结构无法编码目标语言所需的信息。.

取一个字符串,例如:

				
					{{count}} users 
				
			

翻译引擎需要理解 {{count}} 代表什么,以及哪些语法规则适用于后面的名词。同样,像以下这样的字符串:

				
					{{name}} is available 
				
			

可能需要了解 {{name}} 在某种语言中指的是什么,因为语法一致性取决于该信息。.

字符串提供的上下文越少,自动系统就越有可能需要做出语法假设。.

修正性别和名词形式错误

最可靠的方法是赋予翻译工作流程更多控制权,使其能够更好地处理语法上下文至关重要的字符串。自动翻译可以处理初始工作量,而额外的控制措施则有助于解决重复出现或含义模糊的情况。一个实用的工作流程可以结合以下几点:

  • 上下文感知翻译,用于翻译含义取决于其用法的字符串。.
  • 包含具有特定语法要求的术语表。.
  • 针对重复模式的自定义翻译规则。.
  • 人工审核含义模糊或影响较大的字符串。.
  • 翻译记忆库 用于保存已更正的翻译,以供将来使用。

这种方法避免将每个译文都视为孤立的句子,而是确保网站各处重要的语法规则保持一致。.

正式语言规则与非正式语言规则

复数形式、语法性别和正式语体:人工智能翻译面临的语言学边缘问题

正式语言和非正式语言也会造成结构性翻译问题。在某些语言中,语域会影响代词、动词形式和句子结构,因此选择错误的语域会改变译文的语法。. 

正式和非正式代词

有些语言区分正式和非正式的称呼方式。合适的称呼方式取决于受众、关系和语境。例如,英语用户界面上的“请输入您的姓名”就是一个典型的例子。.

英语翻译通常不需要区分“你”是正式还是非正式的。但目标语言可能需要这种区分。具体选择哪种方式取决于网站:

  • 电子商务结账: 可以使用礼貌或正式的形式。
  • 客户支持: 可能更喜欢礼貌的登记方式。
  • 银行或账户页面: 可能始终使用正式语言。
  • SaaS 用户引导: 可根据品牌选择正式语言或更口语化的语言。

关键在于一致性。一旦网站建立了统一的语法体系,翻译后的用户界面字符串在整个用户体验过程中都应遵循相同的语法规则。.

语域如何改变句结构

语域的影响远不止于称呼对方时使用的代词。在具有正式和非正式语法形式的语言中,语域的选择还会影响动词变位或句子的其他部分。例如,同一种类型的信息可能会出现在不同的语境中:

  • 正式的客户通知可以使用礼貌的语法结构。.
  • 非正式的消费者应用程序可能更直接地与用户沟通。.
  • 专业服务网站可能会始终使用正式表格。.

这意味着语域应被视为一种语言规则,而不仅仅是一种写作风格偏好。如果翻译引擎在没有明确理由的情况下频繁切换正式和非正式结构,即使每个句子在技术上都能理解,网站也会显得前后不一致。.

在用户界面和客户消息中记录错误

网站的许多地方都可能出现语域不一致的情况,尤其是在不同字符串被独立翻译时。常见区域包括:

  • 用户界面标签
  • 错误信息
  • 通知
  • 交易邮件
  • 客户支持消息

想象一下,结账流程始终以正式的称谓称呼顾客,但随后一条通知却突然切换到非正式的代词。两条信息可能都没有明显的翻译错误,但这种变化会造成多语言体验的不一致性。.

当用户在同一网站的不同部分之间切换时,这一点尤为明显。翻译系统需要保持相关字符串的语域一致,而不是为每个句子单独决定语域。.

保持语言风格的一致性

第一步是为每种目标语言确定首选语域,并在整个网站中保持一致。这样,当源语言没有明确区分语域时,译者和翻译系统就能有清晰的参考依据。网站可以通过以下方式来支持这种一致性:

  • 定义首选语体的翻译指南。.
  • 重要代词和术语词汇表。.
  • 针对重复出现的语言模式制定自定义翻译规则。.
  • 人工审核高影响力内容,例如结账和交易信息。.

有了这些控制措施,正式和非正式的选择就成为翻译工作流程的一部分,而不是从一个字符串随机到另一个字符串做出的决定。.

修复结构化人工智能翻译错误

复数形式、语法性别和正式语体:人工智能翻译面临的语言学边缘问题

使用自定义翻译规则

自定义翻译规则让您可以更好地控制特定术语、模式或字符串的处理方式,尤其是在自动翻译无法生成所需语法结果时。例如,规则可以帮助管理:

  • 动态复数化模式
  • 具体术语
  • 一致的语法形式
  • 重复的 UI 字符串

与其每次都手动更正相同的翻译,不如定义一条规则,让翻译始终如一地应用您偏好的行为。这对于包含动态或可重用组件的网站尤其有用。Linguise Linguise 翻译规则,允许您微调特定翻译,同时保持其余内容自动处理。

打破语言障碍
告别语言障碍,迎接无限发展!立即体验我们的自动翻译服务。.

使用术语表控制术语

术语表有助于控制术语,确保其在不同译本中保持一致。当一个术语有多种译法或其语法特征至关重要时,术语表尤其有用。例如,术语表可以为以下术语定义首选译法:

  • 产品名称
  • 品牌术语
  • 角色名称
  • 具有特定语法性别的词类

这样一来,翻译引擎就能获得明确的参考信息,而不是让每个词条都存在新的解读空间。对于多语言网站而言,这可以减少术语差异,并有助于保持语法选择的一致性。.

人工后期编辑

某些结构性特殊情况仍然需要人工语言判断,尤其是在无法从源字符串中可靠推断必要上下文时。对于高影响力内容,例如:可以优先考虑人工后期编辑。

  • 结账流程
  • 法律和账户信息
  • 重要通知
  • 高流量着陆页

目的并非手动翻译整个网站。相反,人工审核可以集中精力于语法准确性直接影响用户体验的特殊情况和敏感语句。.

使用翻译记忆库保存更正

翻译经过审核和修正后,下次翻译类似字符串时,修正内容不应消失。 翻译记忆库 有助于保存已批准的翻译,以便将其重复用于匹配或类似的内容。简化的工作流程如下:

AI翻译→人工校对→保存翻译→用于匹配内容。.

对于用户界面字符串重复、术语反复出现或内容高度相似的网站来说,这尤其有用。一旦修正了结构性问题,就可以每次都应用相同的决策,而无需从头开始进行新的自动翻译。. 

准备好探索新市场了吗?试用我们的自动翻译服务,享受1个月无风险试用,无需信用卡!

结论

即使乍看之下翻译准确无误,结构化人工智能翻译也可能出现错误。复数形式、语法性别、基于人称的名词形式以及正式或非正式语体都可能引入原文中并不明显的规则。.

目标语言越复杂,控制自动翻译的应用方式就越重要。Linguise Linguise 自动翻译与自定义翻译规则、术语表管理、人工后期编辑和翻译记忆库等控制功能相结合,使网站所有者能够在不牺牲自动翻译效率的前提下,轻松应对各种语言上的复杂情况。 立即试用 Linguise ,确保您的多语言网站在不同语言间保持准确性和一致性。

您可能也有兴趣阅读

不要错过!
订阅我们的新闻通讯

接收有关网站自动翻译、国际SEO等的新闻!

Invalid email address
试试看,每月仅需一次,您可以随时取消订阅。.

不要离开而不分享您的电子邮件!

我们无法保证您会赢得彩票,但我们可以承诺提供一些有关翻译的有趣信息新闻和偶尔的折扣。.

不要错过!
Invalid email address