MTエンジンのトレーニングで最も重要な点は、単なる量ではなく、データの品質です。データのクリーニングは広範な問題であり、手動でのクリーニングは労力を要します。クリーンなデータは、より高速なトレーニングとより高品質なモデルにつながります。
Phrase Custom AIは、AIを活用したクリーニングフィルターとルールベースのクリーニングフィルターを使用して、翻訳メモリをデータセットに適応させます。提供されるデフォルト設定は、新規ユーザーに適しているはずです。
利用可能なフィルターセットには、ルールベースのフィルターとMLベースのフィルターの両方が含まれます。
-
ルールに基づく
人間が容易に理解できる、明確に定義されたルールで動作するフィルター。このフィルターカテゴリには、、、、、、、が含まれます。
-
MLベース
固定されたルールセットに従うのではなく、テキストの内容自体を分析して判断を下すフィルター。このフィルターカテゴリには、およびが含まれます。
すべてのフィルターは、クリーニングされたバージョンのセグメントに対して評価を行います。とりわけ、複数のスペースは1つに削減され、Phrase タグは削除されます。
日付範囲
設定された日付範囲外のセグメントを除外します。終了日と開始日は、セグメントの最終変更日とともに含まれます。
原文と訳文の不一致
このフィルターは、意味と意味的類似性の観点からセグメントがどの程度一致しているかを判断し、評価の低いものを削除します。文ペアのアライメントは、LASERメトリックを使用して測定されます。
AIエンジンを使用して、ソーステキストとターゲットテキストが同じ意味を持っているか、あるいはどの程度同じ意味を持っているかを確認します。推奨設定では、最も評価の低い10%のセグメントを破棄し、最も評価の高い90%のセグメントを保持します。
詳細設定では、アライメントを変更したり、0から1の数値(1は完全なアライメントを意味する)を使用した生の類似度スコアに基づくフィルターを使用したりできます。生の類似度スコアを使用する場合は注意が必要です。各言語ペアでスコアの分布が異なり、ある言語ペアで良いスコアと見なされるものが、別の言語ペアでは不十分なスコアになる可能性があるためです。
通常、0.5未満のセグメントはあまり質が良くなく、1に近い、または1を超えるセグメントは両方の言語で同じセグメントです。
**Examples**
原文「Super.」、「target」:「Super.」、「similarity」:40
原文「Hello」、「target」: 「http://wwww.sdsadsa.com」、「similarity」:40
最小の文字数および英字数
文字数にはすべての文字が含まれます。これには、すべての文字、空白、句読点、記号が含まれます。学習の目的では、文字を含まないセグメントを破棄すると便利な場合があります。
レター数は、英語のアルファベットなどの文字のみならず、発音記号付きの複雑な文字や漢字もカウントします。中国語の文字は、複数の文字を表す場合でも、1文字としてカウントされます。文字ベースの言語の場合、デフォルト値は1ですが、単語ベースの言語の場合、デフォルト値は文字数が4、レター数が3です。最小値は1、最大値は500です。
短いセグメントをデータ内に多く保持する場合(頭字語など)、フィルター値を低く設定してください。
例:
文のペアの長さ
このフィルターは、ユーザーが設定したしきい値よりも長いセグメントをすべて削除します。このフィルターの理由は、ほとんどのNMTシステムが、内部しきい値よりも長いセグメントでは実際には学習を行わないためです。
例えば、NextMTの内部しきい値は200トークンであり、これは約100〜1,000語に相当します。カスタムエンジンを短い文で学習させるには、この値をデフォルトよりも低く設定してください。
合計文字数には、ソース文とターゲット文の両方から、文字、空白、句読点を含むすべての文字が含まれます。言語の種類を考慮してください(例:中国語と英語)。ソース言語がCJK系ではなく、ターゲット言語がCJKである場合(またはその逆の場合)、このフィルターは無視されます。
長さの比率
このフィルターは、ソースセグメントとターゲットセグメントを比較した際に、長さが著しく異なるセグメントを特定します。ソース言語からターゲット言語へ翻訳する際、翻訳の長さが増減することがあります。翻訳が長すぎる、または短すぎる場合、低品質なトレーニングデータである可能性があります。
ソース言語がCJK系ではなく、ターゲット言語がCJK系である場合(またはその逆の場合)、このフィルターは無視されます。CJK
言語によっては他よりも冗長なものがあるため、200%が適切なデフォルト値です。ターゲット言語がソース言語と類似している場合、またはより多くのデータをフィルタリングする必要がある場合は、値を低く設定できます。
**Examples**
一方の言語がCJKである場合、比率は1です。破棄されません:
原文"This is a sentence.", "target": "这是一个句子。", "ratio":40
ドイツ語訳は英語のソースと同等の長さであり、破棄されません:
原文"This is a sentence.", "target":"Dies ist ein Satz.", "ratio":40
ドイツ語訳は英語のソースよりもはるかに長いため、破棄されます:
原文"This is a sentence.", "target":"Dies ist ein Satz mit zusätzlichen unnötigen Füllungen.", "ratio":40
翻訳不要箇所
翻訳不要なセグメントとは、ソースセグメントとターゲットセグメントが同じものを指します。ターゲットテキストがソーステキストから変更されていない、翻訳不要なすべての文ペアを除外します。
重複
同じソース文を持つセグメントのグループが作成されます。各グループから最適なセグメントのみが保持されるため、セグメントのソース文が一意であれば、自動的に保持されます。それ以外の場合、最も類似度スコアが高いセグメントが保持されます。
ほぼ重複
ニア重複をテストする際、ソース文の(わずかにクリーンなバージョン)が正規化されます。すべての非文字(例:“,?)!-)はスペースに置き換えられ、すべての文字は小文字に変換されます。
正規化されたソース文を使用して、同じ正規化ソース文を持つセグメントのグループが作成されます。各グループから最適なセグメントのみが保持されるため、セグメントの正規化されたソース文は一意となり、自動的に保持されます。それ以外の場合、最も類似度スコアが高いセグメントが保持されます。
言語識別
AIエンジンを使用して、文に基づいてソース言語とターゲット言語を識別します。セグメントは、エンジンが(ソース/ターゲット)言語を認識し(例えば、短い文ではエンジンが言語を特定するのに十分でないことがよくあります)、その言語が期待されるものと異なる場合にのみ削除されます。
QPS (品質評価スコア)
QPSフィルターは、データセット内の品質が最も低い文ペアを削除し、結果として得られるAIモデルが利用可能な最高品質のデータでトレーニングされるようにします。一般的に、トレーニングデータの品質が高いほど、カスタマイズされたモデルのパフォーマンスは向上します。
QPSフィルターは、次の2つの方法で構成できます。
-
最も低いQPSスコアを持つ文ペアを、指定された割合で削除します。推奨される割合は10%です。
-
スコアのしきい値を選択します。詳細設定を使用して、調整可能なQPSしきい値を下回る文ペアを除外します。推奨される開始値は50です。
これら2つのオプションは、ユーザーの品質目標に合わせて、データセットを自動的に整理します。