翻訳メモリ選択ガイドライン
Phrase Custom AIは、翻訳メモリ(TM)を活用し、特定の用語およびスタイルに則ったカスタム機械翻訳(MT)モデルを作成します。それにより、汎用機械翻訳と比較して対象コンテンツの翻訳品質が向上し、結果としてポストエディット時間も短縮されます。
カスタマイズプロセスの有効性に影響を与える最も重要な要素は、使用される翻訳メモリです。これらは、この目的のためにどのデータを使用すべきかを判断するのに役立つ一般的なガイドラインです。
-
単一ドメイン:
データセットが、単一のスタイルと用語をカバーするコンテンツに焦点を当てていることが最善です。データセットに複数のドメインが混在している場合(例:ウェブサイトの法的条項と製品説明の両方)、モデルは目的のスタイルが何であるかを学習できない可能性があります。
-
固有のコンテンツタイプ:
カスタムMTモデルは、インターネットから収集された膨大な量の公開データでトレーニングされた汎用モデルの上に構築されます。翻訳メモリに、汎用モデルの構築に使用される汎用データと非常に類似したデータが含まれている場合、カスタマイズプロセスから得られるものはほとんどありません。
-
データの品質:
モデルは、翻訳メモリ内のすべての文ペアが、生成を期待される出力の例であると想定します。翻訳メモリは高品質である必要があり、理想的にはプロの翻訳者による翻訳から作成されたものである必要があります。データクリーニングパイプラインは、データセットから最も有害な部分を取り除くのに役立ちます。
-
予想されるボリューム:
ROIの観点からカスタマイズを効果的なものにするには、データセットが、MTの品質がより大きな影響を与えるデータの大部分を代表している必要があります。例えば、MT出力の一部を人間がポストエディットする場合、ROIを最大化するには、データがポストエディットされるコンテンツを代表している必要があります。
自動アセットキュレーション用のデータセット作成プロセスは、少し異なります。
カスタムMTエンジンをトレーニングする目的でデータセットを作成するには、以下の手順に従ってください。
-
ページから、カスタムMTエンジンをトレーニングするをクリックします。
ページが開きます。
-
データセットの名前を入力します。
-
言語セレクターでは、さまざまなオプションを選択できます。
-
汎用言語データセットを作成するには、ソース言語とターゲット言語およびロケールセレクターで、同じソース言語とターゲット言語を選択します。
-
ロケール固有のデータセットを作成するには、最初のドロップダウンリストからソース言語とターゲット言語を選択し、2番目のドロップダウンリストからソースロケールとターゲットロケールを指定します。
より多くのデータソースを活用するために、複数のターゲットロケール(同じ言語の異なるバリエーションなど)を追加することもできます。
-
複数のソースロケールとターゲットロケールを持つデータセットを作成するには、最初のドロップダウンリストからソース言語とターゲット言語を選択し、2番目のドロップダウンリストからソースロケールとターゲットロケールを指定して(同じターゲット言語の異なるバリエーションを追加可能)、+ ロケールペアを追加をクリックします。
ウィンドウが表示されます。
-
-
翻訳メモリを追加をクリックします。
ページが開き、検索機能
が表示されます。
-
データセットにTMを追加するには、
アイコンをクリックします。TMが列に追加されます。
複数のTMを、最大200個および最大800万セグメントまで追加できます。データセットには、理想的には少なくとも10,000セグメントを含める必要があります。
TM名をクリックすると、翻訳メモリページでその選択内容が表示されます。
アイコンをクリックすると、列からTMが削除されます。
-
保存をクリックします。
ページが開きます。
-
表示された詳細を確認し、正しい場合は続行をクリックします。
ページが開きます。
-
必要なフィルターを適用し、作成をクリックします。
データセットが作成され、ページのリストに、初期ステータスが、列においてのステータスとして追加されます。