Amazon Bedrockを使ってテキスト処理アプリケーションを開発している企業が、処理コストを事前に見積もろうとしています。日本語テキストのトークン数に関する説明として最も正確なものはどれですか?
LLMのトークナイザーはBPE(Byte Pair Encoding:バイト対符号化)等のアルゴリズムでテキストをサブワード単位に分割します。日本語の1文字が常に1トークンになるわけではなく、トークナイザーは言語ごとに異なる分割パターンを適用するため英語と日本語のトークン効率は同等ではありません。英語では頻出単語が1〜2トークンになることが多い一方、日本語は漢字・ひらがな・カタカナが混在しトークンあたりの情報密度が低いため、同じ意味内容でもより多くのトークンが必要になる傾向があります。 選択肢Aの 日本語は1文字が常に1トークンに対応する は誤りです。 選択肢Cの LLMのトークナイザーは言語に関わらず同一のルールを適用する は誤りです。 選択肢Dの Amazon Bedrockの料金はAPIリクエスト回数に基づく は誤りで、入力・出力トークン数に基づきます。