無限ノック › AIF 練習問題一覧 › 問題
AIF生成AIの基礎

Amazon Bedrockを使ってテキスト処理アプリケーションを開発している企業が、処理コストを事前に見積もろうとしています。日本語テキストのトークン数に関する説明として最も正確なものはどれですか?

A
日本語は1文字が常に1トークンに対応するため、文字数をカウントすることでトークン数を正確に算出できる
日本語は1文字が常に1トークンに対応する は誤りです。
B
トークンはサブワード(部分単語)単位で分割されるため、日本語は英語と比べて同じ情報量でもより多くのトークンを消費する傾向がある
✓ 正解
LLMのトークナイザーはBPE(Byte Pair Encoding:バイト対符号化)等のアルゴリズムでテキストをサブワード単位に分割します。日本語の1文字が常に1トークンになるわけではなく、トークナイザーは言語ごとに異なる分割パターンを適用するため英語と日本語のトークン効率は同等ではありません。英語では頻出単語が1〜2トークンになることが多い一方、日本語は漢字・ひらがな・カタカナが混在しトークンあたりの情報密度が低いため、同じ意味内容でもより多くのトークンが必要になる傾向があります。
C
LLMのトークナイザーは言語に関わらず同一のルールを適用するため、英語と日本語のトークン効率は同等である
LLMのトークナイザーは言語に関わらず同一のルールを適用する は誤りです。
D
Amazon Bedrockの料金はトークン数ではなくAPIリクエスト回数に基づくため、テキストの長さはコストに直接影響しない
Amazon Bedrockの料金はAPIリクエスト回数に基づく は誤りで、入力・出力トークン数に基づきます。

解説

LLMのトークナイザーはBPE(Byte Pair Encoding:バイト対符号化)等のアルゴリズムでテキストをサブワード単位に分割します。日本語の1文字が常に1トークンになるわけではなく、トークナイザーは言語ごとに異なる分割パターンを適用するため英語と日本語のトークン効率は同等ではありません。英語では頻出単語が1〜2トークンになることが多い一方、日本語は漢字・ひらがな・カタカナが混在しトークンあたりの情報密度が低いため、同じ意味内容でもより多くのトークンが必要になる傾向があります。 選択肢Aの 日本語は1文字が常に1トークンに対応する は誤りです。 選択肢Cの LLMのトークナイザーは言語に関わらず同一のルールを適用する は誤りです。 選択肢Dの Amazon Bedrockの料金はAPIリクエスト回数に基づく は誤りで、入力・出力トークン数に基づきます。

ドメイン別正答率・予想スコアでリアルタイムに実力把握

無限ノックでAIFを徹底対策。全問AI生成のオリジナル問題。

無料で演習を始める →
← AIF の問題一覧に戻る