CanDoYa
JA

AI言語判定

すべてブラウザー内で動作します。アップロードも登録も不要です。

一文または段落を貼り付けて言語を判定します。

文章はブラウザの別プロセスで処理され、送信されません。ダウンロードされるのは公開AIモデルだけです。

対応する20言語

アラビア語、イタリア語、ウルドゥー語、英語、オランダ語、ギリシャ語、スワヒリ語、スペイン語、タイ語、ドイツ語、トルコ語、日本語、ヒンディー語、フランス語、ブルガリア語、ベトナム語、ポーランド語、ポルトガル語、ロシア語、中国語。

対応外の言語は、最も近い対応言語として誤って判定される場合があります。

このツールをシェア

言語判定とは何ですか?

言語判定は、貼り付けた文章が何語で書かれている可能性が高いかを調べる機能です。このツールは20言語と照合し、モデルの上位3スコアを表示します。AIはブラウザの別プロセスで動くため、文章は送信されません。ただし、初回のみモデルのダウンロードが必要です。

使い方

  1. 1判定しやすい文章を貼り付ける. 対応する20言語のいずれかで、完全な一文または段落を入力します。名前や単語だけよりも、自然で長めの文章のほうが判別しやすくなります。
  2. 2端末上で判定する. 「言語を判定」を押します。初回はモデルのダウンロード完了を待ってください。次回以降は、残っていればブラウザのキャッシュを再利用できます。
  3. 3順位付きの候補を確認する. 最上位の言語、ISOコード、スコア、ほかの候補を確認します。スコアが近い場合、文章が短い場合、対応外の言語の場合は不確かな結果として扱ってください。

こんな方に

XLM-R分類モデルを端末上で実行します。推論は別プロセスで行うため、処理中もページを操作できます。まずWebGPUによる高速化を試し、使えない場合はWebAssemblyを使ってCPUで再試行します。初回はHugging Faceからモデルとトークナイザーを合わせて約296 MBダウンロードします。通常はブラウザにキャッシュされますが、サイトデータの削除や空き容量の不足により消去される場合があります。

判定できるのは、アラビア語、イタリア語、ウルドゥー語、英語、オランダ語、ギリシャ語、スワヒリ語、スペイン語、タイ語、ドイツ語、トルコ語、日本語、ヒンディー語、フランス語、ブルガリア語、ベトナム語、ポーランド語、ポルトガル語、ロシア語、中国語の20言語です。対象外の言語もいずれかのラベルに割り当てられるため、結果を利用する前に対応言語を確認してください。

よくある質問

入力した文章はサーバーへ送信されますか?

送信されません。文章はブラウザ内の別プロセスへ渡され、端末上で推論されます。そのプロセスは公開されているモデルファイルとTransformers.jsの実行環境を外部ホストからダウンロードしますが、貼り付けた文章をリクエストに含めません。CanDoYaが文章を受信または保存することもありません。

言語判定は無料ですか?

無料です。アカウント、支払い、クレジット枠、APIキーは必要ありません。推論は端末が行います。初回ダウンロードに加え、ローカルストレージ、メモリ、処理時間だけが必要です。通信量に応じて課金される回線では、モデルのダウンロードに料金がかかる場合があります。

どのくらいの長さまで分析できますか?

通常の文章なら長くても貼り付けられますが、モデルの入力範囲を超えず処理時間を安定させるため、分析対象は先頭400文字までです。文字または数字が最低4文字必要です。役立つ結果には自然な一文を、より多くの特徴を与えるには段落を入力してください。

どの言語を判定できますか?

対応する20ラベルは、アラビア語、イタリア語、ウルドゥー語、英語、オランダ語、ギリシャ語、スワヒリ語、スペイン語、タイ語、ドイツ語、トルコ語、日本語、ヒンディー語、フランス語、ブルガリア語、ベトナム語、ポーランド語、ポルトガル語、ロシア語、中国語です。この閉じた範囲にない言語は正確に判定できません。

初回に約296 MBをダウンロードするのはなぜですか?

小さな文字頻度表ではなく、多言語のXLM-Rニューラルモデルを使うためです。量子化されたONNXの重みは約279 MB、トークナイザーは約17 MBあります。通常は両方ともブラウザにキャッシュされますが、プライベートブラウズ、サイトデータの削除、キャッシュの自動消去後は再ダウンロードが必要です。

WebGPUがなくても言語判定できますか?

できます。ブラウザが対応していれば、別プロセスはWebGPUを優先します。WebGPUがない場合やモデルの起動に失敗した場合は、WebAssemblyを使ってCPUで再試行します。文章は端末内に残りますが、スマートフォンや古いパソコンでは読み込みと判定に時間がかかることがあります。

信頼度スコアは何を表しますか?

この文章について、20個の候補ラベルをモデルが順位付けした値です。候補の比較には使えますが、正解の保証、独立した正解確率、実際の言語が対応範囲にあることの証明ではありません。上位スコアが近いときは、自然な文章を追加してください。

複数言語やローマ字表記の文章も判定できますか?

文章や単語ごとのラベルではなく、最も有力な1候補とほかの候補を返します。複数言語が混ざるとスコアが近くなる場合があります。くだけた翻字、固有名詞、絵文字、URL、ソースコードも文字体系や綴りの手掛かりを減らすため、人による慎重な確認が必要です。