CanDoYa
ZH-TW

AI 語言偵測

全程在瀏覽器裡執行,免上傳、免註冊。

貼上句子或段落以辨識語言。

文字在瀏覽器背景執行緒中處理,絕不會上傳。只有公開的 AI 模型會被下載。

支援 20 種語言

阿拉伯文、保加利亞文、中文、荷蘭文、英文、法文、德文、希臘文、印地文、義大利文、日文、波蘭文、葡萄牙文、俄文、西班牙文、史瓦希里文、泰文、土耳其文、烏都文和越南文。

其他語言可能被錯誤標成最接近的支援選項。

分享這個工具

什麼是語言偵測?

語言偵測會判斷貼上文字最可能使用哪一種語言。此工具把範例與 20 種語言比較,並顯示模型分數最高的 3 個結果。AI 在瀏覽器的背景執行緒中本機運算,因此不會上傳文字,但首次使用時仍需下載模型。

使用方式

  1. 1貼上足夠的範例. 輸入 20 種支援語言之一的完整句子或段落。相較於姓名或單一詞彙,較長且自然的文字通常更容易區分。
  2. 2在裝置上執行偵測. 按下「偵測語言」。首次執行時請等候模型下載;之後只要快取檔案仍在,瀏覽器便可重複使用。
  3. 3查看排序結果. 檢查第一名語言、ISO 代碼、分數和其他候選結果。遇到分數接近、範例太短或不支援的語言時,請把結果視為不確定。

適合誰用

此偵測器會在裝置上執行 XLM-R 分類模型,並在背景執行緒完成推論,讓頁面保持順暢。工具會優先使用 WebGPU 加速,必要時改用 WebAssembly CPU 後端。首次執行時,會從 Hugging Face 下載約 296 MB 的模型與斷詞器資料。瀏覽器通常會快取這些檔案,但清除儲存空間或可用空間不足時,檔案可能被移除。

模型只會比較阿拉伯文、保加利亞文、中文、荷蘭文、英文、法文、德文、希臘文、印地文、義大利文、日文、波蘭文、葡萄牙文、俄文、西班牙文、史瓦希里文、泰文、土耳其文、烏都文及越南文。不在清單內的語言會被迫歸到其中一個標籤,因此使用結果前請先確認支援清單。

常見問題

我的文字會上傳到伺服器嗎?

不會。文字會傳給瀏覽器內的背景執行緒,並在裝置上完成推論。背景執行緒會從外部主機下載公開模型檔案與 Transformers.js 執行環境,但這些請求不會包含貼上的文字。CanDoYa 不會收到或儲存文字範例。

語言偵測器可以免費使用嗎?

可以。無須帳號、付費、點數或 API 金鑰。推論由你的裝置執行,實際成本是首次下載、裝置儲存空間、記憶體與處理時間。若網路方案按流量計費,下載模型檔案仍可能產生費用。

可以分析多少文字?

可以貼上一般長度的段落,但偵測器最多只分析前 400 個字元,以符合模型的輸入範圍並維持可預期的瀏覽器推論時間。至少需要 4 個字母或數字。若要取得實用結果,請提供至少一個自然句子;一整段文字能提供更多可區分的模式。

這項工具可以辨識哪些語言?

模型支援 20 個標籤:阿拉伯文、保加利亞文、中文、荷蘭文、英文、法文、德文、希臘文、印地文、義大利文、日文、波蘭文、葡萄牙文、俄文、西班牙文、史瓦希里文、泰文、土耳其文、烏都文和越南文。它無法可靠辨識此封閉集合以外的語言。

為什麼首次下載約為 296 MB?

此偵測器使用多語言 XLM-R 神經模型,而不是小型字元頻率表。量化後的 ONNX 權重約 279 MB,斷詞器約 17 MB。瀏覽器通常會快取兩者,但快取遭移除、使用私密瀏覽或清除網站資料後,可能需要重新下載。

沒有 WebGPU 也能偵測語言嗎?

可以。瀏覽器提供 WebGPU 時,背景執行緒會優先使用。若缺少 WebGPU 或模型啟動失敗,工具會改用 WebAssembly CPU 後端重試。文字仍留在裝置上,但手機或較舊電腦的載入與偵測時間可能更長。

信心分數代表什麼?

分數會針對這段範例排列模型的 20 個可能標籤,可用來比較候選結果,但不保證正確,也不是獨立的正確機率,更不能證明真正的語言在支援清單中。若前幾名分數接近,請加入更多自然文字。

可以偵測混合語言或羅馬拼音嗎?

工具會回傳一個主要結果與其他候選項目,不會為每個句子或詞彙分別標記語言。混合語言文字可能產生接近的分數。非正式羅馬拼音、姓名、表情符號、網址與原始碼也會減少字形和拼字線索,因此需要人工謹慎檢查。