CanDoYa
ZH

AI语言识别

全程在浏览器中运行,无需上传,无需注册。

粘贴一个句子或段落来识别语言。

文本只在浏览器的独立进程中处理,绝不会上传。下载的只有公开AI模型。

支持20种语言

阿拉伯语、保加利亚语、中文、荷兰语、英语、法语、德语、希腊语、印地语、意大利语、日语、波兰语、葡萄牙语、俄语、西班牙语、斯瓦希里语、泰语、土耳其语、乌尔都语和越南语。

其他语言的文本可能被错误标记为最接近的支持语言。

分享此工具

什么是语言识别?

语言识别会判断粘贴文本最可能使用哪种语言。此工具把样本与20种语言进行比较,并显示模型得分最高的3个结果。AI在浏览器的独立进程中运行,因此文本不会上传,但首次使用时需要下载模型。

使用方法

  1. 1粘贴有效样本. 输入20种支持语言之一的完整句子或段落。与姓名或单个词相比,较长的自然文本通常更容易区分。
  2. 2在设备上开始识别. 点击识别语言。首次运行时请等待模型下载完成;以后访问时,如果浏览器缓存仍然存在,就能直接复用。
  3. 3查看排序结果. 核对首选语言、ISO代码、得分和其他候选。得分接近、样本过短或语言不在支持范围时,都应把结果视为不确定。

适用人群

识别过程会在设备上运行XLM-R分类模型,推理工作放在独立进程中,页面不会因此失去响应。工具优先使用WebGPU加速,必要时改用WebAssembly在CPU上重试。首次运行需要从Hugging Face下载约296 MB的模型和分词器数据。浏览器通常会缓存这些文件,但清理存储空间或可用空间不足时可能将其删除。

模型可比较阿拉伯语、保加利亚语、中文、荷兰语、英语、法语、德语、希腊语、印地语、意大利语、日语、波兰语、葡萄牙语、俄语、西班牙语、斯瓦希里语、泰语、土耳其语、乌尔都语和越南语。其他语言的文本也会被强制归入其中一个标签,因此采用结果前请先确认支持列表。

常见问题

我的文本会上传到服务器吗?

不会。文本会传给浏览器内的独立进程,并在设备上完成推理。该进程会从外部主机下载公开的模型文件和Transformers.js运行环境,但这些请求不会携带粘贴的文本。CanDoYa也不会接收或保存样本。

语言识别可以免费使用吗?

可以。无需账号、付款、点数或API密钥,推理由设备完成。实际需要的资源只有首次下载、设备存储空间、内存和处理时间。如果网络套餐按流量计费,下载模型仍可能产生流量费用。

最多可以分析多少文本?

可以粘贴普通长度的段落,但为了符合模型的输入窗口并让浏览器推理时间保持稳定,工具最多分析开头400个字符。最低要求是4个文字或数字。至少输入一个自然句子才更有参考价值,段落能提供更多区别特征。

这个工具能识别哪些语言?

模型支持20个标签:阿拉伯语、保加利亚语、中文、荷兰语、英语、法语、德语、希腊语、印地语、意大利语、日语、波兰语、葡萄牙语、俄语、西班牙语、斯瓦希里语、泰语、土耳其语、乌尔都语和越南语。它无法可靠识别闭集范围以外的语言。

为什么首次下载约为296 MB?

识别器使用多语言XLM-R神经网络模型,而不是小型字符频率表。量化后的ONNX权重约为279 MB,分词器约为17 MB。浏览器通常会缓存两者,但隐私浏览、清除网站数据或自动清理缓存后,需要重新下载。

没有WebGPU也能识别语言吗?

可以。浏览器支持WebGPU时,独立进程会优先使用它。如果没有WebGPU或模型启动失败,工具会改用WebAssembly在CPU上重试。文本仍会留在设备上,但手机或旧电脑的加载和识别时间可能更长。

置信度得分表示什么?

这些得分会为当前样本的20个候选标签排序。它们可以用来比较候选项,但不保证结果正确,不是相互独立的正确概率,也不能证明实际语言在支持范围内。如果前几名得分接近,请添加更多自然文本。

可以识别混合语言或转写文本吗?

工具会给出一个主要候选和其他候选,而不会为每个句子或词分别添加标签。多语言混合文本可能出现接近的得分。非正式转写、姓名、表情符号、URL和源代码也会减少文字系统和拼写线索,因此这些结果需要人工谨慎核对。