CanDoYa
VI

Nhận diện ngôn ngữ bằng AI

Chạy hoàn toàn trên trình duyệt của bạn - không tải lên, không cần đăng ký.

Dán một câu hoặc đoạn văn để nhận diện ngôn ngữ.

Văn bản được xử lý trong một luồng riêng của trình duyệt và không bao giờ được tải lên. Chỉ mô hình AI công khai được tải xuống.

20 ngôn ngữ được hỗ trợ

Tiếng Ả Rập, Bulgaria, Trung, Hà Lan, Anh, Pháp, Đức, Hy Lạp, Hindi, Ý, Nhật, Ba Lan, Bồ Đào Nha, Nga, Tây Ban Nha, Swahili, Thái, Thổ Nhĩ Kỳ, Urdu và Việt.

Văn bản bằng ngôn ngữ khác có thể bị gắn nhãn sai thành lựa chọn được hỗ trợ gần nhất.

Chia sẻ công cụ này

Công cụ nhận diện ngôn ngữ là gì?

Công cụ nhận diện ngôn ngữ xác định ngôn ngữ có khả năng cao nhất của đoạn văn bản được dán vào. Công cụ này so sánh mẫu với 20 ngôn ngữ và hiển thị ba điểm số cao nhất của mô hình. AI chạy cục bộ trong một luồng xử lý của trình duyệt nên văn bản không bị tải lên, dù mô hình cần được tải xuống ở lần dùng đầu tiên.

Cách dùng

  1. 1Dán một mẫu đủ rõ. Nhập một câu hoàn chỉnh hoặc một đoạn văn bằng một trong 20 ngôn ngữ được hỗ trợ. Văn bản tự nhiên và dài thường dễ phân biệt hơn tên riêng hoặc một từ đơn lẻ.
  2. 2Chạy nhận diện trên thiết bị. Nhấn Nhận diện ngôn ngữ. Ở lần đầu, hãy chờ mô hình tải xong; những lần sau trình duyệt có thể dùng lại bộ nhớ đệm nếu dữ liệu vẫn còn.
  3. 3Xem các kết quả theo thứ hạng. Kiểm tra ngôn ngữ đứng đầu, mã ISO, điểm số và các lựa chọn khác. Hãy xem điểm số sát nhau, mẫu ngắn và ngôn ngữ không được hỗ trợ là những trường hợp chưa chắc chắn.

Dành cho ai

Công cụ chạy mô hình phân loại XLM-R ngay trên thiết bị. Quá trình suy luận diễn ra trong một luồng xử lý riêng để trang luôn phản hồi. Công cụ ưu tiên tăng tốc bằng WebGPU và thử lại với backend CPU WebAssembly khi cần. Lần chạy đầu tiên tải khoảng 296 MB dữ liệu mô hình và tokenizer từ Hugging Face. Trình duyệt thường lưu các tệp này vào bộ nhớ đệm, nhưng có thể xóa chúng khi bạn dọn dữ liệu hoặc thiết bị sắp hết dung lượng.

Mô hình so sánh tiếng Ả Rập, Bulgaria, Trung, Hà Lan, Anh, Pháp, Đức, Hy Lạp, Hindi, Ý, Nhật, Ba Lan, Bồ Đào Nha, Nga, Tây Ban Nha, Swahili, Thái, Thổ Nhĩ Kỳ, Urdu và Việt. Văn bản thuộc ngôn ngữ khác vẫn bị ép vào một trong các nhãn này, vì vậy hãy kiểm tra danh sách hỗ trợ trước khi dựa vào kết quả.

Câu hỏi thường gặp

Văn bản của tôi có được tải lên máy chủ không?

Không. Văn bản được chuyển vào một luồng xử lý bên trong trình duyệt và quá trình suy luận diễn ra trên thiết bị. Luồng này tải các tệp mô hình công khai cùng môi trường Transformers.js từ máy chủ bên ngoài, nhưng không gửi văn bản đã dán kèm các yêu cầu đó. CanDoYa không nhận hay lưu mẫu văn bản.

Công cụ nhận diện ngôn ngữ có miễn phí không?

Có. Bạn không cần tài khoản, thanh toán, hạn mức tín dụng hay khóa API. Thiết bị tự thực hiện suy luận. Chi phí thực tế là lần tải mô hình đầu tiên, dung lượng lưu trữ cục bộ, bộ nhớ và thời gian xử lý. Nếu dùng mạng tính phí theo dung lượng, nhà mạng vẫn có thể tính phí dữ liệu tải mô hình.

Tôi có thể phân tích bao nhiêu văn bản?

Bạn có thể dán một đoạn văn thông thường ở bất kỳ độ dài nào, nhưng công cụ chỉ phân tích tối đa 400 ký tự đầu để nằm trong cửa sổ đầu vào của mô hình và giữ thời gian suy luận trong trình duyệt ổn định. Cần tối thiểu bốn chữ cái hoặc chữ số. Một câu tự nhiên đầy đủ cho kết quả hữu ích hơn; cả đoạn văn cung cấp thêm mẫu để phân biệt.

Đoạn văn này là ngôn ngữ gì? Công cụ nhận diện được những ngôn ngữ nào?

Mô hình hỗ trợ 20 nhãn: tiếng Ả Rập, Bulgaria, Trung, Hà Lan, Anh, Pháp, Đức, Hy Lạp, Hindi, Ý, Nhật, Ba Lan, Bồ Đào Nha, Nga, Tây Ban Nha, Swahili, Thái, Thổ Nhĩ Kỳ, Urdu và Việt. Công cụ không thể nhận diện đáng tin cậy các ngôn ngữ ngoài tập đóng này.

Vì sao lần tải đầu tiên khoảng 296 MB?

Công cụ dùng mô hình nơ-ron đa ngôn ngữ XLM-R thay vì một bảng tần suất ký tự nhỏ. Trọng số ONNX đã lượng tử hóa chiếm khoảng 279 MB, còn tokenizer khoảng 17 MB. Trình duyệt thường lưu cả hai vào bộ nhớ đệm, nhưng chế độ duyệt riêng tư, việc xóa bộ nhớ đệm hoặc dữ liệu trang có thể khiến chúng phải được tải lại.

Nhận diện ngôn ngữ có hoạt động khi không có WebGPU không?

Có. Luồng xử lý ưu tiên WebGPU khi trình duyệt cung cấp. Nếu thiếu WebGPU hoặc mô hình không khởi động được, công cụ thử lại bằng backend CPU WebAssembly. Suy luận trên CPU vẫn giữ văn bản trên thiết bị, nhưng quá trình tải và nhận diện có thể lâu hơn trên điện thoại hoặc máy tính cũ.

Điểm tin cậy có ý nghĩa gì?

Các điểm số xếp hạng 20 nhãn mà mô hình có thể chọn cho mẫu này. Chúng hữu ích để so sánh ứng viên, nhưng không bảo đảm kết quả đúng, không phải xác suất đúng độc lập và cũng không chứng minh ngôn ngữ thật sự được hỗ trợ. Nếu hai điểm cao nhất sát nhau, hãy thêm văn bản tự nhiên.

Công cụ có nhận diện văn bản trộn ngôn ngữ hoặc chuyển tự không?

Công cụ trả về một kết quả chính cùng các lựa chọn khác, không gắn nhãn cho từng câu hay từng từ. Văn bản trộn nhiều ngôn ngữ có thể cho các điểm số gần nhau. Chuyển tự không chính thức, tên riêng, biểu tượng cảm xúc, URL và mã nguồn cũng làm mất nhiều dấu hiệu về hệ chữ và chính tả, nên cần được con người xem lại cẩn thận.