CanDoYa
VI

Phân tích cảm xúc miễn phí ngay trong trình duyệt

Hỗ trợ một số ngôn ngữ

Chạy hoàn toàn trên trình duyệt của bạn - không tải lên, không cần đăng ký.

Dán phản hồi, bài đánh giá hoặc bài đăng mạng xã hội để ước lượng giọng điệu.

Văn bản của bạn được xử lý trong một worker của trình duyệt và không bao giờ bị tải lên. Lần chạy đầu sẽ tải mô hình AI công khai.

Ba nhãn cảm xúc tổng thể

Tiêu cực là giọng điệu bất lợi, trung tính là không nghiêng rõ về tích cực hay tiêu cực, tích cực là giọng điệu thuận lợi.

Được fine-tune cho tiếng Ả Rập, Anh, Pháp, Đức, Hindi, Ý, Bồ Đào Nha và Tây Ban Nha. Các ngôn ngữ khác, bao gồm tiếng Việt, chỉ được hỗ trợ ở mức xấp xỉ.

Mô hình được xây dựng từ bài đăng mạng xã hội. Mỉa mai, cảm xúc lẫn lộn, ngôn ngữ chuyên ngành và văn bản ngoài các ngôn ngữ đã huấn luyện có thể bị gán nhãn sai.

Chia sẻ công cụ này

Phân tích cảm xúc là gì?

Phân tích cảm xúc là việc phân loại thái độ chung trong một đoạn văn bản thành tiêu cực, trung tính hoặc tích cực. Công cụ này chạy mô hình đa ngữ XLM-T ngay trong trình duyệt và hiển thị điểm số cho từng nhãn. Văn bản bạn nhập chỉ được xử lý trên thiết bị, dù mô hình công khai vẫn phải được tải về khi bạn phân tích lần đầu.

Cách dùng

  1. 1Dán một mẫu văn bản hữu ích. Nhập một bài đánh giá, bình luận, tin nhắn hoặc bài đăng mạng xã hội. Một câu hoàn chỉnh cho mô hình nhiều ngữ cảnh hơn là chỉ một từ đơn lẻ.
  2. 2Chạy mô hình cục bộ. Bấm Phân tích cảm xúc. Chờ tải xong mô hình ở lần đầu sử dụng; các lần sau có thể tận dụng lại nếu bộ nhớ đệm trình duyệt vẫn còn.
  3. 3Đọc cả ba điểm số. Xem nhãn đứng đầu như một tín hiệu tổng quát và so sánh điểm của nhãn đó với hai nhãn còn lại. Khi các điểm số khá sát nhau, cần có đánh giá của con người thay vì kết luận chắc chắn.

Dành cho ai

Trình phân tích cảm xúc này dùng mô hình XLM-T của Cardiff NLP, một hệ thống XLM-R được huấn luyện trên khoảng 198 triệu tweet đa ngữ và được fine-tune cho bài toán cảm xúc bằng tiếng Ả Rập, Anh, Pháp, Đức, Hindi, Ý, Bồ Đào Nha và Tây Ban Nha. Ba nhãn kết quả lần lượt thể hiện giọng điệu chung bất lợi, không nghiêng rõ rệt về tích cực hay tiêu cực, và giọng điệu chung thuận lợi. Các nhãn này không cho biết loại cảm xúc cụ thể, không kiểm chứng tính đúng sai, mức độ khẩn cấp hay ý định thật sự của người viết. Đối với tiếng Việt, mô hình vẫn có thể trả về nhãn nhờ nền tảng đa ngữ, nhưng độ chính xác chỉ mang tính ước lượng vì không được fine-tune trực tiếp cho tiếng Việt.

Lần phân tích đầu tiên sẽ tải về trọng số mô hình ONNX đã được lượng tử hóa cùng các tệp tokenizer, tổng dung lượng khoảng 297 MB. Mã chạy dùng Transformers.js trong một worker của trình duyệt để suy luận trực tiếp trên thiết bị, không dựa vào danh sách từ khóa đơn giản. Worker này giữ việc tính toán tách khỏi luồng giao diện. WebGPU được ưu tiên khi trình duyệt và phần cứng hỗ trợ; nếu không có, công cụ sẽ chuyển sang backend CPU dùng WebAssembly, chậm hơn nhưng vẫn xử lý cục bộ. Trình duyệt thường lưu các tệp này vào bộ nhớ đệm, nhưng chế độ duyệt riêng tư, dọn dẹp lưu trữ hoặc thiếu dung lượng có thể khiến bạn phải tải lại mô hình.

Câu hỏi thường gặp

Văn bản của tôi có bị tải lên máy chủ không?

Không. Văn bản của bạn được gửi tới một worker bên trong trình duyệt và mô hình chạy trực tiếp trên thiết bị. Worker này tải Transformers.js và các tệp mô hình công khai từ máy chủ bên ngoài, nhưng các yêu cầu đó không chứa nội dung bạn đã dán. CanDoYa không nhận, không lưu trữ mẫu văn bản của bạn.

Công cụ phân tích cảm xúc này có miễn phí không?

Có. Bạn không cần tài khoản, thanh toán, API key hay hạn mức phân tích cố định. Thiết bị của bạn tự thực hiện việc tính toán. Chi phí thực tế là lần tải mô hình đầu tiên, dung lượng lưu trữ cục bộ, bộ nhớ và thời gian xử lý. Nhà cung cấp mạng của bạn vẫn có thể tính phí dữ liệu dùng để tải mô hình.

Tôi có thể phân tích bao nhiêu văn bản?

Bạn có thể dán một đoạn văn thông thường, nhưng công cụ chỉ phân tích tối đa 1.000 ký tự Unicode đầu tiên để việc suy luận trong trình duyệt ổn định hơn. Tokenizer của mô hình cũng sẽ cắt bớt văn bản theo cửa sổ đầu vào của nó. Với tài liệu dài, hãy phân tích từng phần mạch lạc riêng thay vì xem một nhãn duy nhất như tóm tắt cho cả tài liệu.

Mô hình cảm xúc hỗ trợ những ngôn ngữ nào?

Quá trình fine-tune cho bài toán cảm xúc chỉ bao gồm tiếng Ả Rập, Anh, Pháp, Đức, Hindi, Ý, Bồ Đào Nha và Tây Ban Nha. Mô hình nền đa ngữ vẫn có thể đưa ra nhãn cho các ngôn ngữ khác, nhưng các kết quả đó không có cùng mức bằng chứng huấn luyện đặc thù cho tác vụ. Vì vậy, với tiếng Việt trên trang này, kết quả chỉ được đánh dấu là xấp xỉ và nên dùng như một gợi ý tham khảo.

Tiêu cực, trung tính và tích cực nghĩa là gì?

Tiêu cực nghĩa là mô hình nhận thấy giọng điệu chung bất lợi. Trung tính nghĩa là mô hình không phát hiện xu hướng tích cực hay tiêu cực rõ rệt. Tích cực nghĩa là mô hình nhận thấy giọng điệu chung thuận lợi. Các nhãn này mô tả toàn bộ mẫu văn bản gửi vào; chúng không phải là danh mục cảm xúc chi tiết và không chứng minh người viết thực sự tin hay có ý định như vậy.

Điểm số của mô hình nghĩa là gì?

Ba điểm số xếp hạng mức độ phù hợp của các nhãn tiêu cực, trung tính và tích cực cho văn bản này, và thông thường cộng lại xấp xỉ 100 phần trăm. Chúng hữu ích để so sánh giữa ba nhãn của mô hình, nhưng không phải là xác suất đúng được đảm bảo. Điểm số cao vẫn có thể sai, nhất là khi văn bản nằm ngoài miền dữ liệu mà mô hình đã được huấn luyện.

Tại sao lần tải đầu khoảng 297 MB?

Công cụ dùng trọng số XLM-R ở định dạng ONNX đã được lượng tử hóa, khoảng 279 MB, cùng dữ liệu tokenizer khoảng 17 MB. Kích thước này lớn hơn nhiều so với một danh sách từ khóa, nhưng đổi lại mô hình nắm bắt được ngữ cảnh ngôn ngữ thay vì chỉ đếm từ mang nghĩa tích cực hay tiêu cực. Trình duyệt thường lưu các tệp này sau lần chạy đầu tiên, nhưng việc lưu đệm không phải lúc nào cũng được đảm bảo.

Trình phân tích có hoạt động nếu không có WebGPU không?

Có. Worker sẽ ưu tiên dùng WebGPU khi trình duyệt và bộ xử lý đồ họa hỗ trợ. Nếu đường này không khả dụng hoặc không khởi động được, công cụ sẽ thử lại với backend CPU dùng WebAssembly. Phân tích trên CPU sử dụng cùng một mô hình và vẫn xử lý văn bản cục bộ, nhưng thời gian tải và suy luận có thể lâu hơn.