CanDoYa
KO

AI 언어 감지기

지원 언어 제한

브라우저에서 바로 실행됩니다. 업로드도, 회원가입도 없습니다.

언어를 확인할 문장이나 문단을 붙여 넣으세요.

텍스트는 브라우저 워커에서 처리되며 업로드되지 않습니다. 공개 AI 모델만 다운로드합니다.

지원 언어 20개

아랍어, 불가리아어, 중국어, 네덜란드어, 영어, 프랑스어, 독일어, 그리스어, 힌디어, 이탈리아어, 일본어, 폴란드어, 포르투갈어, 러시아어, 스페인어, 스와힐리어, 태국어, 튀르키예어, 우르두어, 베트남어.

다른 언어의 텍스트가 가장 가까운 지원 언어로 잘못 분류될 수 있습니다.

이 도구 공유하기

언어 감지기란 무엇인가요?

언어 감지기는 붙여 넣은 텍스트가 어떤 언어일 가능성이 높은지 찾습니다. 이 도구는 샘플을 20개 언어와 비교하고 모델 점수가 높은 3개 결과를 보여 줍니다. AI는 브라우저 워커에서 로컬로 실행되므로 텍스트가 업로드되지 않습니다. 다만 처음 사용할 때는 모델을 내려받아야 합니다.

사용 방법

  1. 1충분한 샘플 붙여 넣기. 지원되는 20개 언어 중 하나로 된 완전한 문장이나 문단을 입력하세요. 이름이나 단어 하나보다 자연스럽고 긴 글을 더 쉽게 구분할 수 있습니다.
  2. 2기기에서 언어 감지 실행하기. 언어 감지를 누르세요. 첫 실행에서는 모델 다운로드가 끝날 때까지 기다려야 합니다. 캐시가 남아 있으면 다음 방문부터 브라우저가 이를 다시 사용합니다.
  3. 3순위별 결과 살펴보기. 가장 유력한 언어, ISO 코드, 점수, 다른 후보를 확인하세요. 점수 차이가 작거나 샘플이 짧거나 지원되지 않는 언어라면 결과를 확실한 판단으로 보지 마세요.

이런 분께 추천

기기에서 XLM-R 분류 모델을 실행합니다. 추론은 별도의 브라우저 워커에서 처리해 페이지가 멈추지 않도록 했습니다. WebGPU 가속을 먼저 사용하고, 필요하면 WebAssembly CPU 백엔드로 다시 시도합니다. 첫 실행 시 Hugging Face에서 모델과 토크나이저 데이터 약 296 MB를 내려받습니다. 브라우저가 보통 이 파일을 캐시에 보관하지만, 저장 공간을 정리하거나 여유 공간이 부족하면 삭제할 수 있습니다.

모델은 아랍어, 불가리아어, 중국어, 네덜란드어, 영어, 프랑스어, 독일어, 그리스어, 힌디어, 이탈리아어, 일본어, 폴란드어, 포르투갈어, 러시아어, 스페인어, 스와힐리어, 태국어, 튀르키예어, 우르두어, 베트남어를 비교합니다. 다른 언어의 텍스트도 이 중 하나로 분류되므로 결과를 믿기 전에 지원 언어 목록을 확인하세요.

자주 묻는 질문

텍스트가 서버로 업로드되나요?

아니요. 텍스트는 브라우저 안의 워커로 전달되고 기기에서 추론이 진행됩니다. 워커는 외부 호스트에서 공개 모델 파일과 Transformers.js 실행 환경을 내려받지만, 붙여 넣은 텍스트를 그 요청에 함께 보내지 않습니다. CanDoYa는 샘플을 받거나 저장하지 않습니다.

언어 감지기는 무료인가요?

네. 계정, 결제, 사용량 크레딧, API 키가 필요하지 않습니다. 추론은 기기가 처리합니다. 실제로 필요한 것은 첫 모델 다운로드, 로컬 저장 공간, 메모리, 처리 시간입니다. 종량제 인터넷에서는 모델 파일을 내려받은 데이터 요금이 부과될 수 있습니다.

텍스트를 얼마나 분석할 수 있나요?

일반적인 글이라면 길이에 관계없이 붙여 넣을 수 있지만, 모델의 입력 범위를 지키고 브라우저 추론 시간을 일정하게 유지하기 위해 처음 400자까지만 분석합니다. 글자나 숫자가 최소 4개 필요합니다. 쓸 만한 결과를 얻으려면 자연스러운 완전한 문장을 넣으세요. 문단을 쓰면 구별할 패턴이 더 많아집니다.

이 텍스트는 어떤 언어인가요? 어떤 언어를 찾을 수 있나요?

모델이 지원하는 레이블은 20개입니다. 아랍어, 불가리아어, 중국어, 네덜란드어, 영어, 프랑스어, 독일어, 그리스어, 힌디어, 이탈리아어, 일본어, 폴란드어, 포르투갈어, 러시아어, 스페인어, 스와힐리어, 태국어, 튀르키예어, 우르두어, 베트남어입니다. 이 폐쇄된 목록 밖의 언어는 안정적으로 식별하지 못합니다.

첫 다운로드가 약 296 MB인 이유는 무엇인가요?

작은 문자 빈도표가 아니라 다국어 XLM-R 신경망 모델을 사용하기 때문입니다. 양자화된 ONNX 가중치는 약 279 MB, 토크나이저는 약 17 MB입니다. 브라우저가 보통 둘 다 캐시에 저장하지만, 비공개 탐색을 사용하거나 캐시 또는 사이트 데이터를 지우면 다시 내려받아야 할 수 있습니다.

WebGPU 없이도 언어 감지가 되나요?

네. 브라우저에서 WebGPU를 제공하면 워커가 이를 우선 사용합니다. WebGPU가 없거나 모델 시작에 실패하면 WebAssembly CPU 백엔드로 다시 시도합니다. CPU 추론도 텍스트를 기기에만 두지만, 휴대전화나 오래된 컴퓨터에서는 로딩과 감지에 시간이 더 걸릴 수 있습니다.

신뢰도 점수는 무엇을 뜻하나요?

이 샘플에 대해 모델이 고를 수 있는 20개 레이블의 순위를 나타냅니다. 후보를 비교할 때는 유용하지만, 정답을 보장하거나 독립적인 정답 확률을 뜻하지 않으며 실제 언어가 지원된다는 증거도 아닙니다. 상위 점수 차이가 작다면 자연스러운 텍스트를 더 추가하세요.

여러 언어가 섞였거나 로마자로 적은 텍스트도 감지하나요?

문장이나 단어마다 레이블을 붙이지 않고 가장 유력한 언어 하나와 다른 후보를 반환합니다. 여러 언어가 섞이면 점수가 비슷하게 나올 수 있습니다. 비공식 로마자 표기, 이름, 이모지, URL, 소스 코드는 문자 체계와 철자 단서를 줄이므로 사람이 신중하게 확인해야 합니다.