CanDoYa
BN

PDF থেকে টেক্সট বের করুন

পুরোটাই আপনার ব্রাউজারে চলে - কিছু আপলোড নেই, সাইন-আপ নেই।

Selectable text বের করতে একটি digital PDF বাছুন।

এই টুল শেয়ার করুন

PDF থেকে টেক্সট কীভাবে বের করব?

এই PDF থেকে টেক্সট টুল ব্যবহার করে digital PDF-এর ভেতরে আগে থেকেই থাকা selectable text layer বের করুন, তারপর copy করুন বা TXT file download করুন। সব processing আপনার browser-এর ভেতরেই হয়, তাই document upload হয় না। scanned image-only PDF হলে OCR লাগে, আর এই tool OCR করে না।

যেভাবে ব্যবহার করবেন

  1. 1একটি digital PDF বাছুন. Tool-এ one PDF drop করুন বা device থেকে select করুন। ভালো ফলের জন্য নিশ্চিত করুন যে usual PDF viewer-এ words select করা যাচ্ছে।
  2. 2Text layer বের করুন. Extract text-এ click করুন। PDF.js file locally পড়ে, আর server-এ file না পাঠিয়েই progress দেখায়।
  3. 3Plain text যাচাই করুন. Original-এর সাথে paragraph, column, table আর symbol মিলিয়ে দেখুন। PDF-এর reading order visual page order থেকে আলাদা হতে পারে।
  4. 4Copy বা download করুন. প্রয়োজনে result edit করুন, clipboard-এ copy করুন, বা UTF-8 TXT file হিসেবে save করুন।

কাদের জন্য

এই converter আপনার device-এ Mozilla PDF.js ব্যবহার করে প্রতিটি page-এর existing text layer পড়ে। এতে page order আর reported line ending ধরে রাখা হয়, তারপর একটিই editable plain-text result দেয়। Images, fonts, columns, tables আর visual formatting TXT output-এ থাকে না।

এখানে একটা গুরুত্বপূর্ণ সীমা আছে: digital PDF-এ software যে character select আর search করতে পারে, সেটা stored থাকে। Scan হলে page-এর শুধু একটি photograph থাকতে পারে। প্রথম ধরনের file থেকে text বের করা হলো text parsing, আর দ্বিতীয় ধরনের file পড়তে optical character recognition লাগে। এই tool প্রথম কাজটাই করে।

সাধারণ প্রশ্ন

আমার PDF file কি server-এ upload হয়?

না। আপনার browser PDF.js দিয়ে selected PDF locally পড়ে, আর file CanDoYa-তে পাঠানো হয় না। আপনি প্রথমবার tool ব্যবহার করলে PDF engine code download হতে পারে, কিন্তু সেই request-এ আপনার document থাকে না।

এই PDF থেকে টেক্সট converter কি free?

হ্যাঁ। account, watermark বা payment ছাড়াই text extract, edit, copy আর download করতে পারবেন। কাজটা device-এ হয়, তাই server conversion queue বা পরে file retrieve করার ঝামেলা নেই।

PDF size আর page limit কত?

Tool-টি one PDF, সর্বোচ্চ 100 MB এবং 2,000 pages গ্রহণ করে। Available memory আর device speed বাস্তবে এর চেয়ে কম limit দিতে পারে, বিশেষ করে phone-এ। খুব বড় document হলে browser শেষ করতে না পারলে smaller PDF-এ split করুন।

Scanned PDF থেকে text বের করা যাবে?

যদি scan-এ শুধু page image থাকে, তাহলে না। এই converter existing selectable text পড়ে, OCR করে না। Scanned PDF-এর জন্য এমন OCR tool লাগবে যা pixel থেকে character চিনতে পারে। কিছু mixed PDF-এ certain page-এ selectable text থাকতে পারে, অন্য page-এ নাও থাকতে পারে; result-এ no-text page flag করা হয়।

Extracted text কেন ভুল order-এ আসে?

PDF page-এ text fragment coordinate দিয়ে বসানো থাকে, আর clear paragraph বা column order সংরক্ষিত নাও থাকতে পারে। PDF.js document-এর text item আর line ending অনুসরণ করে, যা multi-column layout, table, header বা complex form-এ visual reading order থেকে আলাদা হতে পারে।

PDF থেকে টেক্সট কি formatting আর image preserve করে?

না। TXT file-এ শুধু plain character থাকে, তাই font, color, image, link, column আর table border preserve হয় না। Line break আসে PDF text layer থেকে, আর extraction-এর পরে editing লাগতে পারে।

Password-protected PDF কেন reject হচ্ছে?

Browser password ছাড়া encrypted document পড়তে পারে না। Trusted viewer-এ PDF খুলে password দিন, আর permission থাকলে unlocked copy save করুন। তারপর সেই copy converter-এ দিন।

কোন ভাষার PDF থেকে text বের করা যায়?

Parser এক ভাষার জন্য বাঁধা নয়। PDF-এ সঠিক character map আর selectable text থাকলে যেকোনো script-এর Unicode text ফিরিয়ে দিতে পারে। Document-এ missing বা custom font mapping থাকলে copied character incomplete বা ভুলও হতে পারে।