PDF টেক্সট এক্সট্র্যাক্টর
পুরো নথির জন্য ফাঁকা রাখুন, নির্দিষ্ট পৃষ্ঠার জন্য 1-5, 8 লিখুন।
ফাইলটি এই পাতার ভেতরেই খোলা ও পড়া হয়। এটি কখনও আপলোড হয় না, তাই পরে সার্ভারে কিছু জমাও থাকে না, মুছতেও হয় না।
এই এক্সট্র্যাক্টর কী করে
PDF-এর একটি পৃষ্ঠা আসলে আঁকার নির্দেশের তালিকা, আর তাতে দেখা শব্দগুলো সাধারণত ছবি নয়, সত্যিকারের টেক্সট অবজেক্ট। এই পাতা সেই অবজেক্টগুলো সরাসরি পড়ে, তাই আপনি এমন অক্ষর পান যা খোঁজা, উদ্ধৃত করা ও সম্পাদনা করা যায় — আর ফাইলটি আপনার কম্পিউটার ছেড়ে যায় না।
কীভাবে ব্যবহার করবেন
- 1 বাক্সে PDF ছেড়ে দিন, বা ক্লিক করে ফাইল বেছে নিন।
- 2 কেবল অংশবিশেষ দরকার হলে পৃষ্ঠার পরিসর দিন, আর লাইন ব্রেক রাখবেন কি না বেছে নিন।
- 3 “লেখা বের করুন” চাপুন, তারপর ফলাফল কপি করুন বা .txt ফাইল হিসেবে নামান।
এক্সট্র্যাকশন আর OCR এক নয়
PDF যদি ওয়ার্ড প্রসেসর বা বিলিং ব্যবস্থা থেকে আসে, অক্ষরগুলো ইতিমধ্যেই ভেতরে থাকে আর পড়া হয় হুবহু। স্ক্যানার বা ফোনের ক্যামেরা থেকে এলে পৃষ্ঠাটি নিছক একটি ছবি, পড়ার মতো কিছু নেই; সেই অক্ষর চেনা মানে অপটিক্যাল ক্যারেক্টার রিকগনিশন, যা আলাদা এবং অনেক কম নির্ভরযোগ্য কাজ। এই টুল ফাঁকা বাক্স ফেরত না দিয়ে বলে দেয় আপনি কোন পরিস্থিতিতে আছেন।
লাইন ব্রেক কোথা থেকে আসে
PDF লাইন বা অনুচ্ছেদ রাখে না, কেবল স্থানাঙ্কে বসানো লেখা রাখে। পাঠক একই উচ্চতায় থাকা টুকরোগুলো এক লাইনে জড়ো করে, উচ্চতা বদলালে নতুন লাইন শুরু করে। সাধারণ নথিতে এটি ভালোই চলে, কিন্তু বহু-কলাম বিন্যাসে অসম্পূর্ণ থাকে, সেখানে পৃষ্ঠার দুই কলাম মিশে যেতে পারে।
পৃষ্ঠা বেছে নেওয়া
পরিসরের ঘরটি কমা দিয়ে আলাদা করা একক পৃষ্ঠা ও পরিসর নেয়। পুনরাবৃত্তি বাদ যায় এবং পৃষ্ঠাগুলো ক্রম অনুসারে পড়া হয়, তাই এলোমেলোভাবে লিখলেও ক্ষতি নেই। পরিসরের বাইরের সংখ্যা নীরবে উপেক্ষা না করে বাতিল করা হয়, কারণ নীরবে বাদ পড়া পৃষ্ঠা মানে এমন হারানো লেখা যা আপনি কখনও টের পাবেন না।
1-5 → 1, 2, 3, 4, 5 2, 7, 9 → 2, 7, 9 1-3, 10 → 1, 2, 3, 10 (bos) → সব পৃষ্ঠা
ফরম্যাটিং নিয়ে একটি কথা
আউটপুট সাধারণ লেখা, তাই বোল্ড, শিরোনাম, টেবিল ও ছবি টেকে না; টেবিল হয়ে যায় শব্দের সারি, ঘরের সীমানা উধাও। বিন্যাস ধরে রাখতে চাইলে নথি ফরম্যাটে রূপান্তরই সঠিক উপায়, আর পৃষ্ঠাগুলো কেবল ছবি হিসেবে চাইলে PDF থেকে JPG ও PDF থেকে PNG পাতা দুটি সেটি করে।