PDF को TXT में कैसे बदलें
कभी-कभी साज-सज्जा ही वह चीज़ होती है जो आपको नहीं चाहिए। किसी स्क्रिप्ट, अनुवाद औज़ार, खोज-सूची या भाषा मॉडल को दस्तावेज़ देना तब कहीं बेहतर चलता है जब इनपुट साफ़ पाठ हो, न कि कॉलमों, हेडरों और फ़ुटरों से भरी पन्ने की साज-सज्जा।
PDF को TXT में बदलने से शब्दों के सिवा सब कुछ छँट जाता है। यह गाइड निष्कर्षण बताती है, अलग-अलग किस्म के दस्तावेज़ों में नतीजा कैसा दिखता है, और वह एक हालत भी जिसमें कुछ भी नहीं मिलता — स्कैन की गई फ़ाइलें।
अभी करना चाहते हैं? पीडीएफ टू टीएक्सटी खोलें और कुछ ही सेकंड में अपनी फ़ाइल पाएँ।
टूल खोलेंPDF से TXT की ज़रूरत कब पड़ती है
- दस्तावेज़ की सामग्री किसी स्क्रिप्ट, खोज-सूची या विश्लेषण प्रक्रिया में डालना।
- किसी अनुवाद औज़ार या भाषा मॉडल के लिए पाठ तैयार करना, जो साज-सज्जा के शोर के बिना बेहतर काम करते हैं।
- लंबे दस्तावेज़ से बड़े हिस्से नकल करना, बिना PDF रीडर के चयन से जूझे।
PDF को TXT में बदलने के चरण
पहले देख लें कि PDF में असली पाठ है
किसी PDF रीडर में एक वाक्य चुनकर देखें। अगर चयन अलग-अलग शब्दों को उभारता है, तो निकालने लायक पाठ-परत मौजूद है। अगर कुछ चुना ही नहीं जाता, तो फ़ाइल स्कैन है और उसे OCR चाहिए।
PDF से TXT टूल खोलें
PDF से TXT पेज पर जाएँ। निष्कर्षण ब्राउज़र में चलता है, न इंस्टॉलेशन चाहिए, न खाता।
दस्तावेज़ अपलोड करें
PDF को अपलोड क्षेत्र में खींचें या डायलॉग से चुनें। पासवर्ड से सुरक्षित फ़ाइलों को पहले खोलना होगा।
पाठ निकालें
प्रक्रिया शुरू करें और थोड़ी देर रुकें। पाठ-परत दस्तावेज़ से पढ़ी जाती है और एक सादी पाठ फ़ाइल में लिख दी जाती है।
डाउनलोड करें और सफ़ाई करें
TXT डाउनलोड करें और किसी भी एडिटर में खोलें। बार-बार आने वाले हेडर, पृष्ठ संख्याएँ और पंक्ति के अंत में शब्द-विच्छेद आम बचा-खुचा हैं, और खोजें-और-बदलें के दो चक्कर उन्हें साफ़ कर देते हैं।
आम दिक्कतें और उनका हल
नतीजा फ़ाइल खाली है
PDF में पाठ नहीं, पाठ की तस्वीरें हैं — कोई स्कैन या फ़ोटो खींचा हुआ दस्तावेज़। पिक्सेल से अक्षर सिर्फ़ OCR ही बना सकता है; फ़ॉर्मैट रूपांतरण के पास निकालने को कुछ है ही नहीं।
कॉलमों का पाठ आपस में गड्डमड्ड है
कई कॉलम वाली साज-सज्जा में पढ़ने का क्रम इस बात पर निर्भर है कि दस्तावेज़ कैसे बना था, और कॉलम पंक्ति-दर-पंक्ति बदलते हुए आ सकते हैं। कॉलमों को पाठ एडिटर में अलग करना आम तौर पर किसी भी स्वचालित उपाय से तेज़ पड़ता है।
शब्द हाइफ़न से टूटे हुए हैं
पंक्ति-विराम का शब्द-विच्छेद ज्यों का त्यों बना रहता है। हाइफ़न-के-बाद-नई-पंक्ति पर खोजें-और-बदलें चलाने से शब्द एक ही बार में जुड़ जाते हैं।
TXT चुनें या Word
TXT तब चुनें जब आपको सिर्फ़ शब्द चाहिए। स्क्रिप्ट, अनुक्रमण, अनुवाद और विश्लेषण के लिए यह सबसे साफ़ संभव इनपुट है, और जो भी इसे पढ़ेगा उसमें यह कोई भटकी हुई साज-सज्जा नहीं ले जाता।
PDF से Word तब चुनें जब आपको दस्तावेज़ दोबारा लिखकर प्रकाशित करना है। वह रूपांतरण शीर्षक, शैलियाँ, तालिकाएँ और तस्वीरें बचाने की कोशिश करता है, यानी आपको संसाधित करने की चीज़ नहीं, संपादित करने की चीज़ देता है। खुद से पूछें: अगला पाठक मशीन है या इंसान — और उसी हिसाब से चुनें।
अक्सर पूछे जाने वाले प्रश्न
निकाली गई फ़ाइल खाली क्यों है?
PDF बिना पाठ-परत वाली स्कैन की गई तस्वीर है। परत बनाने के लिए उसे OCR सॉफ़्टवेयर से गुज़ारें, फिर पाठ निकालें।
क्या कोई साज-सज्जा बची रहती है?
नहीं, और यही मक़सद है। आपको अक्षर और पंक्ति-विराम मिलते हैं — फ़ॉन्ट, शैलियाँ, कॉलम या तस्वीरें नहीं।
नतीजे की एन्कोडिंग क्या होती है?
UTF-8, ताकि हर लिपि और हर मात्रा-चिह्न सही ढंग से बचा रहे।
क्या तस्वीरें और तालिकाएँ भी निकलती हैं?
तस्वीरें नहीं। तालिकाओं की सामग्री पाठ के रूप में आती है, पर पंक्तियों और कॉलमों की संरचना नहीं बचती।
क्या सुरक्षित PDF से पाठ निकाला जा सकता है?
पहले PDF अनलॉक करें टूल से सुरक्षा हटाएँ, फिर निष्कर्षण चलाएँ।
क्या दस्तावेज़ के आकार की सीमा है?
प्रति फ़ाइल 100 MB तक, बिना किसी दैनिक सीमा, बिना रजिस्ट्रेशन और बिना वॉटरमार्क।
अभी करना चाहते हैं? पीडीएफ टू टीएक्सटी खोलें और कुछ ही सेकंड में अपनी फ़ाइल पाएँ।
टूल खोलें