คัดลอกข้อความจาก PDF ภาษาไทยไม่เพี้ยน

ไฟล์ PDF ไม่ได้เก็บคำไว้ แต่เก็บคำสั่งว่าให้วาดรูปอะไรตรงไหน การได้ข้อความกลับมาจึงต้องแกะย้อนจากคำสั่งเหล่านั้น และภาษาไทยคือจุดที่เครื่องมือส่วนใหญ่พลาด วรรณยุกต์ไปอยู่ผิดตัว สระอำกลายเป็นช่องว่างกับสระอา และมีช่องว่างโผล่กลางคำ เครื่องมือนี้อ่านฟอนต์ที่ฝังอยู่ในไฟล์เพื่อดูว่ารูปแต่ละรูปคือตัวอักษรอะไรจริงๆ จัดวรรณยุกต์กลับไปไว้ตามลำดับที่พิมพ์ และเว้นวรรคตามที่หน้ากระดาษเว้นจริง เลือกหน้าที่ต้องการ แล้วคัดลอกหรือบันทึกเป็นไฟล์ได้เลย เอกสารไม่ออกจากเครื่องคุณ

1 · เอกสาร

2 · เลือกหน้า

เว้นว่างไว้เพื่อเอาทุกหน้า หรือพิมพ์ 1-3, 7, 12- แบบเดียวกับตอนสั่งพิมพ์

3 · ข้อความ

เพิ่มไฟล์ PDF เพื่อเริ่ม

คำถามที่พบบ่อย

ก๊อปข้อความจาก PDF แล้วเป็นภาษาต่างดาว เพราะอะไร

มีสองสาเหตุ แบบแรก ไฟล์ใช้ฟอนต์ไทยรุ่นเก่าที่เก็บตัวอักษรตามรหัส TIS-620 แต่ไม่ได้บอกโปรแกรมอ่าน ข้อความที่ก๊อปจึงออกมาเป็น "ÊÇÑÊ´Õ" แทน "สวัสดี" แบบที่สอง ไฟล์บอกว่าแต่ละรูปคือตัวอะไรแต่บอกผิด ซึ่งเจอบ่อยในไฟล์จาก Word และ Excel วิธีที่แชร์กันอย่างการสลับ encoding ใน Notepad++ แก้ได้แค่แบบแรก และต้องทำเองทุกครั้ง เครื่องมือนี้อ่านจากฟอนต์ที่ฝังอยู่ในไฟล์โดยตรง จึงแก้ได้ทั้งสองแบบโดยไม่ต้องก๊อปก่อน

ทำไมข้อความไทยที่คัดลอกจากเครื่องมืออื่นถึงเพี้ยน

เพราะใน PDF เก็บเป็นรูป และภาษาไทยใช้รูปต่างกันสำหรับตัวอักษรตัวเดียวกัน แล้วแต่ว่าอยู่ติดกับอะไร วรรณยุกต์บนพยัญชนะหางสูงจะใช้รูปที่เลื่อนไปทางซ้าย สระอำมักถูกวาดเป็นวงกลมเล็กกับสระอาแยกกัน โปรแกรม Word บันทึกรูปเหล่านี้ลงไฟล์โดยผูกกับตัวอักษรผิดตัว เครื่องมือที่เชื่อไฟล์ตรงๆ จึงได้ "กาหนด" แทน "กำหนด" และ "มหำชน" แทน "มหาชน" เครื่องมือนี้ตรวจตัวอักษรเทียบกับฟอนต์ที่ฝังอยู่ในไฟล์ ซึ่งบอกว่ารูปแต่ละรูปออกแบบมาเป็นตัวอะไร และเทียบจากรูปร่างของตัวอักษรเองเมื่อไม่มีข้อมูลอื่นเหลือ

ทำไมข้อความไทยถึงไม่มีช่องว่างแทรกกลางคำ

ภาษาไทยไม่เว้นวรรคระหว่างคำ เครื่องมือที่ใส่ช่องว่างทุกครั้งที่เห็นระยะห่างเล็กๆ จึงใส่กลางคำไปด้วย เราวัดระยะห่างจากเอกสารไทยจริงหลายร้อยไฟล์ ตัวอักษรในคำเดียวกันห่างกันไม่ถึงหนึ่งในสิบสองของขนาดตัวอักษร ส่วนการเว้นวรรคจริงกว้างกว่านั้นเสมอ เส้นแบ่งจึงอยู่ตรงกลางระหว่างสองอย่างนี้ ช่องว่างจะมีเฉพาะที่หน้ากระดาษเว้นไว้จริงเท่านั้น

อ่านเอกสารที่สแกนมาได้ไหม

ไม่ได้ และเครื่องมือจะบอกตรงๆ หน้าที่สแกนมาคือรูปถ่ายของข้อความ ในไฟล์มีแต่จุดสี ไม่มีตัวอักษรเลย การอ่านต้องใช้ OCR ซึ่งเป็นเครื่องมืออีกประเภท หน้าแบบนี้จะถูกบอกเป็นเลขหน้า ไม่ใช่ส่งกลับมาเป็นหน้าว่างเงียบๆ คุณจึงรู้ว่าหน้าไหนต้องจัดการต่อ

Tab มีไว้ทำอะไร

มีไว้สำหรับตาราง เมื่อข้อความสองส่วนในบรรทัดเดียวกันอยู่ห่างกันมากแบบช่องในตาราง จะคั่นด้วย Tab แทนช่องว่าง พอวางลง Excel หรือ Google Sheets ก็จะลงคนละคอลัมน์ ถ้าต้องการแค่เนื้อความ ให้เอาเครื่องหมายออก แล้วคอลัมน์จะถูกเชื่อมด้วยช่องว่างช่องเดียว

มีตัวอักษรบางตัวอ่านไม่ได้ หมายความว่าอะไร

PDF บางไฟล์มีฟอนต์ที่ไม่บอกเลยว่ารูปแต่ละรูปคือตัวอักษรอะไร ไม่มีตาราง ไม่มีชื่อ และไม่มีรูปอื่นให้เทียบ ตัวอักษรเหล่านั้นจะถูกเว้นไว้พร้อมบอกจำนวนและเลขหน้า แทนที่จะเดาใส่ให้ สาเหตุที่พบบ่อยคือไฟล์ผ่านโปรแกรมแปลงหรือรวมไฟล์ที่ทำฟอนต์เสีย การส่งออกใหม่จากเอกสารต้นฉบับจะแก้ได้

วางลง Word หรือ Excel ได้ไหม

ได้ กดคัดลอกแล้ววางได้เลย ข้อความจะออกมาเป็นภาษาไทยปกติที่แก้ไขต่อได้ ถ้าในไฟล์มีตาราง ให้เปิดตัวเลือกแยกคอลัมน์ด้วย Tab ไว้ พอวางลง Excel หรือ Google Sheets แต่ละช่องจะลงคนละคอลัมน์ ถ้าบันทึกเป็น .txt ไฟล์จะเปิดใน Notepad หรือนำเข้า Excel ได้โดยภาษาไทยไม่กลายเป็นเครื่องหมายคำถาม

แปลง PDF เป็น Word ได้ไหม

ไม่ได้ออกมาเป็นไฟล์ Word เครื่องมือนี้ให้ข้อความ ไม่ได้ให้หน้ากระดาษ รูปภาพ ตัวหนา ขนาดตัวอักษร และตำแหน่งบนหน้าจะไม่ตามมาด้วย แต่ถ้าสิ่งที่ต้องการคือเอาเนื้อหาไปพิมพ์ต่อใน Word ซึ่งเป็นเหตุผลที่คนส่วนใหญ่อยากแปลง ให้คัดลอกข้อความตรงนี้แล้ววางลง Word ได้เลย โปรแกรมแปลงเป็น Word ก็ต้องอ่านข้อความจากไฟล์ด้วยวิธีเดียวกัน ถ้าได้ไฟล์ Word ที่ภาษาไทยเพี้ยน ปัญหามาจากขั้นตอนนี้

ต่างจากเว็บที่ให้ก๊อปมาวางแล้วจัดเรียงใหม่อย่างไร

เว็บแบบนั้นแก้ข้อความหลังจากที่ถูกก๊อปมาแล้ว ซึ่งตอนนั้นข้อมูลที่บอกว่ารูปไหนคือตัวอะไรหายไปแล้ว บางตัวจึงเดาได้ไม่ถูก และมักจำกัดจำนวนตัวอักษรต่อครั้ง เครื่องมือนี้อ่านจากไฟล์ PDF โดยตรง ใช้ข้อมูลในฟอนต์ได้ครบ ไม่จำกัดจำนวน และไฟล์ไม่ออกจากเครื่องคุณ

เอกสารของฉันถูกอัปโหลดไหม

ไม่ เบราว์เซอร์ของคุณอ่านไฟล์ PDF ในแท็บนี้เอง นโยบายความปลอดภัยของเว็บกำหนด connect-src ‘none’ เบราว์เซอร์จึงบล็อกการเรียกเครือข่ายจากหน้านี้ จึงส่งอะไรออกไปไม่ได้แม้โค้ดจะพยายาม เอกสารที่คนดึงข้อความออกมาคือสัญญา รายการเดินบัญชี และรายงาน นี่จึงเป็นเหตุผลที่มันต้องทำงานแบบนี้