ดึงรูปออกจากไฟล์ PDF

รูปที่อยู่ในไฟล์ PDF ถูกเก็บไว้ทั้งใบพร้อมการบีบอัดเดิมของมัน แปลว่ามันถูกดึงออกมาได้ ไม่ต้องถ่ายหน้าจอเอา เครื่องมือนี้ค้นรูปทุกใบในเอกสาร รวมถึงรูปที่ซ่อนอยู่ในชิ้นส่วนที่ถูกนำเข้ามาซึ่งเครื่องมือส่วนใหญ่มองไม่เห็น แสดงให้ดูทีละใบพร้อมบอกว่ามาจากหน้าไหน แล้วส่งให้เป็นไฟล์ รูป JPEG ออกมาเป็น JPEG ตัวเดิมทุกไบต์ จึงไม่เสียคุณภาพจากการบีบอัดรอบสอง และเอกสารอยู่ในเครื่องคุณตลอด

1 · เอกสาร

2 · ข้างในมีอะไรบ้าง

รูปแต่ละใบพร้อมหน้าที่มันอยู่ ใบไหนไม่เอาก็เอาเครื่องหมายออก

    3 · ดึงออกมา

    เพิ่มไฟล์ PDF เพื่อเริ่ม

    คำถามที่พบบ่อย

    ดึงออกมาแล้วรูปคุณภาพลดลงไหม

    ไม่ลด และนี่คือเหตุผลที่ทำวิธีนี้ รูปถ่ายในไฟล์ PDF ถูกเก็บเป็น JPEG อยู่แล้ว ระบบจึงคัดลอกไบต์ออกมาแล้วบันทึกเป็นชื่อใหม่ ไม่มีการถอดรหัสและเข้ารหัสใหม่ จึงไม่มีร่องรอยการบีบอัดรอบสอง ส่วนเครื่องมือที่เรนเดอร์หน้าออกมาแล้วครอบตัดรูป สิ่งที่คุณได้คือสำเนาของสำเนา ที่ความละเอียดเท่าที่การเรนเดอร์นั้นบังเอิญเป็น

    เอกสารของฉันถูกอัปโหลดไหม

    ไม่ เบราว์เซอร์ของคุณเป็นตัวเปิดไฟล์ ค้นรูป และเขียนไฟล์ออกมา ทั้งหมดอยู่ในแท็บ นโยบายความปลอดภัยของเว็บกำหนด connect-src ‘none’ เบราว์เซอร์จึงบล็อกการเรียกเครือข่ายจากหน้านี้ ต่อให้โค้ดอยากส่งออกไปก็ส่งไม่ได้ เรื่องนี้สำคัญไม่แพ้หน้าไหนในเว็บ เพราะเอกสารที่คนเอามาดึงรูปมักเป็นสัญญาที่มีลายเซ็นและสำเนาบัตรประชาชน

    ทำไมบางรูปขึ้นว่าอ่านไม่ได้

    เพราะมันถูกเก็บด้วยรูปแบบที่ต้องมีตัวถอดรหัสเฉพาะ และเราเลือกบอกตรง ๆ ดีกว่าแกล้งทำเป็นไม่มี ไฟล์ที่ได้จากการสแกนมักเป็น JBIG2 หรือ CCITT fax ซึ่งออกแบบมาสำหรับกระดาษขาวดำ ส่วนงานจดหมายเหตุบางที่ใช้ JPEG 2000 การเขียนตัวถอดรหัสพวกนี้คือโปรเจกต์หนึ่งโปรเจกต์เลย คำตอบที่ซื่อสัตย์คือรายการที่บอกว่าเจออะไรและอันไหนเปิดไม่ได้ ไม่ใช่รายการที่สั้นกว่าเพราะแอบตัดตัวยาก ๆ ทิ้ง

    ทำไมรูปใบเดียวขึ้นว่าอยู่หลายหน้า

    เพราะมันคือรูปใบเดียวจริง ๆ โลโก้หัวจดหมายถูกเก็บครั้งเดียวแล้วถูกวาดซ้ำทุกหน้า ถ้าแสดงสี่สิบครั้งก็คือไฟล์เดียวกันสี่สิบก๊อบปี้ ระบบจึงแสดงครั้งเดียวพร้อมบอกว่าถูกใช้ในหน้าไหนบ้าง

    พื้นใสของรูปยังอยู่ไหม

    อยู่ครับ โลโก้ที่ไดคัทมาแล้วเก็บความใสไว้ในรูปขาวดำอีกใบที่บอกว่าแต่ละจุดทึบแค่ไหน ระบบเอาค่านั้นมาใส่ก่อนเขียนไฟล์ PNG การมองข้ามจุดนี้คือสิ่งที่ทำให้สี่เหลี่ยมดำกลับมาอยู่หลังโลโก้ ซึ่งเป็นความผิดพลาดที่เห็นชัดที่สุดของเครื่องมือประเภทนี้

    ดึงข้อความออกมาด้วยได้ไหม

    ที่นี่ยังไม่ได้ ข้อความใน PDF ไม่ได้ถูกเก็บเป็นคำ แต่เป็นคำสั่งให้วาดตัวอักษรลงตำแหน่งต่าง ๆ ด้วยการเข้ารหัสที่ไฟล์นิยามขึ้นเอง การประกอบกลับเป็นภาษาไทยที่อ่านออกยากกว่าที่ฟังดูมาก ถ้าทำแบบลวก ๆ จะได้ข้อความที่ดูเหมือนใช้ได้แต่ผิดในจุดที่มองไม่เห็น ซึ่งแย่กว่าการไม่มีให้ใช้