ตรวจการเข้าถึงของไฟล์ PDF

ไฟล์ PDF คือคำบรรยายรอยหมึกบนกระดาษ แต่โปรแกรมอ่านหน้าจอต้องการคำบรรยายของตัวเอกสาร และคำบรรยายชุดที่สองนี้เป็นของที่ใส่หรือไม่ใส่ก็ได้ นี่คือเหตุผลที่ไฟล์ PDF ส่วนใหญ่ในโลกเป็นหน้ากระดาษเปล่าสำหรับคนตาบอด เครื่องมือนี้ตรวจข้อบกพร่องที่เครื่องตัดสินได้ ว่าไฟล์มีแท็กหรือไม่ ระบุภาษาและชื่อเอกสารไว้หรือเปล่า รูปภาพมีคำบรรยายไหม หน้าเป็นภาพถ่ายของตัวอักษรแทนที่จะเป็นตัวอักษรจริงหรือไม่ และฟอนต์แปลงกลับเป็นตัวอักษรได้หรือเปล่า ทั้งหมดทำงานในแท็บนี้ คุณจึงตรวจสัญญาหรือผลตรวจสุขภาพได้โดยไฟล์ไม่ออกจากเครื่อง

วางไฟล์ PDF ลงไป ไฟล์ถูกอ่านในแท็บนี้และไม่ถูกส่งไปไหนเลย ซึ่งเป็นทางเดียวที่จะตรวจเอกสารลับได้

คำถามที่พบบ่อย

เอกสารของฉันถูกอัปโหลดไหม

ไม่ ไฟล์ถูกอ่านในแท็บนี้ด้วยโค้ดที่มาพร้อมหน้าเว็บ และไม่เคยออกจากเครื่องเลย นโยบายความปลอดภัยของเว็บกำหนด connect-src ‘none’ เบราว์เซอร์จึงบล็อกการเรียกเครือข่ายจากหน้านี้ ต่อให้โค้ดอยากส่งอะไรออกไปก็ส่งไม่ได้ นี่คือเหตุผลทั้งหมดที่เครื่องมือนี้มีอยู่ได้ เพราะเอกสารที่ควรตรวจที่สุดคือสัญญา จดหมายจากแพทย์ และแบบฟอร์มราชการ ซึ่งก็คือเอกสารที่ไม่ควรเอาไปวางบนเว็บไซต์ไหนทั้งนั้น

PDF ที่มีแท็กคืออะไร

คือคำบรรยายชุดที่สองซึ่งมองไม่เห็น วางคู่ขนานไปกับรอยหมึกบนหน้ากระดาษ มันบอกว่าข้อความช่วงนี้คือหัวข้อระดับสอง ตรงนี้คือตารางที่มีหัวคอลัมน์แบบนี้ ตรงนี้คือรูปถ่ายและรูปนี้แสดงอะไร โปรแกรมอ่านหน้าจออ่านคำบรรยายชุดนี้ ไม่ได้อ่านหน้ากระดาษ ถ้าไม่มี ก็เหลือแค่กระแสตัวอักษรเรียงตามลำดับที่โปรแกรมสร้างไฟล์บังเอิญเขียนลงไป ซึ่งบ่อยครั้งไม่ใช่ลำดับที่คนอ่าน เอกสารสองคอลัมน์มักออกมาเป็นคอลัมน์ซ้ายทั้งหมดแล้วตามด้วยคอลัมน์ขวาทั้งหมด

ผ่านทุกข้อแปลว่า PDF เข้าถึงได้แล้วใช่ไหม

ไม่ใช่ และหน้านี้บอกไว้ตรง ๆ เวลาผลออกมาสะอาด ทุกอย่างที่ตรวจเป็นเรื่องเชิงกลไก แท็กมีหรือไม่มี ภาษาระบุไว้หรือเปล่า ส่วนคำถามว่าลำดับการอ่านสมเหตุสมผลไหม คำบรรยายรูปบอกอะไรที่มีประโยชน์หรือเปล่า หัวข้อสะท้อนโครงสร้างจริงหรือไม่ ล้วนเป็นเรื่องที่ต้องใช้คนตัดสิน เอกสารหนึ่งผ่านทุกข้อที่นี่แล้วยังผิดพลาดหนักก็เป็นไปได้ ผลที่สะอาดแปลว่าข้อบกพร่องอัตโนมัติหมดแล้ว และที่เหลือต้องใช้คนดู

ทำไมถึงสนใจว่าฟอนต์มีตาราง ToUnicode หรือไม่

เพราะถ้าไม่มี ตัวอักษรก็ไม่ใช่ตัวอักษร ฟอนต์ทำหน้าที่จับคู่รหัสกับรูปร่าง ส่วนตาราง ToUnicode คือสิ่งที่บอกว่ารูปร่างนั้นคือตัวอักษรตัวไหน เอกสารที่ขาดตารางนี้ดูสมบูรณ์ พิมพ์ออกมาสวย และให้ขยะกับทุกอย่างที่พยายามอ่านมัน คัดลอกย่อหน้ามาก็ได้ตัวมั่ว ค้นหาก็ไม่เจอ และโปรแกรมอ่านหน้าจอก็อ่านออกมาเป็นเสียงมั่ว เป็นข้อบกพร่องที่สังเกตด้วยตายากที่สุด และเป็นข้อที่แก้ง่ายกว่าหลายข้อ

ตรวจอะไรกับเอกสารที่เป็นภาพสแกน

ตรวจว่าแต่ละหน้าวาดภาพโดยไม่มีตัวอักษรเลยหรือเปล่า ซึ่งนั่นคือนิยามของหน้าสแกน หน้าแบบนั้นไม่มีอะไรให้โปรแกรมอ่านหน้าจอพูดได้เลย ทางแก้คือ OCR แต่ OCR ไม่ใช่จุดจบ เพราะมันผิดกับภาษาไทยและลายมือมากกว่าตัวพิมพ์ภาษาอังกฤษมาก และข้อความที่ผิดอย่างมั่นใจก็เป็นปัญหาการเข้าถึงในตัวเอง ควรอ่านสิ่งที่ OCR ผลิตออกมาก่อนส่งต่อ

ตรวจตามมาตรฐานอะไร

ตามส่วนที่เป็นกลไกของมาตรฐาน PDF/UA และเทคนิคด้าน PDF ของ WCAG 2.1 ระดับ AA ไม่ใช่การตรวจ PDF/UA แบบเต็ม ซึ่งมีข้อตรวจหลายสิบข้อและลงท้ายด้วยการให้คนตรวจอยู่ดี สิ่งที่มีตรงนี้คือส่วนย่อยที่เครื่องตัดสินได้อย่างซื่อสัตย์ ซึ่งในทางปฏิบัติก็เป็นจุดที่เอกสารจริงเกือบทุกฉบับพังก่อนเป็นอันดับแรก

ทำไมถึงจำกัดขนาดไฟล์

เพราะไฟล์ PDF เก็บสารบัญไว้ท้ายไฟล์ จึงอ่านทีละส่วนไม่ได้ ต้องมีทั้งไฟล์อยู่ในหน่วยความจำก่อนถึงจะหาหน้าแรกเจอ นี่เป็นคุณสมบัติของรูปแบบไฟล์เอง ไม่ใช่การตัดมุมของเรา ขีดจำกัดอยู่ที่ 100 MB และบอกไว้ล่วงหน้า ดีกว่าให้ไปรู้ตอนที่แท็บดับไปแล้ว