ประเภทไฟล์ที่รองรับสําหรับการแยกข้อความ

Cloud Search จะจัดทำดัชนีรายการทั้งหมดที่ส่ง ไม่ว่าจะเป็นไฟล์ประเภทใด (MIME หรือ Content-Type) โดยจะจัดทำดัชนีข้อมูลเมตาของไฟล์ และเนื้อหาของไฟล์ (หากรองรับ) ต่อไปนี้คือรายการประเภทไฟล์ที่รองรับการจัดทำดัชนีเนื้อหา

  • Microsoft Word (DOC)
  • Microsoft Word (DOCX)
  • Microsoft Excel (XLS)
  • Microsoft Excel (XLSX)
  • Microsoft Powerpoint (PPT)
  • Microsoft Powerpoint (PPTX)
  • Adobe’s Portable Document Format (PDF)
  • Rich Text Format (RTF)
  • Text Format (TXT)
  • Hypertext Markup Language (HTML)
  • Extensible Markup Language (XML)

นอกจากไฟล์ประเภทเหล่านี้แล้ว Cloud Search ยังรองรับการจัดทำดัชนีเนื้อหาภายในไฟล์ข้อความธรรมดาทุกประเภทด้วย

ประเภทไฟล์และการรู้จำอักขระด้วยภาพ (OCR)

Google Cloud Search ยังใช้ OCR เพื่อดึงข้อความจากไฟล์ประเภทต่อไปนี้ด้วย

ประเภทไฟล์ ขนาดสูงสุด
Joint Photographic Experts Group (JPG) 10 MB
Graphic Interchange Format (GIF) 10 MB
Tagged Image File Format (TIFF) 10 MB
Scalable Vector Graphics (SVG) 10 MB
PostScript Image Format (PS) 10 MB
Portable Document Format (PDF) 30 MB

นอกจากนี้ OCR ยังใช้ได้กับไฟล์ที่มีลักษณะดังนี้ด้วย

  • เอกสารที่เขียนด้วยลายมือ เอกสารที่เขียนด้วยสคริปต์ละติน ภาษาญี่ปุ่น และภาษาเกาหลีจะให้ผลลัพธ์ที่ดีที่สุด
  • เอกสารที่เขียนในแนวตั้ง เช่น เอกสารภาษาญี่ปุ่น
  • เอกสารที่เขียนจากขวาไปซ้าย เช่น ภาษาฮีบรู