टेक्स्ट निकालने के लिए काम करने वाले फ़ाइल टाइप

Cloud Search, भेजी गई सभी आइटम को इंडेक्स करता है. भले ही, उनका फ़ाइल टाइप (MIME या कॉन्टेंट-टाइप) कुछ भी हो. इंडेक्सिंग, किसी फ़ाइल के मेटाडेटा पर की जाती है. साथ ही, अगर फ़ाइल टाइप के लिए इंडेक्सिंग की सुविधा उपलब्ध है, तो उसके कॉन्टेंट पर भी इंडेक्सिंग की जाती है. यहां उन फ़ाइल टाइप की सूची दी गई है जिनके कॉन्टेंट को इंडेक्स किया जा सकता है.

  • Microsoft Word (DOC)
  • Microsoft Word (DOCX)
  • Microsoft Excel (XLS)
  • Microsoft Excel (XLSX)
  • Microsoft Powerpoint (PPT)
  • Microsoft Powerpoint (PPTX)
  • Adobe’s Portable Document Format (PDF)
  • रिच टेक्स्ट फ़ॉर्मैट (RTF)
  • टेक्स्ट फ़ॉर्मैट (TXT)
  • हाइपरटेक्स्ट मार्कअप लैंग्वेज (HTML)
  • एक्सटेंसिबल मार्कअप लैंग्वेज (XML)

इन फ़ाइल टाइप के अलावा, Cloud Search, सामान्य टेक्स्ट वाली किसी भी फ़ाइल के कॉन्टेंट को इंडेक्स कर सकता है.

ऑप्टिकल कैरेक्टर रिकग्निशन (ओसीआर) वाले फ़ाइल टाइप और उनकी खासियतें

Google Cloud Search, ओसीआर का इस्तेमाल करके इन फ़ाइल टाइप से टेक्स्ट भी निकालता है:

फ़ाइल टाइप सबसे बड़ा साइज़
जॉइंट फ़ोटोग्राफ़िक एक्सपर्ट्स ग्रुप (JPG) 10 एमबी
ग्राफ़िक इंटरचेंज फ़ॉर्मैट (GIF) 10 एमबी
टैग की गई इमेज फ़ाइल फ़ॉर्मैट (TIFF) 10 एमबी
स्केलेबल वेक्टर ग्राफ़िक्स (SVG) 10 एमबी
PostScript इमेज फ़ॉर्मैट (PS) 10 एमबी
पोर्टेबल डॉक्यूमेंट फ़ॉर्मैट (PDF) 30 एमबी

ओसीआर, इन खासियतों वाली फ़ाइलों पर भी काम करता है:

  • हाथ से लिखे गए दस्तावेज़. लैटिन स्क्रिप्ट, जैपनीज़, और कोरियन में लिखे गए दस्तावेज़ों के लिए, ओसीआर के सबसे सही नतीजे मिलते हैं.
  • वर्टिकल तरीके से लिखे गए दस्तावेज़, जैसे कि जैपनीज़ में लिखे गए दस्तावेज़.
  • दाएं से बाएं ओर लिखे गए दस्तावेज़, जैसे कि हिब्रू में लिखे गए दस्तावेज़.