Ten przewodnik jest przeznaczony dla administratorów odpowiedzialnych za pobieranie, wdrażanie i utrzymywanie wtyczki indeksującej Norconex HTTP Collector Google Cloud Search. Powinni oni znać system Linux, podstawy indeksowania stron internetowych, język XML i Norconex HTTP Collector.
Ten przewodnik zawiera instrukcje dotyczące:
- pobierania oprogramowania wtyczki indeksującej,
- konfigurowania Cloud Search,
- konfigurowania Norconex HTTP Collector i indeksowania stron internetowych,
- rozpoczynania indeksowania stron internetowych i przesyłania treści.
Ten przewodnik nie zawiera informacji o zadaniach, które musi wykonać administrator Google Workspace. Więcej informacji o tych zadaniach znajdziesz w artykule Zarządzanie źródłami danych innych firm.
Omówienie wtyczki indeksującej Norconex HTTP Collector
Domyślnie Cloud Search może wykrywać, indeksować i udostępniać treści z usług Google Workspace, takich jak Dokumenty Google i Gmail. Możesz rozszerzyć tę funkcję, aby obejmowała treści internetowe, wdrażając wtyczkę indeksującą Norconex HTTP Collector, czyli narzędzie do indeksowania stron internetowych typu open source.
Pliki właściwości konfiguracji
Aby włączyć indeksowanie i przesyłanie treści przez wtyczkę, musisz podać określone informacje w 2 plikach konfiguracji:
{gcs-crawl-config.xml}: ustawienia Norconex HTTP Collector.sdk-configuration.properties: ustawienia Cloud Search.
Indeksowanie stron internetowych i przesyłanie treści
Po wypełnieniu plików konfiguracji możesz rozpocząć indeksowanie stron internetowych. Norconex HTTP Collector indeksuje strony internetowe i przesyła oryginalne treści dokumentów binarnych lub tekstowych do interfejsu Cloud Search Indexing API.
Wymagania systemowe
- System operacyjny: tylko Linux.
- Wersja Norconex: 2.8.0.
- Oprogramowanie: Java JRE 1.8.
Obsługa list kontroli dostępu
Wtyczka indeksująca obsługuje listy kontroli dostępu, które umożliwiają kontrolowanie dostępu do dokumentów w domenie Google Workspace.
Jeśli włączysz domyślne listy kontroli dostępu w konfiguracji wtyczki (defaultAcl.mode ustawiony na wartość inną niż none), wtyczka zastosuje te ustawienia domyślne. W przeciwnym razie wtyczka przyzna uprawnienia do odczytu całej domenie. Zobacz
Parametry łącznika dostarczone przez Google.
Wymagania wstępne
Zanim wdrożysz wtyczkę indeksującą, przygotuj te komponenty:
- Klucz prywatny Google Workspace (zawierający identyfikator konta usługi). Zobacz Konfigurowanie dostępu do Cloud Search API.
- Identyfikator źródła danych Google Workspace. Zobacz Zarządzanie źródłami danych innych firm.
Kroki wdrożenia
- Zainstaluj Norconex HTTP Collector i oprogramowanie wtyczki
- Skonfiguruj Cloud Search
- Skonfiguruj Norconex HTTP Collector
- Skonfiguruj indeksowanie stron internetowych
- Rozpocznij indeksowanie stron internetowych i przesyłanie treści
Krok 1. Zainstaluj Norconex HTTP Collector i oprogramowanie wtyczki
- Pobierz oprogramowanie Norconex committer ze strony pobierania Norconex download page.
- Wyodrębnij oprogramowanie do katalogu
~/norconex/. Sklonuj wtyczkę committer:
git clone https://github.com/google-cloudsearch/norconex-committer-plugin.git cd norconex-committer-pluginSprawdź wybraną wersję i utwórz wtyczkę:
git checkout tags/v1-0.0.3 mvn packageAby pominąć testy, użyj polecenia
mvn package -DskipTests.Skopiuj plik JAR do katalogu
libNorconex:cp target/google-cloudsearch-norconex-committer-plugin-v1-0.0.3.jar ~/norconex/norconex-collector-http-VERSION/libWyodrębnij utworzony plik ZIP:
unzip target/google-cloudsearch-norconex-committer-plugin-v1-0.0.3.zip cd google-cloudsearch-norconex-committer-plugin-v1-0.0.3Uruchom skrypt instalacyjny i podaj pełną ścieżkę do katalogu
libNorconex:sh install.shJeśli pojawi się prośba o podanie duplikatów plików, wybierz opcję
1.
Krok 2. Skonfiguruj Cloud Search
Utwórz plik sdk-configuration.properties w katalogu Norconex. Plik musi zawierać te parametry:
| Ustawienie | Parametr |
| Identyfikator źródła danych | api.sourceId = 1234567890abcdef
Wymagane. Identyfikator źródła od administratora Google Workspace. |
| Konto usługi | api.serviceAccountPrivateKeyFile = ./PrivateKey.json
Wymagane. Plik klucza konta usługi. |
Przykład pliku sdk-configuration.properties:
# data source access
api.sourceId=1234567890abcdef
api.serviceAccountPrivateKeyFile=./PrivateKey.json
Możesz też uwzględnić parametry takie jak batch.*, aby kontrolować sposób przesyłania danych przez wtyczkę. Zobacz
Parametry łącznika dostarczone przez Google.
Aby wypełnić metadane, skonfiguruj te opcjonalne parametry:
| Ustawienie | Parametr |
| Tytuł | itemMetadata.title.field=movieTitle |
| Typ obiektu schematu | itemMetadata.objectType=movie |
Krok 3. Skonfiguruj Norconex HTTP Collector
Wtyczka zawiera przykładowy plik minimum-config.xml.
Przejdź do katalogu Norconex i skopiuj przykład:
cd ~/norconex/norconex-collector-http-VERSION/ cp examples/minimum/minimum-config.xml gcs-crawl-config.xmlEdytuj
gcs-crawl-config.xml, aby dodać lub zastąpić<committer>i<tagger>węzły:
| Ustawienie | Parametr |
<committer> węzeł |
<committer class="com.norconex.committer.googlecloudsearch.GoogleCloudSearchCommitter">
Wymagane. Dodaj ten węzeł pod węzłem <httpcollector>. |
<uploadFormat> |
<uploadFormat>raw</uploadFormat>
Opcjonalnie. raw lub text. Wartość domyślna to
raw. |
Przykład pliku gcs-crawl-config.xml:
<committer class="com.norconex.committer.googlecloudsearch.GoogleCloudSearchCommitter">
<configFilePath>/full/path/to/gcs-sdk-config.properties</configFilePath>
<uploadFormat>raw</uploadFormat>
</committer>
<importer>
<preParseHandlers>
<tagger class="com.norconex.committer.googlecloudsearch.BinaryContentTagger"/>
</preParseHandlers>
</importer>
Krok 4. Skonfiguruj indeksowanie stron internetowych
Skonfiguruj węzły <crawler> zgodnie z potrzebami, w tym:
- początkowe adresy URL,
- maksymalną głębokość indeksowania,
- liczbę wątków.
Zobacz stronę konfiguracji Norconex.
Krok 5. Rozpocznij indeksowanie stron internetowych i przesyłanie treści
Uruchom kolektor w trybie lokalnym:
./collector-http[.bat|.sh] -a start -c gcs-crawl-config.xml
Monitorowanie narzędzia do indeksowania za pomocą JEF Monitor
Norconex JEF (Job Execution Framework) Monitor wyświetla graficzny widok postępu. Zobacz Monitorowanie narzędzia do indeksowania za pomocą JEF Monitor.