Mit ML Kit unter Android die Sprache eines Textes ermitteln

Sie können ML Kit verwenden, um die Sprache eines Textstrings zu ermitteln. Sie können die wahrscheinlichste Sprache der Zeichenfolge sowie Konfidenzwerte für alle der möglichen Sprachen der Zeichenfolge.

ML Kit erkennt Text in über 100 verschiedenen Sprachen in eigenen Skripts. Außerdem ist romanisierter Text für Arabisch, Bulgarisch, Chinesisch, Griechisch, Hindi, Japanisch und Russisch. Weitere Informationen finden Sie in der vollständige Liste der unterstützten Sprachen und Skripts

<ph type="x-smartling-placeholder">
GebündeltNicht gebündelt
Name der Bibliothekcom.google.mlkit:language-idcom.google.android.gms:play-services-mlkit-language-id
ImplementierungDas Modell ist zum Build-Zeitpunkt statisch mit Ihrer App verknüpft.Das Modell wird dynamisch über die Google Play-Dienste heruntergeladen.
Auswirkungen der App-GrößeDie Größe wurde um etwa 900 KB erhöht.Die Größe wurde um etwa 200 KB erhöht.
InitialisierungszeitModell ist sofort verfügbar.Vor der ersten Verwendung kann es möglicherweise etwas dauern, bis das Modell heruntergeladen wurde.

Jetzt ausprobieren

  • Probieren Sie die Beispiel-App aus, um sehen Sie sich ein Anwendungsbeispiel für diese API an.

Hinweis

<ph type="x-smartling-placeholder">
  1. In der Datei build.gradle auf Projektebene müssen Sie die Parameter von Google Maven-Repository in den Abschnitten buildscript und allprojects.

  2. Fügen Sie die Abhängigkeiten für die ML Kit-Android-Bibliotheken Ihres Moduls Gradle-Datei auf App-Ebene, in der Regel app/build.gradle. Wählen Sie eine der folgenden Optionen aus: die folgenden Abhängigkeiten verwenden:

    So bündeln Sie das Modell mit Ihrer App:

    dependencies {
      // ...
      // Use this dependency to bundle the model with your app
      implementation 'com.google.mlkit:language-id:17.0.6'
    }
    

    Verwendung des Modells in den Google Play-Diensten:

    dependencies {
      // ...
      // Use this dependency to use the dynamically downloaded model in Google Play Services
      implementation 'com.google.android.gms:play-services-mlkit-language-id:17.0.0'
    }
    
  3. Wenn Sie das Modell in den Google Play-Diensten verwenden möchten, können Sie wird das Modell automatisch auf das Gerät heruntergeladen, aus dem Play Store installiert haben. Fügen Sie dazu die folgende Deklaration der Datei AndroidManifest.xml Ihrer App:

    <application ...>
          ...
          <meta-data
              android:name="com.google.mlkit.vision.DEPENDENCIES"
              android:value="langid" >
          <!-- To use multiple models: android:value="langid,model2,model3" -->
    </application>
    

    Sie können die Modellverfügbarkeit auch explizit prüfen und den Download über Die Google Play-Dienste ModuleInstallClient API.

    Wenn Sie das Herunterladen von Modellen bei der Installation nicht aktivieren oder einen expliziten Download anfordern, Das Modell wird heruntergeladen, wenn Sie die ID zum ersten Mal ausführen. Von Ihnen gestellte Anfragen bevor der Download abgeschlossen ist, keine Ergebnisse liefern.

Sprache eines Strings ermitteln

Um die Sprache eines Strings zu ermitteln, rufen Sie LanguageIdentification.getClient() auf. rufen Sie eine Instanz von LanguageIdentifier ab und übergeben Sie den String an den identifyLanguage()-Methode von LanguageIdentifier.

Beispiel:

Kotlin

val languageIdentifier = LanguageIdentification.getClient()
languageIdentifier.identifyLanguage(text)
        .addOnSuccessListener { languageCode ->
            if (languageCode == "und") {
                Log.i(TAG, "Can't identify language.")
            } else {
                Log.i(TAG, "Language: $languageCode")
            }
        }
        .addOnFailureListener {
            // Model couldn’t be loaded or other internal error.
            // ...
        }

Java

LanguageIdentifier languageIdentifier =
        LanguageIdentification.getClient();
languageIdentifier.identifyLanguage(text)
        .addOnSuccessListener(
                new OnSuccessListener<String>() {
                    @Override
                    public void onSuccess(@Nullable String languageCode) {
                        if (languageCode.equals("und")) {
                            Log.i(TAG, "Can't identify language.");
                        } else {
                            Log.i(TAG, "Language: " + languageCode);
                        }
                    }
                })
        .addOnFailureListener(
                new OnFailureListener() {
                    @Override
                    public void onFailure(@NonNull Exception e) {
                        // Model couldn’t be loaded or other internal error.
                        // ...
                    }
                });

Wenn der Aufruf erfolgreich ist, wird ein Der BCP-47-Sprachcode lautet an den Erfolgs-Listener übergeben. Dabei wird die Sprache des Texts angegeben. Falls nein sicher erkannt wird, wird der Code und (unbestimmt) wurde übergeben.

Standardmäßig gibt ML Kit nur dann einen anderen Wert als und zurück, wenn der Sprache mit einem Konfidenzwert von mindestens 0,5. Sie können dies ändern. Grenzwert durch Übergabe eines LanguageIdentificationOptions-Objekts an getClient():

Kotlin

val languageIdentifier = LanguageIdentification
        .getClient(LanguageIdentificationOptions.Builder()
                .setConfidenceThreshold(0.34f)
                .build())

Java

LanguageIdentifier languageIdentifier = LanguageIdentification.getClient(
        new LanguageIdentificationOptions.Builder()
                .setConfidenceThreshold(0.34f)
                .build());

Mögliche Sprachen eines Strings abrufen

Um die Konfidenzwerte der wahrscheinlichsten Sprachen eines Strings zu erhalten, erhalten Sie einen Instanz von LanguageIdentifier und übergeben Sie den String dann an den identifyPossibleLanguages()-Methode.

Beispiel:

Kotlin

val languageIdentifier = LanguageIdentification.getClient()
languageIdentifier.identifyPossibleLanguages(text)
        .addOnSuccessListener { identifiedLanguages ->
            for (identifiedLanguage in identifiedLanguages) {
                val language = identifiedLanguage.languageTag
                val confidence = identifiedLanguage.confidence
                Log.i(TAG, "$language $confidence")
            }
        }
        .addOnFailureListener {
            // Model couldn’t be loaded or other internal error.
            // ...
        }

Java

LanguageIdentifier languageIdentifier =
        LanguageIdentification.getClient();
languageIdentifier.identifyPossibleLanguages(text)
        .addOnSuccessListener(new OnSuccessListener<List<IdentifiedLanguage>>() {
            @Override
            public void onSuccess(List<IdentifiedLanguage> identifiedLanguages) {
                for (IdentifiedLanguage identifiedLanguage : identifiedLanguages) {
                    String language = identifiedLanguage.getLanguageTag();
                    float confidence = identifiedLanguage.getConfidence();
                    Log.i(TAG, language + " (" + confidence + ")");
                }
            }
        })
        .addOnFailureListener(
                new OnFailureListener() {
                    @Override
                    public void onFailure(@NonNull Exception e) {
                        // Model couldn’t be loaded or other internal error.
                        // ...
                    }
                });

Wenn der Aufruf erfolgreich ist, wird eine Liste mit IdentifiedLanguage-Objekten an den zuhören. Von jedem Objekt können Sie den BCP-47-Code der Sprache und dass der String in dieser Sprache ist. Beachten Sie, dass zeigen diese Werte die Sicherheit an, dass sich der gesamte String in der angegebenen Sprache; ML Kit erkennt nicht mehrere Sprachen in einem einzelnen String.

Standardmäßig gibt ML Kit nur Sprachen mit Konfidenzwerten von mindestens 0:01. Sie können diesen Grenzwert ändern, indem Sie eine LanguageIdentificationOptions Objekt für getClient():

Kotlin

val languageIdentifier = LanguageIdentification
      .getClient(LanguageIdentificationOptions.Builder()
              .setConfidenceThreshold(0.5f)
              .build())

Java

LanguageIdentifier languageIdentifier = LanguageIdentification.getClient(
      new LanguageIdentificationOptions.Builder()
              .setConfidenceThreshold(0.5f)
              .build());

Wenn keine Sprache diesen Grenzwert erreicht, enthält die Liste ein Element mit dem Wert und