Google hat die neue Version seines Embedding-Modells EmbeddingGemma 2 veröffentlicht, das eine bedeutsame Erweiterung gegenüber früheren Versionen darstellt. Das Modell kann mehrere Medientypen gleichzeitig verarbeiten und in einem gemeinsamen Vektorraum abbilden, was neue Möglichkeiten für Suche und Datenanalyse eröffnet.
Was ist ein Embedding? Embeddings sind mathematische Darstellungen von Inhalten, die es Maschinen ermöglichen, Ähnlichkeiten zwischen verschiedenen Elementen zu erkennen. Ein Suchmodell würde beispielsweise nach einem Foto fragen "Finde alle ähnlichen Bilder in meiner Datenbank", und das Embedding-Modell könnte Millionen von Bildern blitzschnell durchsuchen, ohne die Inhalte vollständig analysieren zu müssen.
Die neue Version EmbeddingGemma 2 unterscheidet sich durch ihre Multimodalität: Sie kann nicht nur Text verarbeiten, sondern auch Code, Bilder, Audio und Video. Dies ermöglicht völlig neue Anwendungsszenarien. Ein Anwender könnte beispielsweise ein Bild hochladen und das System würde nicht nur ähnliche Bilder, sondern auch Artikel, Videos oder Code-Beispiele finden, die inhaltlich relevant sind.
Ein grosser Vorteil von EmbeddingGemma 2 ist die Möglichkeit, es direkt auf Endgeräten zu betreiben. Dies ist relevant für Privatsphäre und Datensicherheit: Die zu analysierenden Inhalte müssen nicht an Google-Server übertragen werden, sondern können lokal verarbeitet werden. Dies ist besonders wertvoll für Unternehmen mit sensiblen Dokumenten oder Bildern.
Für KMU eröffnen sich mehrere praktische Anwendungen: Dokumentenmanagement-Systeme könnten damit intern nach relevanten Dokumenten suchen, ohne zur Cloud greifen zu müssen. Bildarchive könnten intelligent durchsucht werden. Rechtsanwaltskanzleien könnten ähnliche Fälle anhand von Case-Dokumenten finden. Entwickler könnten Code-Repositories intelligenter durchsuchen. Die lokale Verarbeitung bedeutet auch, dass sich der Betrieb solcher Systeme wirtschaftlicher wird, da keine ständige Cloud-Anbindung nötig ist.
