Qwen3-Embedding-8B
Beschreibung
Das Qwen3-Embedding-Modell von Alibaba ist für das Erstellen von Embeddings konzipiert, die für ein RAG-System (Retrieval augmented generation) unverzichtbar sind. Mit diesem Modell ist keine Chat-Interaktion möglich. Es wird benötigt, um Dokumente und Texte in einzelne Vektoren umzuwandeln, die von der anwendenden Applikation in einer Vektordatenbank gespeichert werden und damit eine semantische Suche ermöglichen. Die Stärke dieses Modells liegt in seiner Unterstützung von über 100 Sprachen bei gleichzeitig hoher Performance.
Folgende Grenz- und Standardwerte gelten:
- Maximale Kontextlänge: 32.768 Token
- Standarddimension des Embeddings: 4.096
- Unterstützte Werte für
dimensions: 256, 512, 768, 1.024, 1.536, 2.048, 3.072 und 4.096
Es wird empfohlen, Embeddings für Suchanfragen mit folgendem Template zu formatieren:
Instruct: {task_description}
Query: {query}
Hierbei sollte {query} die individuelle Suchanfrage in einem Satz abbilden und {task_description} die Aufgabe beschreiben, beispielsweise:
task = 'Given a web search query, retrieve relevant passages that answer the query'
query = 'Explain gravity'
Embedding-Dimensionen reduzieren
Qwen3-Embedding-8B unterstützt die serverseitige Dimensionsreduktion über den OpenAI-kompatiblen Parameter dimensions. Diese unterstützte Modellfunktion basiert auf Matryoshka Representation Learning.
Setze dimensions auf 256, 512, 768, 1.024, 1.536, 2.048, 3.072 oder 4.096. Der Endpunkt gibt einen Vektor mit genau der angeforderten Anzahl an Werten zurück und normalisiert ihn nach der Dimensionsreduktion mit der L2-Norm. Werte unter 256 werden nicht unterstützt, da die Retrieval-Qualität bei kleineren Dimensionen abnimmt.
So forderst du zum Beispiel ein Embedding mit 256 Dimensionen an:
from openai import OpenAI
client = OpenAI(
base_url="https://llm.aihosting.mittwald.de/v1"
)
response = client.embeddings.create(
model="Qwen3-Embedding-8B",
input="Testing 123",
encoding_format="float",
dimensions=256,
)
print(len(response.data[0].embedding)) # 256
Kleinere Embeddings reduzieren den Übertragungs- und Speicherbedarf, können aber auch die Retrieval-Qualität beeinflussen. Prüfe die gewählte Dimension deshalb mit repräsentativen Daten für deinen Anwendungsfall.
Nutzungsbedingungen und Lizenzhinweise
Es gelten die allgemeinen Nutzungsbedingungen. Das Modell wird von Alibaba unter der Apache 2.0-Lizenz angeboten, eine Weiternutzung der generierten Inhalte unterliegt keiner zusätzlichen Restriktion.