MODELLPROFIL · AKTUALISIERT AM 22. SEPTEMBER 2026
Jev-Omni
Ein Entscheidungs-Klassifikator, der Bilder, Ton und Video versteht — nicht nur Text.
Jev-Omni greift Jevs Idee typisierter Entscheidungen auf und erweitert sie über Text hinaus. Gib einen Zustand, eine Frage und eine Liste von Optionen vor; das Modell liefert eine Wahrscheinlichkeit für jede Option.
MULTIMODALE ENTSCHEIDUNG
Jev-Omni
Frage
Soll dieser Clip an eine Person weitergeleitet werden?
BASISMODELL
Gemma 4 12B IT
PARAMETER
12B
LIZENZ
Apache-2.0
AUTOR
akhilaaa3
WAS DAS MODELL LIEST — UND WIE SCHNELL
Vier Modalitäten, eine Entscheidungsschnittstelle
Veröffentlichte Medianwerte aus 20 Anfragen auf einer warmgelaufenen H200 mit optimiertem Backend. Vorverarbeitung und Netzwerkzeit kommen hinzu; auf einer kleineren Karte ist die Verarbeitung langsamer.
Text
Rund 2.000 Tokens in der veröffentlichten Messung.
Bild
Ein Bild pro Anfrage.
Audio
Auf 30 Sekunden begrenzt. ffmpeg muss installiert sein.
Video
Wird in 16 Einzelbildern ausgewertet.
Betrachte diese Werte als Richtwert, nicht als Versprechen: Sie stammen von einer warmgelaufenen H200 und schließen Medienvorverarbeitung und Netzwerkzeit aus.
WAS JEV-OMNI TATSÄCHLICH IST
Ein Klassifikator, kein Chatmodell
Jev-Omni ist ein unabhängiges Projekt von akhilaaa3 und kein TypeSafe-Modell. Es basiert auf Googles Gemma 4 12B IT mit einem Klassifikationskopf, wurde anhand von 30.000 Entscheidungsfragen feinabgestimmt und als zusammengeführtes Modell veröffentlicht.
Der Kopf bewertet die Optionen, die du vorgibst, und liefert eine Wahrscheinlichkeitsverteilung. Er erzeugt weder Erklärungen noch Ausgabetokens im Streamingverfahren. Deine Anwendung übernimmt daher die abschließende Interpretation und Aktion.
Die multimodalen Eingaben stammen direkt aus Gemma 4. Der Loader lädt die erforderlichen Komponenten bei der ersten Verwendung. Die Gewichte stehen unter Apache-2.0; laut Modellkarte deckt diese Lizenz die Rechte am Trainingsdatensatz nicht ab.
VERÖFFENTLICHTE ERGEBNISSE
Aussagekräftige Zahlen mit Kontext
Die Modellkarte nennt sowohl einen gleich gewichteten Mittelwert über Szenarien oder Gruppen als auch einen Mikro-Mittelwert über alle Fragen.
| Benchmark | Umfang | Genauigkeit | Mikro-Genauigkeit |
|---|---|---|---|
| DecisionBench Medium | 80 Szenarien / 293 Fragen | 87,57 % | 86,01 % |
| JevBench (abgeglichene Teilmenge) | 195 Gruppen / 231 Entscheidungen | 86,15 % | 87,45 % |
| MMAU | 1.000 Fragen | — | 63,10 % |
| MVBench | 14 Aufgaben / 2.786 Fragen | 53,10 % | 53,09 % |
GRÖSSE UND ABDECKUNG
Vergleichswerte aus der Modellkarte
Diese Referenzwerte wurden der Modellkarte entnommen. Laut den Autoren handelt es sich bei den größeren Modellen um deren eigene offizielle Werte; die Bewertungsverfahren können voneinander abweichen.
| Modell | Parameter | MMAU | MVBench | Modalitäten |
|---|---|---|---|---|
| Jev-Omni | 12B | 63,10 % | 53,10 % | Text, Bild, Audio, Video |
| Inkling | 975B gesamt / 41B aktiv | 77,20 % | — | Text, Bild, Audio |
| Qwen3.5-397B-A17B | 397B gesamt / 17B aktiv | — | 77,60 % | Text, Bild, Video |
Sachlich betrachtet ist dies ein Vergleich von Größe und Abdeckung, keine Qualitätsbehauptung. Jev-Omni liegt bei den veröffentlichten Benchmarks hinter den größeren Referenzmodellen, benötigt aber nur einen Bruchteil ihrer Parameter und unterstützt als einziges Modell hier alle vier Modalitäten.
AUSFÜHRUNG
Den Klassifikator auf deiner GPU ausführen
Eine CUDA-GPU ist erforderlich. Die FP32-Gewichte belegen vor Laufzeit-Overhead etwa 50 GB; die Inferenz verwendet BF16-Autocast. Für Audioeingaben wird außerdem ffmpeg benötigt.
Vor dem Start
Plane eine CUDA-Maschine mit genügend Speicher für Gewichte und Laufzeit ein. Prüfe Genauigkeit, Kalibrierung und Medienvorverarbeitung anhand eigener Daten, bevor du die Ausgabe in einem kritischen Ablauf verwendest.
pip install -r https://huggingface.co/akhilaaa3/Jev-Omni/resolve/main/requirements.txtfrom huggingface_hub import snapshot_download
path = snapshot_download("akhilaaa3/Jev-Omni")
import sys
sys.path.insert(0, path)
from jev_omni import load_jev_omni
classifier = load_jev_omni()
result = classifier(state, question, options)Für Bild, Audio oder Video ergänze media="/path/to/file" und modality="image", "audio" oder "video".
DIESE GRENZEN SOLLTEST DU KENNEN
Die Abwägungen gehören zum Modell
Jev-Omni eignet sich für klar eingegrenzte multimodale Entscheidungen. Weniger geeignet ist es, wenn du offene Textgenerierung, lange Medien oder einen leichtgewichtigen gehosteten Endpunkt benötigst.
- Praktisch höchstens 20 Optionen. Der Kopf akzeptiert 256, aber die Qualität oberhalb von 20 ist nicht belegt.
- Nur kurze Medien. Audio ist auf 30 Sekunden begrenzt, Video wird auf 16 Einzelbilder reduziert.
- Es ist ein Klassifikator. Es gibt keine generierten Ausgabetokens und keine integrierte Erklärung für die gewählte Option.
- Leistungsfähige Hardware erforderlich. Plane etwa 50 GB für die Gewichte und eine CUDA-GPU ein; die veröffentlichten Geschwindigkeiten wurden auf einer H200 gemessen.
- Die Rechte am Datensatz sind nicht durch die Apache-2.0-Lizenz der Gewichte abgedeckt. Prüfe vor einer Weiterverbreitung die Modellkarte.
JEV-OMNI ODER JEV?
Entscheide anhand der Informationen, die du verstehen musst
Die Abgrenzung ist einfach: Jev-Omni ergänzt Medieneingaben und Self-Hosting; Jev konzentriert sich auf schnelle, gehostete Textentscheidungen.
JEV-OMNI EIGNET SICH, WENN
die Entscheidung multimodal ist
- Es um ein Bild, einen kurzen Sprachclip oder einige Sekunden Video geht.
- Du über eine CUDA-GPU mit genügend Platz für ein multimodales 12B-Modell verfügst und die offenen Gewichte selbst verwalten möchtest.
- Du bereit bist, Genauigkeit und Kalibrierung anhand eigener Daten zu prüfen, bevor du den Kennzahlen vertraust.
JEV EIGNET SICH, WENN
die Entscheidung auf Text beruht
- Dein Zustand aus Text besteht, wie bei den meisten Aufgaben für Triage, Moderation, Weiterleitung und Bewertung.
- Du kalibrierte Wahrscheinlichkeiten über eine gehostete API beziehen willst, ohne etwas zu installieren oder eine GPU zu betreiben.
- Du sofort im Browser starten möchtest, statt erst einen Download von 50 GB abzuwarten.
Die Textversion kannst du sofort testen
Führe einen echten Fall im Jev-Playground aus und prüfe die vollständige Wahrscheinlichkeitsverteilung, bevor du eine Integration schreibst.
FRAGEN
Häufige Fragen zu Jev-Omni
Was ist Jev-Omni?+
Ein multimodaler Entscheidungs-Klassifikator mit offenen Gewichten von akhilaaa3, feinabgestimmt auf Basis von Googles Gemma 4 12B IT mit 30.000 Entscheidungsfragen. Du gibst einen Zustand, eine Frage und Optionen vor; das Modell liefert Wahrscheinlichkeiten.
Wurde Jev-Omni von TypeSafe entwickelt oder steht es in Verbindung mit Jev?+
Nein. Es ist ein unabhängiges Projekt, das den Namen Jev und die Idee typisierter Entscheidungen aufgreift. TypeSafes Jev ist ein geschlossenes, gehostetes Modell; Jev-Omni besteht aus Gemma-4-Gewichten unter Apache-2.0, die du selbst ausführst.
Ist Jev-Omni in der JevBench-Rangliste vertreten?+
Nicht als direkt vergleichbarer Ranglisteneintrag. Die Modellkarte nennt 86,15 % auf einer abgeglichenen Teilmenge der JevBench-Aufgaben; JevBench v1.3.0 nutzt eine andere Messung über eine breitere Auswahl von Systemen.
Welche Hardware benötigt Jev-Omni?+
Eine CUDA-GPU. Die FP32-Gewichte belegen vor Laufzeit-Overhead rund 50 GB; die Inferenz läuft mit BF16-Autocast. Die veröffentlichten Latenzen wurden auf einer warmgelaufenen H200 gemessen. Betrachte sie daher als Richtwert, nicht als Garantie.
Wie viele Optionen kann Jev-Omni verarbeiten?+
Der Klassifikationskopf akzeptiert bis zu 256 Optionen. Laut Modellkarte ist die Unterstützung bei 20 oder weniger Optionen am besten; die Qualität oberhalb von 20 ist nicht belegt. Prüfe die gewünschten Optionszahlen selbst, bevor du dich darauf verlässt.
Kann Jev Bilder wie Jev-Omni lesen?+
Nein. Jev verarbeitet nur Text: eine Zeichenfolge, ein JSON-Objekt oder ein Array. Wenn deine Entscheidung ein Foto, eine Sprachnachricht oder einen Clip betrifft, verwende ein multimodales Modell wie Jev-Omni.
QUELLEN
Primärquellen lesen
Quellen geprüft am 22. September 2026.
Jev-Omni, Gemma und alle anderen auf dieser Seite genannten Produkte gehören ihren jeweiligen Eigentümern. Die Zahlen wurden den verlinkten Quellen entnommen und dienen der Orientierung; sie stellen keine Leistungsgarantie dar.