MODELLPROFIL · AKTUALISIERT AM 22. SEPTEMBER 2026

Jev-Omni

Ein Entscheidungs-Klassifikator, der Bilder, Ton und Video versteht — nicht nur Text.

Jev-Omni greift Jevs Idee typisierter Entscheidungen auf und erweitert sie über Text hinaus. Gib einen Zustand, eine Frage und eine Liste von Optionen vor; das Modell liefert eine Wahrscheinlichkeit für jede Option.

MULTIMODALE ENTSCHEIDUNG

Jev-Omni

Frage

Soll dieser Clip an eine Person weitergeleitet werden?

Weiterleiten0.91
Automatisch fortfahren0.09

BASISMODELL

Gemma 4 12B IT

PARAMETER

12B

LIZENZ

Apache-2.0

AUTOR

akhilaaa3

WAS DAS MODELL LIEST — UND WIE SCHNELL

Vier Modalitäten, eine Entscheidungsschnittstelle

Veröffentlichte Medianwerte aus 20 Anfragen auf einer warmgelaufenen H200 mit optimiertem Backend. Vorverarbeitung und Netzwerkzeit kommen hinzu; auf einer kleineren Karte ist die Verarbeitung langsamer.

83 ms

Text

Rund 2.000 Tokens in der veröffentlichten Messung.

26 ms

Bild

Ein Bild pro Anfrage.

31 ms

Audio

Auf 30 Sekunden begrenzt. ffmpeg muss installiert sein.

504 ms

Video

Wird in 16 Einzelbildern ausgewertet.

Betrachte diese Werte als Richtwert, nicht als Versprechen: Sie stammen von einer warmgelaufenen H200 und schließen Medienvorverarbeitung und Netzwerkzeit aus.

WAS JEV-OMNI TATSÄCHLICH IST

Ein Klassifikator, kein Chatmodell

Jev-Omni ist ein unabhängiges Projekt von akhilaaa3 und kein TypeSafe-Modell. Es basiert auf Googles Gemma 4 12B IT mit einem Klassifikationskopf, wurde anhand von 30.000 Entscheidungsfragen feinabgestimmt und als zusammengeführtes Modell veröffentlicht.

Der Kopf bewertet die Optionen, die du vorgibst, und liefert eine Wahrscheinlichkeitsverteilung. Er erzeugt weder Erklärungen noch Ausgabetokens im Streamingverfahren. Deine Anwendung übernimmt daher die abschließende Interpretation und Aktion.

Die multimodalen Eingaben stammen direkt aus Gemma 4. Der Loader lädt die erforderlichen Komponenten bei der ersten Verwendung. Die Gewichte stehen unter Apache-2.0; laut Modellkarte deckt diese Lizenz die Rechte am Trainingsdatensatz nicht ab.

VERÖFFENTLICHTE ERGEBNISSE

Aussagekräftige Zahlen mit Kontext

Die Modellkarte nennt sowohl einen gleich gewichteten Mittelwert über Szenarien oder Gruppen als auch einen Mikro-Mittelwert über alle Fragen.

BenchmarkUmfangGenauigkeitMikro-Genauigkeit
DecisionBench Medium80 Szenarien / 293 Fragen87,57 %86,01 %
JevBench (abgeglichene Teilmenge)195 Gruppen / 231 Entscheidungen86,15 %87,45 %
MMAU1.000 Fragen—63,10 %
MVBench14 Aufgaben / 2.786 Fragen53,10 %53,09 %
Interpretiere die JevBench-Zeile nicht als Ranglistenplatz. Sie zeigt 86,15 % auf einer abgeglichenen Teilmenge; JevBench v1.3.0 verwendet andere Messwerte und eine andere Ranglistenbasis.

GRÖSSE UND ABDECKUNG

Vergleichswerte aus der Modellkarte

Diese Referenzwerte wurden der Modellkarte entnommen. Laut den Autoren handelt es sich bei den größeren Modellen um deren eigene offizielle Werte; die Bewertungsverfahren können voneinander abweichen.

ModellParameterMMAUMVBenchModalitäten
Jev-Omni12B63,10 %53,10 %Text, Bild, Audio, Video
Inkling975B gesamt / 41B aktiv77,20 %—Text, Bild, Audio
Qwen3.5-397B-A17B397B gesamt / 17B aktiv—77,60 %Text, Bild, Video

Sachlich betrachtet ist dies ein Vergleich von Größe und Abdeckung, keine Qualitätsbehauptung. Jev-Omni liegt bei den veröffentlichten Benchmarks hinter den größeren Referenzmodellen, benötigt aber nur einen Bruchteil ihrer Parameter und unterstützt als einziges Modell hier alle vier Modalitäten.

AUSFÜHRUNG

Den Klassifikator auf deiner GPU ausführen

Eine CUDA-GPU ist erforderlich. Die FP32-Gewichte belegen vor Laufzeit-Overhead etwa 50 GB; die Inferenz verwendet BF16-Autocast. Für Audioeingaben wird außerdem ffmpeg benötigt.

Vor dem Start

Plane eine CUDA-Maschine mit genügend Speicher für Gewichte und Laufzeit ein. Prüfe Genauigkeit, Kalibrierung und Medienvorverarbeitung anhand eigener Daten, bevor du die Ausgabe in einem kritischen Ablauf verwendest.

pip install -r https://huggingface.co/akhilaaa3/Jev-Omni/resolve/main/requirements.txt
from huggingface_hub import snapshot_download
path = snapshot_download("akhilaaa3/Jev-Omni")
import sys
sys.path.insert(0, path)
from jev_omni import load_jev_omni
classifier = load_jev_omni()
result = classifier(state, question, options)

Für Bild, Audio oder Video ergänze media="/path/to/file" und modality="image", "audio" oder "video".

DIESE GRENZEN SOLLTEST DU KENNEN

Die Abwägungen gehören zum Modell

Jev-Omni eignet sich für klar eingegrenzte multimodale Entscheidungen. Weniger geeignet ist es, wenn du offene Textgenerierung, lange Medien oder einen leichtgewichtigen gehosteten Endpunkt benötigst.

  • Praktisch höchstens 20 Optionen. Der Kopf akzeptiert 256, aber die Qualität oberhalb von 20 ist nicht belegt.
  • Nur kurze Medien. Audio ist auf 30 Sekunden begrenzt, Video wird auf 16 Einzelbilder reduziert.
  • Es ist ein Klassifikator. Es gibt keine generierten Ausgabetokens und keine integrierte Erklärung für die gewählte Option.
  • Leistungsfähige Hardware erforderlich. Plane etwa 50 GB für die Gewichte und eine CUDA-GPU ein; die veröffentlichten Geschwindigkeiten wurden auf einer H200 gemessen.
  • Die Rechte am Datensatz sind nicht durch die Apache-2.0-Lizenz der Gewichte abgedeckt. Prüfe vor einer Weiterverbreitung die Modellkarte.

JEV-OMNI ODER JEV?

Entscheide anhand der Informationen, die du verstehen musst

Die Abgrenzung ist einfach: Jev-Omni ergänzt Medieneingaben und Self-Hosting; Jev konzentriert sich auf schnelle, gehostete Textentscheidungen.

JEV-OMNI EIGNET SICH, WENN

die Entscheidung multimodal ist

  • Es um ein Bild, einen kurzen Sprachclip oder einige Sekunden Video geht.
  • Du über eine CUDA-GPU mit genügend Platz für ein multimodales 12B-Modell verfügst und die offenen Gewichte selbst verwalten möchtest.
  • Du bereit bist, Genauigkeit und Kalibrierung anhand eigener Daten zu prüfen, bevor du den Kennzahlen vertraust.

JEV EIGNET SICH, WENN

die Entscheidung auf Text beruht

  • Dein Zustand aus Text besteht, wie bei den meisten Aufgaben für Triage, Moderation, Weiterleitung und Bewertung.
  • Du kalibrierte Wahrscheinlichkeiten über eine gehostete API beziehen willst, ohne etwas zu installieren oder eine GPU zu betreiben.
  • Du sofort im Browser starten möchtest, statt erst einen Download von 50 GB abzuwarten.

Die Textversion kannst du sofort testen

Führe einen echten Fall im Jev-Playground aus und prüfe die vollständige Wahrscheinlichkeitsverteilung, bevor du eine Integration schreibst.

Playground öffnen

FRAGEN

Häufige Fragen zu Jev-Omni

Was ist Jev-Omni?+

Ein multimodaler Entscheidungs-Klassifikator mit offenen Gewichten von akhilaaa3, feinabgestimmt auf Basis von Googles Gemma 4 12B IT mit 30.000 Entscheidungsfragen. Du gibst einen Zustand, eine Frage und Optionen vor; das Modell liefert Wahrscheinlichkeiten.

Wurde Jev-Omni von TypeSafe entwickelt oder steht es in Verbindung mit Jev?+

Nein. Es ist ein unabhängiges Projekt, das den Namen Jev und die Idee typisierter Entscheidungen aufgreift. TypeSafes Jev ist ein geschlossenes, gehostetes Modell; Jev-Omni besteht aus Gemma-4-Gewichten unter Apache-2.0, die du selbst ausführst.

Ist Jev-Omni in der JevBench-Rangliste vertreten?+

Nicht als direkt vergleichbarer Ranglisteneintrag. Die Modellkarte nennt 86,15 % auf einer abgeglichenen Teilmenge der JevBench-Aufgaben; JevBench v1.3.0 nutzt eine andere Messung über eine breitere Auswahl von Systemen.

Welche Hardware benötigt Jev-Omni?+

Eine CUDA-GPU. Die FP32-Gewichte belegen vor Laufzeit-Overhead rund 50 GB; die Inferenz läuft mit BF16-Autocast. Die veröffentlichten Latenzen wurden auf einer warmgelaufenen H200 gemessen. Betrachte sie daher als Richtwert, nicht als Garantie.

Wie viele Optionen kann Jev-Omni verarbeiten?+

Der Klassifikationskopf akzeptiert bis zu 256 Optionen. Laut Modellkarte ist die Unterstützung bei 20 oder weniger Optionen am besten; die Qualität oberhalb von 20 ist nicht belegt. Prüfe die gewünschten Optionszahlen selbst, bevor du dich darauf verlässt.

Kann Jev Bilder wie Jev-Omni lesen?+

Nein. Jev verarbeitet nur Text: eine Zeichenfolge, ein JSON-Objekt oder ein Array. Wenn deine Entscheidung ein Foto, eine Sprachnachricht oder einen Clip betrifft, verwende ein multimodales Modell wie Jev-Omni.

QUELLEN

Primärquellen lesen

Quellen geprüft am 22. September 2026.

Jev AI auf GitHub

Jev-Omni, Gemma und alle anderen auf dieser Seite genannten Produkte gehören ihren jeweiligen Eigentümern. Die Zahlen wurden den verlinkten Quellen entnommen und dienen der Orientierung; sie stellen keine Leistungsgarantie dar.