Google veröffentlicht EmbeddingGemma 2 für multimodale Suche
Googles Embedding-Modell mit 740 Millionen Parametern bildet Text, Code, Bilder, Video und Audio in einem gemeinsamen Vektorraum ab. Modulare Encoder sind für lokale Geräte ausgelegt.
Googles Embedding-Modell mit 740 Millionen Parametern bildet Text, Code, Bilder, Video und Audio in einem gemeinsamen Vektorraum ab. Modulare Encoder sind für lokale Geräte ausgelegt.
Mistral hat den API-Zugang zu seinem multimodalen Modell mit einer Billion Parametern geöffnet und den 27. Oktober für die offenen Gewichte angesetzt. Architektur- und Benchmark-Angaben bleiben damit vorläufig.
Ein Preprint findet in Vision-Language-Modellen einen frühen Schaltkreis für Objektabgleich und einen späteren für Beziehungsabgleich. Letzteren verknüpft die Studie mit der Leistung auf ARC-AGI-1.
Das Apache-lizenzierte Projekt veröffentlicht Beschleunigerentwurf, Compiler, Simulator und Host-Werkzeuge. Der gemessene Durchsatz zeigt ein kleines, durch Speicher begrenztes System statt eines GPU-Ersatzes.
Ein vorab registriertes Experiment vergleicht neun Claude-Code-Skills mit gleich langen neutralen Anweisungen. Zwei sind günstiger als Placebo, einer schlechter und sechs statistisch nicht unterscheidbar.
Eine technische Studie zu drei offenen Mixture-of-Experts-Modellen findet, dass Malware-Fragen Routen nahe moralischen Fragen folgen. Der lesbare Arbeitsbereich der Modelle behält dabei Sicherheitsbegriffe bei.
Forschung, Modellveröffentlichungen, lokale Projekte, technische Essays und Community-Berichte: 51 kurze Meldungen mit direkten Quellen.
Das Mixture-of-Experts-Modell mit 501 Milliarden Parametern ist nur über einen Vorabzugang verfügbar. Laut Reflection folgen Gewichte, technischer Bericht und Entwicklerwerkzeuge später im Oktober.
Ein Preprint findet eine gemeinsame interne Richtung, die Sprachmodelle zum ersten, zweiten oder späteren Fakt einer Passage führt. Eine Frage entlang dieser Richtung zu verschieben kann ändern, welchen Fakt das Modell abruft.
Ein Preprint findet, dass ein Großteil des Nutzens der Agentenhistorie auch nach dem Durchmischen früherer Handlungen erhalten bleibt. Jede Handlung ausdrücklich mit ihrem Ergebnis zu verbinden verbessert den Aufgabenabschluss.
Das Open-Source-Kommandozeilenwerkzeug bindet llama.cpp ein und liefert zwei kleine, feinabgestimmte Modelle. Sein Autor veröffentlichte außerdem den Trainingssatz mit 401.975 Paaren und den Benchmark-Code.
Context Language Models ersetzen eine nur erweiterbare Transkription durch eine Datei, die das Modell umschreiben, löschen und umordnen kann. Die Autoren melden nach Training der Bearbeitungsstrategie höhere Genauigkeit bei langen Aufgaben und weniger wiederholte Berechnungen.