Programmcode auf einem Bildschirm als Symbol fuer die Programmiersprache Rust

Ollama 0.33.3: Gemma-4 mit Bild und Ton auf Apple Silicon

Das quelloffene Ollama-Projekt hat am 2. September 2026 die Version 0.33.3 seiner lokalen KI-Laufzeit veröffentlicht. Der Patch bringt vor allem multimodales Gemma 4 auf Apples MLX-Engine – das Modell verarbeitet dort nun neben Text auch Bilder und Audio direkt auf Apple-Silicon-Hardware.

Multimodal auf dem Mac

Der zentrale Punkt der Release-Notes lautet knapp: „gemma4 now supports images and audio on MLX engine“. Damit läuft Googles offenes Gemma-4-Modell samt Bild- und Audioeingabe nun auf der von Apple entwickelten MLX-Laufzeit – also ohne Umweg über CUDA-GPUs. Für Entwickler auf MacBooks und Mac-Studio-Geräten heißt das: multimodale Prompts lokal, ohne Cloud und ohne dedizierte Nvidia-Karte.

Genauere Token-Abrechnung

Daneben nennt das Projekt zwei weitere handfeste Änderungen: Ollama meldet jetzt gecachte Prompt-Tokens getrennt aus und respektiert die in einer GGUF-Datei hinterlegten Standardparameter eines Modells. Beides erleichtert reproduzierbare Läufe und eine ehrlichere Kosten- beziehungsweise Kontextlängen-Abrechnung.

  • Gemma 4 mit Bild und Audio auf der MLX-Engine
  • Ausweis gecachter Prompt-Tokens
  • Beachtung der GGUF-Standardparameter
  • Aktualisierte MLX-, MLX-C- und llama.cpp-Engines

Die 0.33-Reihe hatte zuvor bereits die interne Engine-Anbindung überarbeitet. Version 0.33.3 aktualisiert nun die eingebetteten MLX-, MLX-C- und llama.cpp-Komponenten und schließt damit an den wöchentlichen Release-Takt an, den das Team seit dem Sommer fährt.

Quellen: GitHub – Ollama v0.33.3 · Ollama Releases

Mastodon
Nach oben scrollen