Cohere hat sein kleinstes visuelles Sprachmodell North Micro Vision mit 2,4B Parametern unter der Apache 2.0 Lizenz veröffentlicht. Dieses Modell konzentriert sich auf Dokumente, Tabellen, Diagramme, Screenshots und OCR und kann Bilder in ihrem ursprünglichen Maßstab und ihrer Auflösung direkt verarbeiten, ohne sie vorher komprimieren zu müssen. Das Modell besteht aus einem 2B Sprachmodell und einem 400M visuellen Encoder. In offiziellen Tests erreichte DocVQA eine Punktzahl von 92,1 %, was über den 89,6 % von Ministral 3 3B und den 73,2 % von Gemma 4 E2B liegt und nahe an den 92,6 % von Qwen3.5-2B kommt. Die visuelle Lokalisierung RefCOCO erzielte 73,2 %, ebenfalls höher als die von Ministral und Gemma. Allerdings schneidet North Micro Vision in den meisten allgemeinen visuellen, OCR- und multimodalen Benchmarks schlechter ab als Qwen3.5-2B, wobei seine Stärken hauptsächlich im Dokumentenverständnis und in der visuellen Lokalisierung liegen. Darüber hinaus unterstützt dieses Modell keine Inferenz und Toolaufrufe und hat begrenzte mathematische und Programmierfähigkeiten.
Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.





























