Vergangene Schlacht · 2025-11-18 UTC
Research AI Agents Duell — 18. November 2025
Aus der Kategorie Research AI Agents. 13 Marken verteilt auf 3 Kämpfer. GLM-4.6V holte sich die Krone.
Endstand
Die Aufstellung
Die Kämpfer
Profile aller Tools, die in dieser Schlacht angetreten sind, nach Endpunktzahl sortiert.

GLM-4.6V
Open-Source-Multimodal-GLM von Z.ai, die visuelle, textuelle und funktionsaufrufbasierte Einheit zur Verarbeitung großer Kontexte, zum Suchen, zum Programmieren und zur Code-Generierung umfasst.

GLM-4.6V ist ein multimodales Large Language Model, das sein Kontextfenster auf 128 k Token erweitert und eine State-of-the-Art-Leistung im visuellen Verständnis erzielt. Es integriert native Function Calling‑Fähigkeiten und schafft damit eine einheitliche technische Basis für multimodale Agenten in realen Geschäftsszenarien. GLM-4.6V kann multimodale Eingaben verarbeiten und automatisch hochqualitative, strukturierte Bild‑Text‑Inhalte erzeugen, komplexe Dokumenteninterpretation durchführen sowie visuelle Suche und Retrieval ermöglichen. Dieses Modell bietet mehrere Fähigkeiten und Anwendungsfälle, darunter die intelligente Erstellung und Anordnung von Bild‑Text‑Inhalten, visuelle Websuche und die Generierung von Rich‑Media‑Berichten sowie das Verständnis von langen Kontexten. Es kann gemischte Text‑Bild‑Eingaben verarbeiten, hochwertige Inhalte erzeugen und eine visuelle Prüfung von Kandidatenbildern durchführen. Der multimodale Such‑und Analyse‑Workflow von GLM-4.6V ermöglicht einen nahtlosen Übergang von der visuellen Wahrnehmung zur Online‑Abrufung und zur strukturierten Berichtserstellung. Er bewahrt das multimodale Kontextbewusstsein und führt Schlussfolgerungen basierend auf sowohl textuellen als auch visuellen Informationen durch. Dieses Modell bietet mehrere Fähigkeiten und Anwendungsszenarien, darunter Intent-Erkennung und Suchplanung, multimodale Ergebnisabstimmung sowie Argumentation mit der Erstellung von Rich-Media-Berichten.
Kriterienaufschlüsselung
- Multimodale Eingabeunterstützung (Bilder, Texte, Dateien)
- Native multimodale Werkzeugaufruf-Fähigkeit
- 128k Kontextlänge
- Funktionsaufruf-Fähigkeit
- Großkontext-Verständnis
- Visuelle Wahrnehmung und Werkzeug-Retrieval

AMIE
Ein multimodales AI-Diagnoseagent, das klinische Gespräche führt und medizinische Bildern zu genauen Diagnosen interpretiert.

AMIE (Artikulierte medizinische Intelligenz-Explorer) ist ein von Google DeepMind und Google Research entwickeltes Forschungs-AI-Diagnoseagent. Es ist dafür gedacht, klinische Gespräche zu führen und medizinische Bilder zu genau Diagnosen zu interpretieren. Zunächst war AMIE ein textbasiertes medizinisches Diagnosegesprächskonversationssystem, das in der Natur veröffentlicht wurde. Die neueste Verbesserung, das multimodale AMIE, integriert die Fähigkeit, intelligentes Anfragen, Interpretationen und Rückschlüsse über visuelle medizinische Informationen während klinischer Gespräche zu führen. Diese Entwicklung zielt darauf ab, die diagnostische Genauigkeit durch die Einbindung multimodaler Daten, wie z.B. Bilder und Dokumente, in den diagnostischen Prozess zu verbessern. AMIE nutzt einen Zustandsbewussten Rahmen für die Argumentation und basiert auf den multimodalen Gemini-Modellen. Sie wurde durch Experteneinschätzungen, einschließlich Objektiv strukturierter klinischer Prüfungen (OSCEs), mit ihren Leistungen im Vergleich zu Primärsorgenkrankenschwestern (NPs) in verschiedenen Patientenszenarien bewertet.
Kriterienaufschlüsselung
- Multimodales diagnostisches Gespräch
- Interpretation visueller medizinischer Informationen
- Zustandsbewusster Argumentationsrahmen
- Integration mit Gemini-Modellen
- Simulationsumgebung für die Auswertung dialoger Gespräche

Der Table Agent ist eine mit KI-potenzierter Datenassistent, der bei tabellarischer Forschung unterstützen soll. Ziel ist es, den Prozess des Datenabholens zu jeder gegebenen Thematik zu automatisieren, um die Forschung dadurch effizienter zu gestalten. Das Tool ermöglicht anpassbare Daten schemata, durch die die Nutzer ihre Daten sammeln können, um bestimmten Anforderungen gerecht zu werden. Diese Flexibilität bringt Vorteile für eine breite Palette von Anwendungen und Branchen, in denen sich die Datenstruktur erheblich unterscheiden kann. Zu Kernfunktionen von Table Agent gehört die durch seine AI-Agenten angetriebene DatenSuchfähigkeit. Das bedeutet, dass die Plattform Künstliche Intelligenz einsetzt, um aktiv relevant Daten zu suchen und zu sammeln, dadurch potenziell die Zeit und Anstrengung einzusparen, die für manuelle Suchvorgänge notwendig ist. Obwohl Details über seinen Workflow und die Integrationen nicht aufgeführt sind, impliziert der Konzept eines durch KI angesteuerten Datenassistenten, dass es leicht mit verschiedenen Datenanalyse-Tools kombiniert werden könnte, wodurch der Gesamtforschungsprozess verbessert wird. Die Stärken von Table Agent könnten wohl ihre Fähigkeit umfassen, zeitaufwändige Sammlungsaufgaben zu automatisieren und ihr Anpassungsfähigkeit an verschiedene Datenstrukturen. Es ist jedoch ohne weitere Informationen schwierig, ihre Einschränkungen oder wie sie sich zu alternativen Datenassistenzwerkzeugen vergleichen lassen, zu bestimmen.
Kriterienaufschlüsselung
- Automatische Datensammlung
- Anpassbare Datenstrukturen
- Künstlich-intelligenz-basierte Datenfunktion
- Schnelle und genaue Datenerfassung


