Miniona bitwa · 2025-11-18 UTC
Research AI Agents Pojedynek — 18 listopada 2025
Z kategorii Research AI Agents. 13 ocen oddanych na 3 zawodników. GLM-4.6V zdobył koronę.
Klasyfikacja końcowa
Zestawienie
Zawodnicy
Profile każdego narzędzia, które rywalizowało w tej bitwie, uszeregowane według ich wyniku końcowego.

GLM-4.6V
Otwartoźródłowy multimodalny GLM od Z.ai integrujący wizję, tekst i wywoływanie narzędzi w celu rozumowania w długim kontekście, wyszukiwania, programowania oraz konwersji UI na kod.

GLM-4.6V to multimodalny duży model językowy, który rozszerza swoje okno kontekstowe do 128 k tokenów i osiąga najnowocześniejszą wydajność w rozumieniu wizualnym. Integruje wbudowane możliwości Function Calling, umożliwiając jednolitą techniczną podstawę dla multimodalnych agentów w realnych scenariuszach biznesowych. GLM-4.6V może przyjmować wejścia multimodalne i automatycznie generować wysokiej jakości, strukturalną, przeplatane treści obraz‑tekst, wykonywać złożone rozumienie dokumentów oraz realizować wizualne wyszukiwanie i pobieranie. Model oferuje szereg możliwości i scenariuszy, w tym inteligentne tworzenie i układ treści obraz‑tekst, wizualne wyszukiwanie w sieci i generowanie bogatych raportów multimedialnych oraz rozumienie długiego kontekstu. Potrafi przyjmować mieszane wejścia tekst‑obraz, generować wysokiej jakości treści i przeprowadzać wizualny audyt wybranych obrazów. Workflow multimodalnego wyszukiwania i analizy GLM-4.6V umożliwia płynne przejście od percepcji wizualnej do pobierania online i generowania ustrukturyzowanych raportów. Utrzymuje świadomość kontekstową multimodalną i przeprowadza rozumowanie oparte zarówno na informacji tekstowej, jak i wizualnej. Model zapewnia różnorodne możliwości i scenariusze, w tym rozpoznawanie intencji i planowanie wyszukiwania, dopasowanie wyników multimodalnych oraz rozumowanie przy generowaniu bogatych raportów multimedialnych.
Podział kryteriów
- Wsparcie wejść multimodalnych (obrazy, tekst, pliki)
- Wbudowane wywoływanie narzędzi multimodalnych
- Długość kontekstu 128 k
- Możliwość wywoływania funkcji
- Rozumienie długiego kontekstu
- Rozumienie wizualne i wyszukiwanie narzędzi

AMIE
Wielomodalny agent AI diagnostyczny, który prowadzi konwersacje kliniczne i interpretuje obrazy medyczne w celu dokładnych diagnoz.

AMIE (Articulate Medical Intelligence Explorer) to badawcze narzędzie AI diagnostyczne stworzone przez Google DeepMind i Google Research. Jest zaprojektowane do prowadzenia konwersacji klinicznych oraz interpretacji obrazów medycznych w celu precyzyjnych diagnoz. Początkowo AMIE był oparty na tekstowym AI diagnostycznym konwersacyjnym publikowanym w czasopiśmie Nature. Najnowsze udoskonalenie, wielomodalny AMIE, integruje zdolność inteligentnego żądania, interpretacji i rozumienia informacji wizualnych podczas konwersacji klinicznych. Rozwój ma na celu zwiększenie dokładności diagnoz poprzez uwzględnienie danych wielomodalnych, takich jak obrazy i dokumenty, w procesie diagnostycznym. AMIE korzysta ze struktury rozumowania zorientowanej na stan (state-aware reasoning) i opiera się na wielomodalnych modelach Gemini. Był oceniany przez ekspertów, w tym w ramach Objective Structured Clinical Examinations (OSCE), porównując jego wydajność do lekarzy pierwszego kontaktu (PCP) w różnych scenariuszach pacjentów.
Podział kryteriów
- Wielomodalny dialog diagnostyczny
- Interpretacja wizualnych informacji medycznych
- Framework rozumowania zorientowanego na stan
- Integracja z modelami Gemini
- Środowisko symulacyjne do oceny dialogu

Table Agent jest asystentem danych zasilanym AI, zaprojektowanym do wspomagania badań w formie tabel. Ma na celu automatyzację procesu zbierania danych na dowolny temat, zwiększając efektywność badań. Narzędzie umożliwia dostosowywanie schematów danych, co pozwala użytkownikom na dopasowanie zbierania danych do konkretnych potrzeb. Ta elastyczność jest korzystna dla szerokiego zakresu aplikacji i branż, w których struktura danych może znacznie się różnić. W podstawie funkcjonalności Table Agent leży zdolność wyszukiwania danych sterowana agentem AI. Oznacza to, że narzędzie wykorzystuje sztuczną inteligencję do aktywnego poszukiwania i kompilacji odpowiednich danych, co może zmniejszyć czas i wysiłek potrzebny do ręcznych poszukiwań. Chociaż szczegóły jego przepływu pracy i integracji nie są opisane, koncepcja AI‑napędzanego asystenta danych sugeruje, że mógłby bezproblemowo integrować się z różnymi narzędziami do analizy danych, poprawiając ogólny proces badawczy. Silne strony Table Agent prawdopodobnie obejmują zdolność do automatyzacji nużących zadań zbierania danych oraz jego adaptacyjność do różnych struktur danych. Brakuje jednak bardziej szczegółowych informacji, co utrudnia określenie ograniczeń lub porównanie z alternatywnymi narzędziami asystującymi w pracy z danymi.
Podział kryteriów
- Zautomatyzowane zbieranie danych
- Konfigurowalne schematy danych
- Wyszukiwanie danych napędzane przez agenta AI
- Szybkie i precyzyjne pobieranie danych


