Tidigare batalj · 2024-05-31 UTC
Research AI Agents Uppgörelse — 31 maj 2024
Från kategorin Research AI Agents. 34 markeringar placerade över 8 kämpar. Google AI Co-Scientist tog kronan.
Slutställning
Uppställningen
Kämparna
Profiler av varje verktyg som tävlade i den här bataljen, rankade efter sin slutpoäng.

Google AI Co-Scientist
Ett molntjänstbaserat AI-system som samarbetar med vetenskapsmän för att generera hypoteser och förhårdna sjukhusforskning.

Google AI Co-vetenskapsman är ett komplext AI-system designat för att samarbeta med forskare och åstadkomma förbättringar i den biomedicinska forskningen. Systemet bygger för fullt på Gemini 2.0 och fungerar som en virtuell vetenskaplig samarbetspartner för att hjälpa till att generera nyckelhypoteser och forskningsförslag. Målet är att systemet skall spegla den logik som ligger bakom vetenskaplig metod och upptäcka nya, originella kunskaper. Med en forskares undersökningsmål specificerat i naturlig språk, skapar AI Co-vetenskapsmannen nyttiga forskningshypoteser, detaljerade forskningsöversikter samt experimentalprotokoll. Det använder sig av en kohort av specialiserade agenter, inklusive Generation, Reflection, Ranking, Evolution, Proximity samt Meta-review, vilka använder sig automatisk feedback för att iterativt generera, värdera och förfina hypoteserna. Systemet möjliggör för forskare att interagera med det på olika sätt, inklusive att förmedla sångseed-hanterande idékällor för utforskning eller feedback på genererade utgångar på naturlig språk. AI Co-vetenskapsmannen använder sig även av verktyg såsom web-sök och specialiserade AI-modeller för att förbättra grunden och kvaliteten av genererade hypoteser. Systemet är designat för att flexibelt skal och successivt förbättra sin vetenskapliga logik mot specifiserat undersökningsmål. AI Co-Vetaren är särskilt användbar för vetare som möter utmaningar vid navigeringen av den snabba tillväxten av vetenskapliga publikationer och integrering av inblickar från okända domäner. Genom att utnyttja senaste AI-framstegen, inklusive förmågan att syntetisera över komplexa ämnen och utföra långsiktig planering och resonemang, syftar AI Co-Vetaren till att öka hastigheten på vetenskapliga och biomedicinska upptäckter. Systemet har testats i olika tillämpningar, inklusive upptäckt av gentransfer och återupptäckt av gentransfer. Även om AI Co-Scientisten presenterar flera fördelar beror dess effektivitet på den inkommande forskningsmålets kvalitet samt forskarens möjligheter att ge betydelsefulla återkopplingar. AI Co-Vetaren är en ny verktyg som har potential att på ett signifikant sätt påverka vetenskapsgemenskapen, men dess begränsningar och potentiella fördomar måste noggrant utvärderas. Utvecklingen av AI Co-Sångivaren är en pågående insats, och dess framtida tillämpningar och förbättringar kommer att beror på fortsatt forskning och testning.
Radbrytning av kriterier
- Hypotesgenerering
- Forskningsöversiktsskapande
- Experimentell protokollsutveckling
- Specialiserade agenter för vetenskaplig resonemang
- Automatiserad återkoppling
- Webb-sökning integration

Bright Data Web MCP
MCP-server som ger AI-agenter pålitlig webbsökning, scraping och webbläsarautomatisering med 5 000 gratis förfrågningar per månad.

Bright Data Web MCP är en server som gör det möjligt för AI-agenter att pålitligt söka, skrapa och automatisera webbläsare. Den erbjuder 5 000 kostnadsfria förfrågningar per månad. Verktyget gör det möjligt för AI-agenter att effektivt söka på nätet, extrahera data och navigera webbplatser utan att bli blockerade. Det erbjuder funktioner såsom realtids-sökresultat, dataextraktion, webbplatscrawling och webbläsarautomatisering. Web MCP är utformad för att kringgå blockeringar och begränsningar, och används av mer än 20 000 kunder världen över.
Radbrytning av kriterier
- Real-tids webbsökning
- Webbplats-crawling och dataextraktion
- Webbläsarautomatisering
- Genomgår geo-begränsningar och CAPTCHAs
- Renderar JavaScript för dynamiskt innehåll
- Imiterar verkligt användarbeteende

Kosmos
Autonom vetenskapsman för långa forskningskampanjer som analyserar data och litteratur för att producera fullständigt citerade vetenskapliga rapporter.

Kosmos är en autonom AI-forskare som är utformad för biotekniska och läkemedelsutvecklingsforskningsgrupper. Den analyserar data och litteratur för att producera fullständigt citerade vetenskapliga rapporter, vilket accelererar läkemedelsutvecklingsprocessen från hypotes till registrering på några dagar, inte månader. Kosmos arbetar autonomt, läser litteratur, genererar hypoteser, styr utredningar och utför vetenskapliga arbetsflöden. Den unterstütjer hela livscykeln för läkemedelsutveckling, från målidentifiering till klinisk utveckling och ansökan. AI-verktyget samarbetar med mänskliga forskare via Slack, Teams och e-post, och lär av organisationens kunskap, bygger på experimentell historia och egen vetenskaplig data.
Radbrytning av kriterier
- Autonom hypotesgenerering
- Litteraturanalys
- Dataanalys
- Vetenskaplig arbetsflödesutförande
- Samarbete via Slack, Teams och e-post
- Modellagnostisk för framtida toppmodeller

THEUS (Aigora)
Företags-AI-forskningsystem som omsätter egendomliga studier till spårbara inblickar med fact-IDs, citationer och expertavatar för syntes.

THEUS är en affärsteknisk AI-forskningssystem som omvandlar företagets egna undersökningar till spårbara insikter med faktoider, citeringar och expertavatarer. Det byggs på Googles Agent Development Kit (ADK) och använder bidirectionella modeller för data-baserade kunskapsaktörer. Användaren kan utvinna, syntetisera och utforska deras forskningsdata, och varje påstående stöds av en specifik Fact ID med sidnivå-citeringar. THEUS erbjuder två sätt att utforska: att generera nya insikter med Dr. Reed eller att analysera befintlig kunskap med Dr. Sinclair. Den här plattformen är utformad för verkställande direktörer för insikter (VPs of Insights), globala sensoriska ledare och innovationsledare som utvärderar byggandet av strategisk kapacitet. Den använder ett forskningsbrett forskningsmetodik, inte generisk företags-AI, och skapar dataunderbyggda kunskapsagenter som tränats på verkliga institutdata. Med tanke på att 85% av nya produkter misslyckas inom två år (Nielsen) förbättras beslutskvaliteten dramatiskt genom bevisbaserad utforskning. THEUS erbjuder ett enskilt licensavtal, som inkluderar funktioner såsom högst 30 dokument som kan importeras per månad, högst 1 500 sidor som kan räknas ut per månad, samt högst 500 frågor som ställs till Dr. Sinclair per månad. En av de viktigaste fördelarna med THEUS är dess förmåga att omvandla decenniers värdefull företagsdata till spårbara och beslutsfasta intelligen med hjälp av AI-drivna kunskapsagenter.
Radbrytning av kriterier
- Extractor och synte för forskningsdata
- Generera nya inblickar med Dr. Reed eller analysera befintlig kunskap med Dr. Sinclair
- Bipolärt modellering för datagrundad kunskapsagenter
- Anslut produkttillverkning- och konsumentkännedom för bipolärt insikt
- Stödjer kors-studie-syntes och forskningsluckan analys

AMIE
En multimodal AI-diagnostisk agent som genomför kliniska samtal och tolkar medicinska bilder för att ge korrekta diagnoser.

AMIE (Articulate Medical Intelligence Explorer) är en forskningsbaserad AI-diagnostisk agent utvecklad av Google DeepMind och Google Research. Den är utformad för att genomföra kliniska samtal och tolka medicinska bilder för korrekta diagnoser. Ursprungligen var AMIE en textbaserad medicinsk diagnostisk konversationell AI-agent som publicerades i Nature. Den senaste utvecklingen, multimodala AMIE, integrerar förmågan att intelligenta begära, tolka och resonera kring visuella medicinska uppgifter under kliniska samtal. Denna utveckling syftar till att förbättra diagnostisk noggrannhet genom att införliva multimodala data, såsom bilder och dokument, i den diagnostiska processen. AMIE använder ett tillståndsmedvetet resonansramverk och bygger på multimodala Gemini-modeller. Den har utvärderats genom expertbedömningar, inklusive Objective Structured Clinical Examinations (OSCEs), där dess prestanda jämfördes med primärvårdsläkare (PCP) i olika patientscenarier.
Radbrytning av kriterier
- Multimodalt diagnostiskt samtal
- Visuell tolkning av medicinsk information
- Tillståndsmedveten resonemangsram
- Integration med Gemini-modeller
- Simuleringsmiljö för dialogutvärdering

QualiaInterviews
Plattform för artificiell inledning av forsknings- och utvärderingsintervjuer i flera språk och konversation på skal

QualiaInterviews är en forskningsplattform som använder AI för att genomföra intervjuer med deltagare genom naturlig, konversationell dialog. Den möjliggör för team att samla in kvalitativa insikter från större urval än traditionella en-till-en intervjuer tillåter, medan den bevarar djupet och nyanserna av öppna, öppna konversationer. Verktyget stöder intervjuer på flera språk, vilket gör det lämpligt för tvärforskningsstudier, global marknadsforskning och programvärdering. Forskarna kan designa intervjuguider, distribuera dem till deltagare och recensera automatiskt strukturerade resultat utan att manuellt moderera varje session. QualiaInterviews används vanligtvis av sociologer, utvärderare, UX-team och organisationer som utför impactutvärderingar som behöver skalbara kвалитativa uppgifter utan att kompromissa med konversationell djupgång.
Radbrytning av kriterier
- AI-modererade konversationella intervjuer
- Multispråkigt intervjustöd
- Automatiserade uppföljande frågor
- Strukturerad analys av kvalitativa responser
- Skalbar utplacering av deltagare
- Research och utvärderingsarbetsflödesverktyg

Table Agent är ett AI-drivet dataassistent som är avsett att underlätta tabellforskning. Dess syfte är att automatisera datainsamlingsprocessen för något given ämne, för att göra forskningen mer effektiv. Verktyget tillåter anpassningsbara datastrukturer, vilket ger användarna möjligheten att anpassa sina datainsamlingar efter specifika behov. Denna flexibilitet är fördelaktig för ett brett spektrum av programvaruapplikationer och branscher där datastrukturen kan variera betydligt. I kärnan hos Table Agent ligger dess AI-agentdrivna data-sökfunktion. Detta innebär att verktyget använder artificiell intelligens för att aktivt leta upp och samla relevanta data, vilket potentiellt kan reducera tid och ansträngning som krävs för manuella sökningar. Även om detaljerna kring dess arbetsflöde och integreringar inte ges, antyder begreppet om en AI-driven dataassistent att det kunde smidigt integreras med olika dataanalysverktyg, vilket skulle förbättra den totala forskningsprocessen. De stora styrkorna för Table Agent torde omfatta dess förmåga att automatisera tröttsamma uppgifter i datainsamling och dess anpassningsförmåga till olika datamodeller. Men utan mer specifik information är det svårt att fastställa dess begränsningar eller hur det mäter för med alternativa dataassistentverktyg.
Radbrytning av kriterier
- Automatiserat insamlings av data
- Anpassbara datascheman
- Datadriven sökning med AI-ansvarig
- Snabba och exakta datauttag

Autoresearch
Ett öppen källkodsprojekt som låter AI-agenter köra LLM-träningsexperiment autonomt och behålla de bästa modellförändringarna.

Autoresearch är ett öppen källkodsprojekt som gör det möjligt för AI-agenter att självständigt köra LLM-träningsexperiment och behålla de bästa modelländringarna. Projektet gör det möjligt för användare att sätta upp en liten men riktig LLM-träningsmiljö och låta en AI-agent experimentera med den över natten, ändra koden, träna under kort tid och kontrollera om resultaten förbättras. Målet är att automatisera forskningsprocessen genom att låta AI-agenten utforska olika modellarkitekturer, hyperparametrar och optimeringsstrategier utan mänsklig inblandning. Projektet innehåller en förenklad single‑GPU-implementation av nanochat och erbjuder en grundläggande struktur för att programmera AI-agentens forskningsprocess med Markdown-filer. Projektet är utformat för att vara utökningsbart, så att användare kan lägga till fler agenter och förbättra forskningsprocessen över tid.
Radbrytning av kriterier
- Autonoma LLM-träningsexperiment
- Forskning driven av AI-agenter
- Enkel-GPU-implementation av nanochat
- Markdown-baserad programmering för forskningsprocessen
- 5-minuters träningsbudget med utvärderingsmetrik (val_bpb)







