Минула битва · 2024-05-31 UTC
Research AI Agents Протистояння — 31 травня 2024 р.
З категорії Research AI Agents. 34 позначок поставлено серед 8 бійців. Google AI Co-Scientist здобув корону.
Підсумкові результати
Учасники
Бійці
Профілі кожного інструмента, який змагався в цій битві, ранжовані за підсумковим балом.

Google AI Co-Scientist
Мультиагентний інтелектуально-підтримуваний науковий співпартнер, який співпрацює зі вченими для генерації гіпотез та прискорення біомедичної досліджень.

Google AI Co-Scientist - це багатогранна система штучного інтелекту, розроблена для співпраці з вченими та прискорення біомедичних досліджень. Її створено з Gemini 2.0 та вона виконує функцію віртуального наукового співробітника, який допомагає створювати нові гіпотези та проекти наукових досліджень. Система спроєктована для відображення процесу роздумування, який лежить в основі науково-дослідної методиці, та відкриваючи нова, оригінальна знання. В залежності від науково-дослідної мети вченого, вказаної природною мовою, AI Co-Scientist створює нові науково-дослідні гіпотези, детальний науково-дослідний огляд та експериментальне протоколи. Для цього вона використовує коаліцію спеціалізованих агентів, зокрема Generation, Reflection, Ranking, Evolution, Proximity, та Meta-review, які використовують автоматичні відгуки для ітеративної генерації, оцінки та вдосконалення гіпотез. Система дозволяє вченим взаємодіяти з нею різними способами, зокрема шляхом надання насіння для вивчення або відгуків на згенеровані виходи природною мовою. AI Co-Scientist також використовує інструменти, такі як пошук у мережі та спеціалізовані моделі штучного інтелекту, для підвищення ґрунтовності та якості згенерованих гіпотез. Система розроблена для підтримки вільної зміни обчислювальних ресурсів та ітеративного вдосконалення науково-дослідної міркування відповідно до вказаної науково-дослідної мети. Навчальний інструмент AI Co-Scientist особливо вигідно виглядає для вчених, що стикаються із викликами при навігації в швидкому зростанні наукових публікацій та інтеграції інсайтів з непознаних галузей. Використавши останні досягнення в галузі AI, включно з можливістю синтезу у складних галузях та виконання довгострокової плани та висновків, AI Co-Scientist сприяє підвищенню швидкості відкриттів у галузі науково-технічних та біомедичних досліджень. Система була піддана випробуванню у різних застосуваннях, включаючи відкриття генної передачі та повторне відкриття генної передачі. Бажані вигоди від AI Co-Scientist залежать від якості вихідного дослідницько-голівного завдання та здатності вченого надавати корисні висновки. AI Co-Scientist - це новий інструмент, що має потенціал суттєво вплинути на наукове співтовариство, проте його обмеження та потенційні упередженості потрібно об'єктивно оцінити. Вирішення питань AI Co-Scientist являє собою постійну роботу, а його майбутні застосування та вдосконалення будуть залежати від продовженої дослідницької та випробувальної роботи.
Розподіл критеріїв
- Виробництво гіпотез
- Сворення огляду наукових досліджень
- Розробка експериментальної програми
- Виконавці спеціалізовані для наукового мислення
- Автоматизований ланцюг відкликань
- Інтеграція веб-пошуків

Bright Data Web MCP
Сервер MCP, який забезпечує вірну пошукові агентам, скраплівання веб-сторінок і автоматизацію веб-браузерів із 5 000 вільними запитами на місяць.

Веб-сервер MCP від Bright Data використовується для надання АІ-агентам надійної можливості пошуку, скраплівання даних та автоматизації веб-браузерів. Сервер надається з можливістю виконання 5 000 вільних запитів на місяць. Інструмент дозволяє АІ-агентам ефективно виконувати пошук у веб-міжінародному просторі, збирати дані і здійснювати навігацію веб-сторінок без блокування. Сервер MCP також передбачає такі функції як отримання інформації в реальному часу, виділення даних зі сторінок, скраплівання сайтів та їх подальша навігація, а також можливістю виконувати автоматизовані заходи. Крім того MCP здатний відкинути блокування та обмеження і вже понад 20 000 клієнтів його довірюють.
Розподіл критеріїв
- Пошук в реальному часі
- Скраплінг даних та навігація по сайтам
- Автоматизація роботи браузера
- Відкидання геообмежень та CAPTCH
- Рендеринг JavaScript для динамічних даних
- Мімічна поведінка справжнього користувача

Kosmos
Автономний науковий співробітник за допомогою штучного інтелекту для довгих дослідницьких кампаній, який аналізує дані та наукові статті, щоб видав повністю цитовані наукові доповіді.

Є автономний штучний інтелект науковий співробітник для біо-фармацевтичних команд R&D та співробітників досліджень. Він аналізує дані та наукові статті, щоб видав повністю цитовані наукові доповіді, прискорюючи процес розвитку лікарських засобів від гіпотези до реєстрації протягом днів, а не місяців. Kosmos працює автономно, читаючи наукові статті, генеруючи гіпотези, керуючи дослідженнями та виконуючи наукові workflow. Він підтримує повний життєвий цикл розвитку лікарських засобів, починаючи від ідентифікації цілей до клінічної розробки та реєстрації. Штучний інтелект інструмент співпрацює з науковцями людиною за допомогою Slack, групи Microsoft Teams та електронної пошти та вчиться у організації знань, будувавши експериментальну історію та власницькі наукові дані.
Розподіл критеріїв
- Автономне створення гіпотез
- Аналіз наукових статей
- Аналіз даних
- Виконання наукові workflow
- Співпраця за допомогою Slack, групи Microsoft Teams та електронної пошти
- Єagnosticний для майбутніх штучних інтелектних моделі

THEUS (Aigora)
Корпоративна система штучного інтелекту для досліджень, що перетворює власні дослідження в відстежувані інсайти з ID фактів, цитатами та експертними аватарками для синтезу.

THEUS – корпоративна система штучного інтелекту, яка перетворює власні дослідження в відстежувані інсайти з ID фактів, цитатами та експертними аватарками. Заснована на Google’s Agent Development Kit (ADK) і використовує двобічне моделювання для агентів знань, основаних на даних. Користувачі можуть витягувати, синтезувати й досліджувати свої дані, а кожне твердження підтримується конкретним Fact ID із посиланням на конкретну сторінку. THEUS пропонує два способи досліджень: генерувати нові інсайти з Dr. Reed або аналізувати існуючі знання з Dr. Sinclair. Платформа розроблена для віце-президентів з інсайтів, світових лідерів у сенсорних технологіях та інноваційних керівників, які оцінюють можливості стратегічного розвитку. Вона використовує спеціальну методологію досліджень, а не загальний корпоративний ШІ, і створює агенти знань, навчених на реальних інституційних даних. З 85 % нових продуктів, що зазнають невдачі протягом двох років (Nielsen), доказове дослідження суттєво покращує якість прийняття рішень. THEUS пропонує окремий доступ, що включає можливість обробляти до 30 документів на місяць, до 1 500 сторінок, а також до 500 запитів до Dr. Sinclair на місяць. Однією з ключових переваг THEUS є здатність перетворювати десятиліття власних даних у відстежувану, готову до рішення інтелігенцію, керовану ШІ-агентами знань.
Розподіл критеріїв
- Витягувати, синтезувати й досліджувати дані досліджень
- Генерувати нові інсайти з Dr. Reed або аналізувати існуюче знання з Dr. Sinclair
- Двобічне моделювання для агентів знань, основаних на даних
- Підключення знань про продукт та споживача для двобічного інсайту
- Підтримка крос-стаді синтезу та аналізу прогалин у дослідженнях

AMIE
Мультимодальний агент діагностики AI, що проводить клінічні розмови та інтерпретує медичні зображення для точних діагнозів.

AMIE (Умільна медична інтелектуальна досліджувачка) - це дослідницький агент діагностики AI, розроблений компанією Google DeepMind та Google Research. Він призначений для проведення клінічних розмов та інтерпретації медичних зображень для точних діагнозів. На початку, AMIE був текстовим агентом діагностичних спілкувань з лікарів публікованим у Nature. Останнє вдосконалення AMIE, мультимодальний AMIE, інтегрує можливість інтелектуально запитувати, інтерпретувати та роздумувати про візуальну медичну інформацію під час клінічних розмов. Ця розробка передбачає поліпшення діагностичної точності шляхом включення мультимодальної інформації, такі як зображення та документи, в процес діагностики. AMIE використовує стоврінський роздумувальний framework та створений на основі моделей мультимодальної Gemini. Його дослідили шляхом експертних оцінок, включаючи Об'єктивно Стоврінські Клінічні Екзамени (OSCEs), порівнюючи його результати зі спеціалістами сімейної медицини (PCPs) у різних пацієнтів сценаріях.
Розподіл критеріїв
- Мультимодальна діагностична бесіда
- Інтерпретація візуальної медичної інформації
- Фреймворк роздумувальної станції
- Вбудовування з моделями Gemini
- Сімуляційна основа для оцінки діалогу

QualiaInterviews
AI-керована платформа для багатомовних, розмовних досліджень і оцінювальних інтерв'ю у великому масштабі.

QualiaInterviews — це платформа досліджень, яка використовує AI для проведення інтерв'ю з учасниками через природний, розмовний діалог. Вона дозволяє командам збирати якісні інсайти з більшої вибірки, ніж це дозволяють традиційні інтерв'ю один на один, зберігаючи при цьому глибину й нюанси відкритої бесіди. Платформа підтримує інтерв'ю на кількох мовах, що робить її придатною для міжкордонних досліджень, глобального ринкового дослідження та оцінки програм. Дослідники можуть створювати посібники для інтерв'ю, розгортати їх учасникам і переглядати автоматично структуровані висновки без ручного модерації кожної сесії. QualiaInterviews зазвичай використовується соціальними дослідниками, оцінювачами, командами UX та організаціями, що проводять оцінку впливу, які потребують масштабованих якісних даних без жертви глибини розмов.
Розподіл критеріїв
- AI-містка модерація розмовних інтерв'ю
- Підтримка багатомовних інтерв'ю
- Автоматичні додаткові запитання та розслідування
- Структурований аналіз якісних відповідей
- Масштабоване розгортання учасників
- Інструменти робочого процесу дослідження і оцінки

Table Agent — це AI‑підтримуваний асистент даних, створений для допомоги у табличних дослідженнях. Він призначений для автоматизації процесу збору даних про будь‑яку тему, що робить дослідження більш ефективним. Інструмент дозволяє налаштовувати схеми даних, що дає користувачам можливість підлаштовувати збір даних під конкретні потреби. Така гнучкість корисна для широкого спектру застосувань і галузей, де структура даних може значно варіюватися. У центрі функціональності Table Agent лежить можливість пошуку даних, керована агентом ШІ. Це означає, що інструмент використовує штучний інтелект, щоб активно знаходити й збирати релевантні дані, що потенційно зменшує час і зусилля, потрібні для ручних пошуків. Незважаючи на те, що деталі його робочого процесу та інтеграцій не розкриті, концепція AI-керованого помічника даних припускає, що він може безшовно інтегруватися з різноманітними інструментами аналізу даних, підвищуючи ефективність усього дослідницького процесу. Сильні сторони Table Agent, ймовірно, включатимуть його здатність автоматизувати утомні завдання збору даних та адаптивність до різних структур даних. Однак, без додаткової конкретної інформації важко визначити його обмеження або порівняти з альтернативними інструментами-асистентами даних.
Розподіл критеріїв
- Автоматизований збір даних
- Налаштовувані схеми даних
- Пошук даних на основі AI‑агента
- Швидке та точне отримання даних

Autoresearch
Проєкт відкритого вихідного коду, який дозволяє самостійним роботам із інтелектуальної власности здійснювати експерименти щодо навчання мовних моделей і зберігати найкращі зміни.

Autoresearch є проєктом відкритого вихідного коду, який надається користувачам можливість самостійнім роботам із інтелектуальної власности здійснювати експерименти щодо навчання мовних моделей та зберігати найкращі зміни. Проєкт дозволяє користувачам встановити малий, але справжній середовище навчання мовних моделей та дозволити роботі самостійно експериментувати протягом ночі, змінюючи код, тренуючи протягом невеликого періоду часу та перевіряючи, чи покращилися результати. Важливою метою цього проєкту є автоматизація процесу досліджень, щоб робота самостійно досліджувала різні архітектури мовних моделей, гіперіпарметри та стратегії оптимізації без втручання людини. Проєкт включає в себе упрощений імплементацію мови nanochat на одній графічній карті GPU і надає основну структуру для програмування процесу досліджень роботи самостійно за допомогою файлів Markdown. Проєкт призначений для розширення, що дозволяє користувачам додавати додаткові роботи та вдосконалювати процес досліджень у часі.
Розподіл критеріїв
- Самостійні експерименти щодо навчання мовних моделей
- Процес досліджень, керований роботами із інтелектуальної власности
- Імплементація мови nanochat за допомогою однієї графічної карти GPUs
- Маркдаун-орієнтоване програмування процесу досліджень
- Бюджет часу тренувань протягом 5 хвилин із оціночною метрикою (val_bpb)







