Минула битва · 2024-12-22 UTC
Agent Development Протистояння — 22 грудня 2024 р.
З категорії Agent Development. 15 позначок поставлено серед 4 бійців. Vocode здобув корону.
Підсумкові результати
Учасники
Бійці
Профілі кожного інструмента, який змагався в цій битві, ранжовані за підсумковим балом.

Vocode
Відкритий фреймворк для створення голосових AI-агентів у реальному часі з компонентів Speech-to-Text, LLM та Text-to-Speech

Вocode – вільна бібліотека для побудови голосових конверсацій для інтелектуальної системи підтримки. Вона забезпечує необхідну архівну частину під'єднання розпізнавання мовлення, великих мовних моделей і мови штучного мовлення в єдиний поточний флоув, що дозволяє розробникам створювати агентів, які можуть слухати, розбиратися та розмовляти під час телефонних викликів, вебсокетів чи місцевого аудіо. Фреймворк розподіляється головним чином як Python SDK, з акцентом на стримінгу аудіо, щоб розмови виглядали швидко реагуючими, а не залежними від черговості з довгими затримками. Він обробляє проблеми організаційних заходів, які заважають створенню голосових агентів безпосередньо, таких як управління порушенням (перехоплення), буферизації та передачі трансляцій і координації переднього краю між транслятором, логікою агента та синтезатором. Вocode розроблений під модульну концепцію та безумовну вірогідність щодо вибору провайдерів послуг. Він інтегрується зі рядом зовнішніх послуг для кожного етапу поточного виробництва — наприклад, з послугами транскрипції, якими є Deepgram та AssemblyAI, мовними моделями, такі як ті, що є під відкритими джерелами від OpenAI, а також з сервісами перетворення звуку на текст, включаючи ElevenLabs, Azure та інших. Розробники можуть замінювати різні компоненти залежно від вимог щодо вартості, затримки та якості звуку. Хоча іспитувати найбільш розповсюджену галузь використання, можна зазначити, що зв'язок через телефоні є однією із найпоширеніших галузей застосування Vocode. Вона забезпечує підтримку здійснення та прийому телефонних розмов через провайдерів, наприклад, Twilio, чим робить її ідеальним інструментом для створення програм автоматизованого проведення зовнішніх і внутрішніх телевікеров, голосових помічників і телефонних ботів із зовнішнім інтерфейсом користувача. Крім того, вона підтримує проведення конверсацій із використанням локальної мікрофона або браузерної інтерфейсу для створення інбудованих голосових досвідів у додатках. Бо він відкритий код та можна самостійно його розміщувати на своєму сервері, Vocode приваблює команди, які бажають мати контроль над своїми технологіями та мати змогу індивідуально налаштовувати поведінку агентів, а не покладатися на повністю керований закритий платформу. Але є відмінниця, якщо створювати продуктивну версію голосових агентів ще потрібно поєднувати кілька зовнішніх послуг транскрибації, LLM, TTS та встановлювати оптимальну затримку та поведінку в розмові. Є частиною зростаючого середовища інструментів голосових агентів поряд із керованими платформами та іншими фреймворками; своє головне відрізнення становить відкритий інструментарій за відкритою ліцензією, що надається розробникам безпосередній доступ до внутрішніх процесів системи.
Розподіл критеріїв
- Потоковий конвеєр голосового агента в реальному часі
- Інтеграція з багатьма провайдерами STT, LLM та TTS
- Підтримка телефонних дзвінків через Twilio та подібні телекомунікаційні сервіси
- Обробка переривань (barge-in)
- Python SDK для створення власних агентів
- Підтримка розмов у браузері та локальним мікрофоном

MemGPT
Фреймворк, що надає LLM довгострокову пам'ять та самостійно керований контекст за межами фіксованих обмежень токенів

MemGPT — це фреймворк з відкритим вихідним кодом, призначений для вирішення однієї з фундаментальних обмежень великих мовних моделей: їхнього фіксованого вікна контексту. Походить від досліджень в Університеті Берклі, проект ввів ідею розглядати обмежений контекст LLM як операційну систему, що керує обмеженою фізичною пам'яттю, використовуючи сторінкування та ієрархічні рівні пам'яті, щоб дати моделям вигляд набагато більшої, постійної пам'яті. Основний підхід безпосередньо запозичує ідеї з дизайну операційної системи. MemGPT розрізняє між пам'яттю в контексті (токени, що зараз знаходяться у вікні підказки моделі) та зовнішнім сховищем, що знаходиться поза контекстом. Самій LLM надано інструменти виклику функцій, які дозволяють їй вирішувати, коли переміщати інформацію між цими рівнями — наприклад, зберігати важливі факти у довгострокове сховище, отримувати відповідну інформацію минулого чи редагувати власну основну пам'ять. Така поведінка, що самостійно редагується, дозволяє агентам підтримувати зв'язний, такий, що змінюється, стан протягом тривалих розмов або документів, які далеко перевищують одне вікно контексту. Фреймворк призначений для розробників, що будують розмовні агенти, яким потрібна постійна пам'ять користувачів та попередніх взаємодій, а також для тих, хто працює над аналізом документів за корпусами, які занадто великі, щоб поміститися в контексті. Керує пам'яттю відкликання, архівним сховищем та робочим контекстом, MemGPT дозволяє агентам посилатися на деталі з набагато раніше під час взаємодії без необхідності ручного проектування трубопроводів отримання для кожного випадку. MemGPT працює як із пропрієтарними моделями, такими як моделі від OpenAI, так і з локально розміщеними відкритими моделями, та інтегрується із векторними базами даних та іншими сховищами для збереження пам'яті між сеансами. Проект пізніше розвинувся та тісно пов'язаний із Letta, компанією та платформою, що продовжує розвиток основних концепцій Stateful-агентів, пропонуючи сервер та інструменти навколо вихідних ідей. Його основні переваги — концептуальна ясність та конкретний, багаторазово використовуваний шаблон для довгострокової пам'яті, що виходить за межі наївного отримання інформації, доповненого генерацією. Компроміси типові для фреймворків агентів: цикл пам'яті, що самостійно редагується, сильно залежить від надійності виклику функцій моделі, яка може змінюватися з меншими або локальними моделями, а додаткові кроки керування пам'яттю додають затримку та витрати токенів. Як такий, що розвивається, фреймворк з відкритим вихідним кодом, його найменування, API та навколишнє середовище змінювалися з часом, що може зробити документацію та версіонування рухомим цілями.
Розподіл критеріїв
- Ієрархічне керування контекстом та зовнішньою пам'яттю
- Самостійне редагування основної пам'яті за допомогою викликів функцій
- Сховище архівної та пам'яті відкликання
- Інтеграція із векторними базами даних для отримання інформації
- Підтримка кількох бекендів LLM
- Стабільні розмовні агенти

Letta AI
Відкрита платформа для створення штучних інтелектуних агентів зі станційним управлінням та розвиненим розумінням.

Платформа Letta AI призначена для створення штучних інтелектуних агентів зі станційним управлінням зі збереженою пам'яттю та розвиненим розуміннем. Якість розвиток агентів, здатних зберігати інформацію про попередні взаємодії, що забезпечує більш складну та контекстно-орієнтовану прийом прийняття рішень. Це особливе користування, особливо тоді, коли потрібні агенти, здатні навчитися від попередніх досвідів та відповідати відповідно. Letta AI спрямована на розробників та дослідників, які цікавляться створенням розвинених штучних інтелектуних агентів для різних застосувань, починаючи від служби клієнта та закінчуючи складнішими завданням розв'язування проблем. Застосування зберігання інформації та розвиненого розуміння, Letta AI дозволяє розробити агентів штучного інтелекту, які можуть виконувати низку завдань зі вищою ступенем самодостатності та інтелектність.
Розподіл критеріїв
- Штучні інтелектуальні агенти зі станційним управлінням
- Станційне управління
- Розвинений розумінь

mosaia
Відкрита платформа для спільної розробки, публікування та розгортання агентів штучного інтелекту

Mosaia — платформа, керована спільнотою, призначена для розробки агентів та застосунків штучного інтелекту у відкритому форматі. Вона надає розробникам інструменти для створення, налаштування та розгортання рішень штучного інтелекту, одночасно сприяючи співробітництву та прозорості проєктів. Платформа підкреслює відкритість, дозволяючи користувачам ділитися своєю роботою, змінювати агенти інших користувачів та сприяти зростанню екосистеми компонентів штучного інтелекту. Такий підхід має на меті знизити бар'єр для входу в розробку штучного інтелекту, заохочуючи водночас поділ знаннями між розробниками. Незалежно від того, чи ви створюєте прототип окремого агента чи збираєте більш складний робочий процес штучного інтелекту, Mosaia пропонує інфраструктуру та спільноту для підтримки ітеративної відкритої розробки.
Розподіл критеріїв
- Інструменти для створення агентів штучного інтелекту
- Відкрите публікування та співробітництво
- Керований спільнотою ринок
- Настроювані робочі процеси агентів
- Платформа, орієнтована на розробників
- Інфраструктура розгортання



