지난 배틀 · 2024-12-22 UTC
Agent Development 대결 — 2024년 12월 22일
Agent Development 카테고리에서. 4개의 참가자에 걸쳐 15 표시가 배치되었습니다. Vocode이(가) 왕좌를 차지했습니다.
최종 순위
출전 라인업
참가자들
이 배틀에 참가한 모든 도구의 프로필, 최종 점수순으로 순위가 매겨졌습니다.

Vocode는 음성 기반 대화식 인공지능应用을 구축하기 위한 오픈 소스 라이브러리이다. Vocode는 음성 인식, 거대 언어 모델 및 음성 합성을 하나의 실시간 파이프라인으로 연결시켜-developer들이 전화를 통해, 웹 소켓을 통해, 또는 지역 오디오를 통해 들어서, 사고하고 말할 수 있는 에이전트를 만들 수 있도록 개발해야합니다. 프레임워크는 주로 파이썬 API로 배포되며, 음성이 빠르게 전송되도록 하는 STREAMING 기능으로 주로 운영됩니다. 이로써 대화는 반응형으로 느껴지리라 말할 수 있으며, TURN-BASED 대화보다는 지연을 포함하는 DELAY가 적습니다. 그 외에 음성 에이전트를 구축하는 데 어려움을 초래하는 Orchestratoin에 대한 문제점, 예를 들어, 중단 (BARGE-IN)을 관리하고, 버퍼링 및 전송되는 음성 자막을 처리하는 전사(TRANSCRIBER)와 에이전트 로직, 그리고 합성음 synthesizer를 서로 조율하는 것들에 대해서도 다룹니다. Vocode는 모듈식이며 서비스 공급자 중립적인 설계로 되어 있습니다. 파이프 라인이 각 단계별로 third-party 서비스와 통합되며, 예를 들어 Deepgram과 AssemblyAI의 음성 인식 서비스, OpenAI의 언어 모델, ElevenLabs, Azure 등 텍스트를 음성으로 변환하는 엔진이 있습니다. 개발자들은 비용, 지연 시간, 음성 품질에따라 구성 요소를 교체 할 수 있습니다. 일반적인 사용 사례는 통신입니다: Vocode은 Twilio와 같은 제공자에 의해 전화 통화를 받고 호출하는 것을 지원하기 때문에 자동 주기 및 반 주기를 위한 외주 대리, 음성 도우미 및 고객 대면 전화 봇을 개발하기에 적합합니다. além으로, 이 도구는 이메일 클라이언트 내의 음성 경험을 위한 앱 내 인앱 음성 대화 및 로컬 마이크로폰 대화를 지원합니다 열쇠 자체가있는 오픈 소스와 Self-hostable으로, Vocode는 종속되어 있는 완전 관리형 플랫폼을 의존하지 않고 스택에 대한 통제권과 에이전트 동작을 개인화하고자 하는 팀에게 호환된다. 그러나 이에 대한 대가는 프로덕션 급의 음성 에이전트를 만들기 위해서는 여전히 외부 음성 전사, LLM, TTS 서비스를 결합하고 유료한 작업과 시청각 및 대화 동작을 조정하는 일과 같은 것을 수행하고, latency와 대화 동작을 조정해야한다. 보코드는 관리 플랫폼 및 기타 프레임워크와 함께 음성 에이전트 도구의 성장하는 영역에서 위치하고 있습니다. 주된 차별점은 개발자에게 파이프 라인이 internals에 직접 접근할 수 있는 개방된 소스, composable 접근 방식을 제공합니다.
평가 기준 분해
- 실시간 스트리밍 음성 어그먼트 파이프 라인
- 다양한 STT, LLM 및 TTS 제공자의 상호 연결
- Twilio 및 비슷한 유선 음성 서비스를 통한 전화 통화 지원
- 인터럽션 (가로 인입) 처리
- Python SDK를 통한 커스텀 에이전트 빌드
- 브라우저와 로컬 마이크로폰 대화 지원

MemGPT은 오픈 소스 프레임워크로서 장기 언어 모델(LM)의 고정된 문맥_window의 한계를 해결하기 위해 설계되었다. UC 버클리의 연구에서 시작된 프로젝트는, 운영 체제가 제한된 물리적 메모리를 관리하는 것 처럼, LLM의 제한된 문맥을 like paging와 계층적 메모리 계층을 사용해 모델에 큰 범위의 영구 메모리를 제공하는 아이디어를 소개했다. MemGPT 은 운영 체제 설계의 주요 접근방식에서 직접 빌린다. MemGPT 은 현재 모델의 프롬프트 창에 있는 토큰(인코텍스트 메모리)과 외부에 있는 컨텍스트에서 나누는 저장소 두 가지를 구분한다. LLM 자체에 함수 호출 도구가 제공된다. 정보를 이러한 계층 사이에서 어디에 저장할지, 중요한 фак트를 장기저장소에 저장, 관련된 과거 정보 검색, 자기 내부 메모리의 편집 등 언제 이동할지를 결정할 수 있다.이 자체 편집 동작은 에이전트에게 싱글 컨텍스트 창을 넘어서 한 대화 또는 문서를 보유하는 가속도 있는 상태를 유지할 수 있다는 것이며, 이것은 장기간 대화 또는 문서에서 일관되고 진화하는 상태를 유지할 수 있는 것이다. 기본 framework는 개발자가 장기 기억을 위한 사용자와 전 이전 상호 작용을 기억하는 대화 에이전트를 구축할 때도 사용되고, 문서 분석을 위해 저장할 수 있는 범위 밖의 대규모 데이터 집합도 사용되는 경우에 있다. 사용자 기억, 보관 장치, 운영 맥락을 관리하여, 개발자가 각 사례를위한 전송 труб구조를 수동으로 구성해야 하는 것을 피하고, 개발자가 매 번 매뉴얼 에이전트가 전 과정에서 참고할 수 있는 구체적인 정보를 명시적으로 구성할 필요 없이, 에이전트가 과거와 이전 대화에서 정보를 참조할 수 있도록 해서, 에이엔트를 위한 framework인 MemGPT를 제공한다. MemGPT은 OpenAI와 같은 독립적인 모델 및 로컬에서 호스팅하는 Open 모델과 함께 작동하며, 벡터 데이터베이스 및 다른 저장 백엔드와의 통합을 통해 세션 간 메모리를 지속한다. 이 프로젝트는 나중에 Letta라는 회사 및 플랫폼과도 밀접한 관련을 맺은 것으로 발전했고, 원래 아이디어의 주변에 있는 서버 및 도구와 관련한 기반 상태 에이전트 개념의 개발 ongoing. 메모리GT의 주요 강점은 개념적 명확성과 더 나은 방식의 Long-term memory 패턴, 즉 단순한 검색 및 생성 증강 보충만큼 더 긴 치유 메모리로 전환하는 재사용 가능한 구체적인 스크립트다. 경쟁 프레임워크에서는 보통의 에이전트 프레임워크의 손실이 발생한다. 자기 편집 메모리 루프는 모델의 함수 호출 신뢰도에 의존적이므로, 작은 모델이나 지역 모델에서 신뢰도가 변할 수 있으며, 추가 메모리 관리 단계는 지연 시간과 토큰 오버헤드를 낸다. 계속해서 진화하고 있는 오픈 소스 프로젝트이므로, 이름, API, 주위 생태계가 시간과 함께 이동하고 있다. 이는 문서화 및 버전 관리를 위해 언제나 이동하는 표 표를 만든다는 것을 의미한다.
평가 기준 분해
- 층계층적 컨텍스트 및 외부 메모리 관리
- 자기수정 Core 메모리 함수 호출'
- 도서와 검색 메모리 저장
- 벡터 데이터베이스 통합을위한 검색
- 멀티 LLM 백엔드 지원
- 상태있는 대화 에이전트

Letta AI는 개방 소스 플랫폼으로, 가상 지능 요원 생성을 위한 설계가 있습니다. 이러한 요원은 장기 기억 및 고급 이 reasoning 능력을 가진다. 이 플랫폼은 개발자들이 과거 상호작용의 기록을 유지할 수 있는 AI 요원 빌드를 허용합니다. 이러한 기록을 바탕으로 더 복잡한 및 상황적 의사 결정을 위한 프로세스를 가능하게하는 것입니다. 특히, 이 기술은 시간이 지남에 따라 경험을 학습하고 대응하는 응답을 적응하는 요원으로 작동하는 애플리케이션에 유용합니다. Letta AI는 다양한 응용 프로그램에 고급 AI 요원 개발에 관심이 있는 개발자 및 연구자들을 목표로 하고 있습니다. Letta는 고객 서비스부터 훨씬 더 복잡한 문제 해결 임무까지의 다양한 임무를 다룰 수 있을 만큼 더 높은 수준의 자율성 및 지능을 가진 AI 요원을 만들 수 있도록 장기 기억과 고급 이 reasoning을 제공합니다.
평가 기준 분해
- 상태 기반의 인공지능 에이전트
- 장기 기억
- 심층이론적推論

무소이아는 오픈에서 AI 에이전트 및 애플리케이션을 만들기 위한 커뮤니티 구축 플랫폼입니다. 개발자에게 AI 솔루션을 만들고, 조절하고, 배포하는 도구를 제공하며, 프로젝트 간 협력과 투명성을 증진시키는 것을 목표로 합니다. 플랫폼은 개방성의 중요성을 강조하고, 사용자가 자신의 작업물을 공유하고, 다른 사용자의 에ージェнт(의 일부)를 재가공하며, 자바스크립트(LLM) 구현 및 API 등의 AI 컴포넌트들을 위한 커뮤니티의 성장에 기여할 수 있도록 허용한다. 이러한 접근법의 목표는 AI 개발에 대한 진입장벽을 낮추었으며, 건축가의 사이버페이스(?) 상에서 지식 공유를 장려하고 있다. 만들고 싶은 AI 워크 플로의 수준에 상관없이 일관적인 AI 환경을 위한 Infra 및 커뮤니티를 제공하는 Mosaia는 이터레이트 가능한, 오픈의 개발을 지지하는 장을 마련했습니다.
평가 기준 분해
- AI 에이전트 구축 도구
- 개방된 공유 및 협력
- 커뮤니티 주도 시장
- 사용자 지정 에이전트 워크플로
- 개발자 중심 플랫폼
- 배포 Infrastructure







