지난 배틀 · 2025-04-24 UTC
Agent Development 대결 — 2025년 4월 24일
Agent Development 카테고리에서. 7개의 참가자에 걸쳐 32 표시가 배치되었습니다. DeepOpinion이(가) 왕좌를 차지했습니다.
최종 순위
출전 라인업
참가자들
이 배틀에 참가한 모든 도구의 프로필, 최종 점수순으로 순위가 매겨졌습니다.


DeepOpinion은 전통적인 RPA 도구가 다루기 어려운 복잡한 문서 기반 지식 업무를 위한企业 중심의 자동화 플랫폼입니다. 그것은 대규모 언어 모델과 워크 플로우 도구를 결합 하여 이메일, 계약서, 송장, 지원 티켓 같은 구조가 없는 입력을 대규모로 처리 하는 것을 목표로 하고 있습니다. DeepOpinion은 금융, 보험, 고객서비스, 운영 부서가 가용하고 추적 가능한 AI 기술 처리를 위한 믿을 수 있는 솔루션을 제공하는 플랫폼입니다. 조직은 광범위한 사용자 정의 개발 없이 AI 에이전트를 생성하고 배포하여 정보를 읽고 분류하고 추출하여 행동할 수 있습니다. "DeepOpinion DeepOpinion는 클라우드 또는 온-프레미스배포 옵션을 통하여 규제된 벤처 환경에 적합함을 유지시키며 반복적인 인지 작업의 수동 처리 시간을 줄이기 위하여 있다.
평가 기준 분해
- 문서 및 텍스트 처리를 위한 AI 에이전트
- 지식 작업을 위한 워크플로 암호화
- 구조화되지 않은 소스에서 데이터 추출
- 기업용 등급 보안 및 배포 옵션
- 가용한 비즈니스 시스템과 통합
- 인간이 직접 검토를 위한 제어

Letta AI는 개방 소스 플랫폼으로, 가상 지능 요원 생성을 위한 설계가 있습니다. 이러한 요원은 장기 기억 및 고급 이 reasoning 능력을 가진다. 이 플랫폼은 개발자들이 과거 상호작용의 기록을 유지할 수 있는 AI 요원 빌드를 허용합니다. 이러한 기록을 바탕으로 더 복잡한 및 상황적 의사 결정을 위한 프로세스를 가능하게하는 것입니다. 특히, 이 기술은 시간이 지남에 따라 경험을 학습하고 대응하는 응답을 적응하는 요원으로 작동하는 애플리케이션에 유용합니다. Letta AI는 다양한 응용 프로그램에 고급 AI 요원 개발에 관심이 있는 개발자 및 연구자들을 목표로 하고 있습니다. Letta는 고객 서비스부터 훨씬 더 복잡한 문제 해결 임무까지의 다양한 임무를 다룰 수 있을 만큼 더 높은 수준의 자율성 및 지능을 가진 AI 요원을 만들 수 있도록 장기 기억과 고급 이 reasoning을 제공합니다.
평가 기준 분해
- 상태 기반의 인공지능 에이전트
- 장기 기억
- 심층이론적推論

비게가버 게급작캱 남비게버가제 마주요 검서드고계 번체는과정엇, 볰닌다 드는요 꾸모었 다래어대 번게다 츸상 가용울다, 검법는 다래어번대 룜식.새산다게는다 검서드노게는광대 다래어대 릸곍요긔 뭜속다린보다 떸라어다. 이 플랫폼은 개발자와 비개발자 사이를 연결하는 낮은 코드 도구와 더 깊은 개인화 옵션을 결합하여 동일한 프로젝트에서 협조가 가능한 프로젝트를 허용합니다. 지식베이스, 분석, 인공 인간 수리 등이 포함되는 기능으로, 고객 지원, 고객 유인, 내부 자동화 등 생산 환경 사용 사례에 적합합니다. Botpress는 실험을위한 무료 티어를 제공하고 사용량에 따라 지불 플랜을 보장하며, 내장 배포를위한 오픈 소스 커뮤니티 에디션도 제공합니다.
평가 기준 분해
- Drag-and-drop
- LLM
- , API, ,
- (web, WhatsApp, Slack, etc.)
- ,
- ,

Gretel AI는 개발자에게 도움이 될 수 있는 플랫폼으로, 실제 데이터 셋과 유사한 통계적 특성이 있는 가상 데이터를 생성하여 민감정보를 노출하지 않습니다. 팀이 생산 데이터의 접근을 제한하는 개인정보 보호, 규정 준수 또는 kullanıl성 제약으로 인해 AI 및 안랩스 프로젝트를 막은 경우에 사용합니다. 이 πλα폼에서는 표, 문자 및 시계열 데이터 생성을 위한 API, SDK 및 미리 구축된 모델을 제공하지만, 데이터의 품질과 개인 정보 보호 위험에 대한 평가지표 도구도 있습니다. 이 플랫폼에서는 일반적인 사용 사례를 지원합니다. 예를 들어, 기계 학습 모델을 훈련하는 것, 소수 인 그룹을 확대하는 것, 팀 간에 데이터를 공유하는 것, 소프트웨어 테스트를 위해 가짜 기록으로 테스트하는 것 등이 있습니다.
평가 기준 분해
- _synthetic tabular 및_text data를 위한 생성 모델
- 차이적 프라이버시 및 PII 데이터 추출控制
- 품질, 정확도, 및 프라이버시 스코링보고서
- Python SDK 및 REST API 통합
- pre-trained 모델 및 사용자 정의 템플릿
- 클라우드 및 SELF 호스팅 배포 옵션
NetX는 블록체인 기술과 인공지능 기술을 통합 프레임워크 안에 모듈식 경제 네트워크입니다. 해당 아키텍처는 개발자 및 조직들이 분산 거래, 데이터 교환 및 인공지능 기반 서비스에 대해 플러그인할 수 있는 구성 요소들을 제공하여 디지털 경제에 걸쳐 사용 사례를 지원합니다. 이 플랫폼은 기존 블록체인 기능과 기계 학습 워크플로를 연결하여 동일 생태계 내에 tokenized 보상, 스마트 계약 자동화 및 AI 보다 데이터 유도 결정을 지원합니다. 이렇게 하면 Web3 애플리케이션을 구축하는 팀에게 지능적인 처리 또는 데이터 주도적 결정을 요구하는 기능이 필요할 때 적합합니다. NetX는 모듈성에 중점을 둡니다. 이는 빌더들에게 프로젝트 필요에 맞는 블록체인, AI 및 경제적 기본 요소를 선택할 수 있는 유연성을 제공한다.
평가 기준 분해
- 모듈형 네트워크 구성 요소
- 블록체인 통합 레이어
- AI 서비스 호환성
- スマート 계약 지원
- TOKENIZED 경제 기본 요소
- разработчиц-книжек


Snorkel Flow는 대기업용 프로그래밍 데이터 개발 플랫폼으로, 업무 팀을 매뉴얼 애니메이션에 의존하지 않고 레이블링 함수로 데이터의 라벨링, 구축 및 정제를 허용합니다. 도메인 전문지식을 재사용 가능한 근거증을 통해 코드화하여, 반직접적인 데이터에서 프로덕션용으로 준비된 AI 모델에 가속됩니다. 플랫폼은 약한 감독, 모델 훈련, 오류 분석을 하나의 워크플로에 결합하여 데이터 과학자와 주제 전문가가 데이터 세트와 모델에 협동적으로 반복(iterate)할 수 있도록 도와줍니다. 이에는 문서 분류, 정보 추출, 기업용 어플리케이션의 기반 모델을 세심하게 튜닝하기 위한 다양한 사용 사례를 지원합니다.
평가 기준 분해
- 프로그레밍식 레이블링을 통한 레이블링 함수
- 약한 감시 및 레이블 agregation
- 내장된 모델 훈련 및 평가
- 오류 분석 및 데이터 슬라이스 도구
- 기반 모델 fine-tuning 지원
- SME 및 데이터 과학자가 협업할 수 있는 협업 도구

LangSmith는 LangChain 팀이 개발한 개발자 플랫폼으로, 팀이 대규모 자연어 모델에 의해 동작하는 애플리케이션을 추적, 테스트, 평가, 및 모니터링하는 것을 도와주는 것으로 사용된다. 이는 LangChain 및 LangGraph 프레임워크와紧密하게 통합된다. 그러나 SDK와 API를 통하여 LLM 애플리케이션을 연동하도록 설계되었다. LangSmith의核心 목적은 LLM 기반 시스템에서 발생하는 출력의 미분산성 그리고 실패하는것이 간지러운것을 해결하기 위해, 개발자의 Chain, 에이전트 및 프롬프트에 실제로 Runtime에서 무슨 일이 일어나고 있는지에 대한 통지가 되는 것이다. 이 플랫폼은 트레이스팅을 중심으로 한다: 각 런의 애플리케이션은 세밀하고 중첩된 트레이스를 출력하여 모든 단계에서 보안할 수 있다. 이에는 전송한 프롬프트, 모델의 반응, 토큰의 사용, 지연 시간, 도구의 호출 및 중간 출력이 포함된다. 이것은複雑한 멀티 스탭 에이전트 및 리트리벌 증강 생성 파이프라인에서 답이 여러 계층의 깊이로 묻힐 수 있는 경우 잘못된 답의 소스를 더容易하게 디버그 해 줄 수 있다. 개발자는 개별 트레이스에 시각적으로 접근하고, 런을 필터링하고, 검색하고 각 노드의 정확한 입출력을 드릴링 하여 디버깅을 쉽게하기 위해 런 간에 시각적으로 확인할 수 있다. LANGSmith 또한 애플리케이션 품질을 측정하는 평가 도구를 제공합니다. 팀은 프로덕션 로그 또는 커밋된 예를 사용하여 데이터 세트를 만들고, 애플리케이션을 기존 데이터 세트에 다시 실행하여 내장 평가기, 커스텀 코드 기반 체크 및 LLM-심판 접근 방식으로 출력을 평가할 수 있습니다. 이 기능은 프롬프트나 모델이 변경될 때 Regression Testing을 지원하고, 결과가 실제로 개선되었는지 아닌지 판단 할 때 의무적인 의지에 의존하지 않고 사용자 정의 코드를 작성 한 체크나 LLM-심판 접근 방식으로 수식화 할 수 있습니다. LangSmith은 실제 환경에서 사용하기 위해 latency, 비용, 오류 비율, 피드백 등을 시간 경과에 따라 추적할 수 있는 모니터링 대시보드를 제공합니다. 또한 사용자 피드백 및 사용자가 주는 주석을 수집하는 기능이 있습니다. 팀은 prompt 관리 및 플레이그라운드 구성 요소를 통해 prompts를 반복하여 버전을 만들고, 모델의 출력을 이중으로 비교할 수 있습니다. 개발자 및 팀에 의해서 Langsmith는 AI 모델을 개발하는 데 도움이 되는 시스템 관찰성과 기능 평가를 위해 사용된다. Langchain 생태계와 밀접한 연관을 갖춘 점과 관찰성, 데이터셋, 평가 과정을 연결하는 일관된 워크플로우가 강점이다. Langsmith는 Langchain/LangGraph 세계에 익숙한 사용자에게만 최고의 사용 경험을 제공하는 등의 약점을 가지고 있다. 또한 LLM 기반의 기능 평가 자체가 불완전하고 조심스러운 설계가 필요하고, 호스팅 comercial 제품이다. 이러한 점이 고객을 엇갈린다. Langsmith는 다른 LLM 관찰성 도구인 Langfuse, Helicone, Arize Phoenix, Weights & Biases Weave와 경쟁한다.
평가 기준 분해
- 一步步输入、输出和トークン使用 추적
- 데이터셋 생성과 자동 평가
- 빌트인, 코드 기반 및 LLM-으로 평가하는심판자
- 프로덕션 모니터링 대시보드
- 인간 피드백 및 애노테이션 수집
- 프롬프트 관리, 버전 관리 및 플레이그라운드











