LangGraph부터 CrewAI까지: 2026년 장기 실행 AI 에이전트 하네스 비교
2026년 장기 실행 AI 에이전트는 모델 성능만으로 완성되지 않습니다. LangGraph부터 CrewAI까지 공식 가격, 상태 복구, 검증 방식과 운영 한계를 비교합니다. 실패를 안전하게 복구하고 비용을 통제해야 하는 제품팀과 개발팀을 위한 실전 선택 기준도 담았습니다.

LangGraph는 2026년 장기 실행 작업에 가장 적합한 AI 에이전트 하네스입니다. 상태 관리와 복구, 사람의 통제를 워크플로의 핵심 요소로 다루기 때문입니다. NVIDIA의 새로운 AVO 결과는 이것이 왜 중요한지 보여줍니다. ARC Prize의 별도 모델 기준에서 Claude Opus 5는 약 30%였지만, NVIDIA의 완전한 에이전트 시스템 안에서는 100.00 RHAE를 기록했습니다. 다만 NVIDIA는 두 결과가 통제된 비교가 아니라고 명확히 경고합니다.
더 강력한 모델을 구매하면서 그 모델을 둘러싼 시스템에 예산을 배정하지 않는다면, 이제는 불완전한 투자 판단입니다. 모델은 다음 행동을 제안하지만, 하네스는 이전에 벌어진 일을 기억하고 실패 후 작업을 재개하며 결과를 검증합니다. 부작용을 제한하고 사람이 언제 개입해야 하는지도 결정합니다. 한 번의 매끄러운 세션을 넘어서는 업무에서는 이런 주변 통제가 추가 모델 비용을 지속 가능한 성과로 바꿀지, 더 길고 비싼 실수로 만들지를 좌우합니다.
이 비교의 가격과 기능은 2026년 8월 24일 현재 공식 페이지에서 확인했습니다. 순위는 데모 속도보다 운영 환경의 복구 가능성을 우선하며, 공개 벤치마크 결과는 보편적인 점수가 아니라 특정 구성에 대한 근거로 다룹니다.
한눈에 보는 최고의 AI 에이전트 하네스
기본 선택은 LangGraph가 좋습니다. 프레임워크의 자유도보다 런타임 운영 부담을 줄이는 일이 중요하다면 Claude Managed Agents를 선택합니다. Azure 내구성이나 .NET이 이미 필수 조건이라면 Microsoft Agent Framework가 맞습니다. 격리된 환경에서 최전선 연구를 진행한다면 NOOA가 적합합니다. 명확히 구분된 역할이 실제로 도움이 되는 업무라면 CrewAI를 고려하되, Crew 바깥은 결정론적인 Flow로 감싸야 합니다.
이 범주는 더 폭넓은 AI 에이전트 플랫폼 비교보다 한 단계 아래에 있습니다. 플랫폼은 사용자가 쓸 에이전트를 제공하고, 하네스는 에이전트가 실제 업무를 끝까지 견디게 하는 런타임 규칙을 개발자에게 제공합니다.
NVIDIA AVO가 바꾼 것은 순위가 아니라 예산입니다
NVIDIA AVO는 이 분야에서 가장 주목할 만한 새로운 근거이지만, 구매할 수 있는 제품은 아닙니다. NVIDIA는 AVO를 영구 메모리와 감독자를 갖춘 범용 코딩 에이전트로 설명합니다. 해당 글이 연결하는 것은 논문이지, 공개 패키지나 호스팅 플랜 또는 가격 페이지가 아닙니다.

하나의 아키텍처가 성격이 전혀 다른 두 작업에 그대로 적용됐다는 점에서 이 결과는 주목할 가치가 있습니다. 어텐션 커널 연구에서 AVO는 일주일 동안 연속으로 작동하며 500개가 넘는 최적화 방향을 탐색했고, 40개의 커널 버전을 커밋했습니다. NVIDIA는 DGX B200에서 FlashAttention-4보다 최대 10.5% 높은 성능을 보고했습니다. ARC-AGI-3 공개 세트에서는 Claude Opus 5를 사용한 AVO가 6,624번의 행동으로 25개 환경의 183개 레벨을 모두 완료해 100.00 RHAE를 기록했습니다.
하네스가 Opus 5를 약 30%에서 100%로 끌어올렸다는 표현은 매력적인 헤드라인입니다. 그러나 이를 인과관계로 받아들여서는 안 됩니다. NVIDIA는 직접 ARC Prize 기준 결과와 AVO 실행이 서로 다른 추론 설정, 에이전트 시스템, 평가 환경을 사용했다고 밝힙니다. 이 비교만으로는 메모리, 감독, 관찰 설계, 프롬프팅 또는 다른 변수 가운데 무엇이 몇 점을 만들었는지 분리할 수 없습니다.
그래도 방어 가능한 결론은 중요합니다. 모델만 평가한 결과로는 완전한 에이전트를 설명할 수 없습니다. 토큰 가격과 벤치마크 표만 비교하는 구매 절차는 차량과 내비게이션, 브레이크, 정비 계획을 무시한 채 엔진만 비교하는 것과 같습니다.
따라서 AVO는 선택 기준을 바꿉니다. 최고의 하네스는 에이전트 역할이 가장 많거나 그래프 편집기가 가장 보기 좋은 제품이 아닙니다. 되돌릴 수 없는 행동을 조용히 반복하지 않으면서, 가장 치명적인 실패를 복구 가능한 상태로 만들어 주는 제품입니다.
AI 에이전트 프레임워크 선정 기준
다섯 개 제품은 프롬프트 라이브러리가 아니라 미완료 업무를 위한 운영체제로 평가했습니다. 순위를 결정한 기준은 여섯 가지입니다.
- 내구성 있는 상태: 대화 기록뿐 아니라 워크플로 위치, 대기 중인 작업, 산출물, 의사결정까지 보존할 수 있는가?
- 재시작 복구: 충돌이나 배포 후 비싸거나 되돌릴 수 없는 모든 단계를 다시 실행하지 않고 프로세스를 재개할 수 있는가?
- 검증: 제안된 작업과 승인 사이에 결정론적 검사, 평가기 또는 사람의 승인을 둘 수 있는가?
- 부작용 통제: 재생해도 안전한 계산과 전송, 결제, 삭제, 배포 같은 행동을 분리할 수 있는가?
- 비용 가시성: 운영자가 한도를 설정하고 비용을 실행, 좌석, 트레이스 또는 호스팅 리소스 단위로 귀속할 수 있는가?
- 격리: 배포 모델이 생성 코드와 외부 툴에 실질적인 보안 경계를 제공하는가?
이 순서는 위 기준에 따른 편집상의 판단이지, 여러 공급업체를 억지로 같은 조건에 놓은 벤치마크가 아닙니다. 열한 개 제품을 나열한 디렉터리는 관측성 제품, 에이전트 SDK, 멀티 에이전트 라이브러리를 같은 문제의 해법인 것처럼 섞곤 합니다. 이 목록에는 각 제품이 장기 실행에서 부딪히는 한계와 그 절충을 받아들여야 할 구매자를 공식 근거로 설명할 수 있는 다섯 제품만 담았습니다.
여기서 ‘비교했다’는 말은 검증일을 기준으로 공식 문서, 저장소, 가격, 공개 결과를 검토하고 같은 틀로 정리했다는 뜻입니다. 배지를 붙이기 위해 다섯 개의 프로덕션 배포 사례를 꾸며 냈다는 뜻이 아닙니다.
1. LangGraph: 장기 실행 에이전틱 AI 워크플로를 위한 최적의 선택
LangGraph는 에이전틱 단계를 허용하면서도 상태 전환을 개발자가 명시적으로 통제할 수 있어 종합적으로 가장 좋은 선택입니다. 저수준 오케스트레이션 프레임워크이자 런타임이므로, 하나의 자율 루프에 전체 작업을 맡기는 대신 결정론적 노드와 모델이 판단하는 노드를 그래프 안에서 조합할 수 있습니다. 여러 날 이어지는 프로세스에 꼭 필요한 방식입니다. 판단이 유용한 곳에는 자유를 주고, 반복이나 부작용이 위험한 곳에는 구조를 둡니다.

가장 적합한 용도: 내구성 있는 체크포인트, 명시적 워크플로 상태, 재생, 사람의 승인이 필요한 프로덕션 에이전트.
차별점: 체크포인터는 스레드별 그래프 상태를 저장하고, 스토어는 여러 스레드에 걸쳐 정보를 보존할 수 있습니다.
가격: LangGraph는 무료 오픈소스입니다. LangSmith Developer는 좌석당 월 $0이며 좌석 하나와 월 기본 트레이스 5,000개를 제공합니다. Plus는 좌석당 월 $39로, 총 기본 트레이스 10,000개와 무제한 유료 좌석, 무료 Serverless Small 배포 하나를 포함합니다. Enterprise 가격은 별도 문의입니다. 현재 사용료는 LangChain Compute Unit당 $1.50, LangChain Storage Unit당 $1.00입니다.
무료 체험: Developer는 기간 제한 체험이 아니라 계속 사용할 수 있는 무료 플랜입니다.
이 아키텍처가 유용한 이유는 체크포인트가 단순한 ‘메모리’ 이상이기 때문입니다. 메모리는 에이전트가 사실을 떠올리게 합니다. 체크포인트는 워크플로가 어디까지 진행됐고 어떤 값을 보유하며 다음에 무엇을 해야 하는지 기록합니다. 리서치 에이전트가 소스 200개를 수집한 뒤 최종 보고서를 만드는 도중 실패했다면, 내구성 있는 그래프는 실패한 노드 부근에서 재개할 수 있습니다. 반면 채팅 기록을 덤프한 방식은 대개 모델이 긴 대화에서 의도를 재구성한 뒤 이전 행동을 반복하지 않기를 바라야 합니다.
LangGraph 영구 저장 기능는 시간 이동과 재생도 지원합니다. 다만 재생 동작을 의도적으로 설계했을 때만 가치가 있습니다. 읽기, 계산, 초안 생성은 대개 반복해도 안전합니다. 결제 승인, 이메일 전송, 데이터베이스 삭제, 프로덕션 배포는 그렇지 않습니다. 되돌릴 수 없는 모든 행동에는 같은 요청이 효과를 두 번 만들지 못하게 하는 멱등성 키를 붙이고, 실행 직전과 직후에 체크포인트를 저장해야 합니다.
한계는 운영 책임입니다. LangGraph는 의도적으로 저수준입니다. 개발자가 프로덕션 체크포인터를 선택하고 상태를 정의하며 보존 기간을 정해야 합니다. 그래프 버전 관리와 마이그레이션을 담당하고, 체크포인트 증가가 새로운 저장 공간 문제가 되지 않게 막아야 합니다. 인메모리 체크포인터는 프로세스가 재시작되면 내용을 잃으므로, 겉보기에는 내구성이 있는 프로토타입도 첫 실제 재시작 테스트에서 실패할 수 있습니다.
- 명시적인 그래프 상태 덕분에 장기 실행 작업을 점검하고 복구할 수 있습니다
- 결정론적 노드와 에이전틱 노드를 하나의 워크플로에서 함께 사용할 수 있습니다
- 체크포인트가 재생, 시간 이동, 사람의 검토를 지원합니다
- 오픈소스 프레임워크라 의무적인 런타임 좌석 비용이 없습니다
- 필요할 때 LangSmith로 관리형 관측성과 배포 경로를 더할 수 있습니다
- 저수준 설계이므로 상태 모델링과 마이그레이션을 개발자가 맡아야 합니다
- 영구 체크포인트에는 보존, 정리, 접근 제어가 필요합니다
- LangSmith Plus는 사용료를 제외하고도 좌석 다섯 개에 월 $195입니다
- 그래프를 잘못 설계하면 안전한 작업뿐 아니라 부작용까지 정확하게 재생할 수 있습니다
내구성의 단위를 정합니다
하나의 스레드를 풀 리퀘스트, 공급업체 검토, 고객 온보딩 사례처럼 하나의 비즈니스 결과로 정의합니다. 서로 무관한 작업을 끝없이 쌓는 통으로 사용하지 마십시오.
상태와 근거를 분리합니다
그래프에는 간결한 제어 상태를 두고, 대용량 산출물과 원문 문서, 생성 파일은 안정적인 참조와 함께 외부에 저장합니다. 이렇게 하면 체크포인트를 이해하기 쉽고 제어되지 않는 증가를 제한할 수 있습니다.
영구 체크포인터를 설치합니다
첫 프로덕션 파일럿 전에 인메모리 체크포인터를 교체합니다. 보존 정책을 정하고, 동일한 스레드 식별자로 다른 워커에서 프로세스를 재시작할 수 있는지 확인합니다.
되돌릴 수 없는 행동을 차단합니다
전송, 결제, 삭제, 병합, 배포 전에 승인 또는 결정론적 검증을 둡니다. 행동마다 멱등성 키를 부여하고 실행 결과를 저장합니다.
재시작 훈련을 실시합니다
외부 행동 직전, 직후, 모델 호출 도중에 실행을 종료합니다. 세 가지 재개 경로를 모두 예측할 수 있기 전에는 장기 실행 시스템이 준비된 것이 아닙니다.
실패 복구가 제품 요구사항이고 팀이 애플리케이션 런타임을 운영할 수 있다면 LangGraph를 선택하십시오. 저장 공간과 워커, 그래프 버전을 운영하지 않고 업무를 위임하는 것이 주된 목표라면 적합하지 않습니다. 그런 구매자에게는 Claude의 관리형 경로가 더 낫습니다.
2. Claude Managed Agents: 장기 실행 코딩을 위한 최고의 관리형 옵션
Claude Managed Agents는 업무가 Anthropic의 에이전트 환경에 맞고 런타임 운영 부담이 더 큰 제약일 때 가장 좋은 관리형 선택입니다. 세션은 격리된 클라우드 컨테이너 안에 이벤트와 상태를 보존하며, 다른 배포 경계가 필요한 팀을 위해 Anthropic은 셀프 호스팅도 문서화했습니다. 개발자가 워커 큐와 컨테이너 수명 주기, 세션 API를 따로 조립하는 대신 관리형 실행 환경을 구매하고 모델 사용량과 실행 시간에 따라 비용을 냅니다.

가장 적합한 용도: 프레임워크 이동성보다 관리형 세션의 가치가 큰 장기 실행 코딩, 리서치, 컴퓨터 작업.
차별점: 상태 유지 세션이 영구 이벤트 기록과 세션별 정가 비용 한도를 결합합니다.
가격: 모델 토큰 비용에 실행 세션 시간당 $0.08이 추가됩니다. Claude Opus 5 정가는 입력 토큰 백만 개당 $5, 출력 토큰 백만 개당 $25입니다. Anthropic이 공개한 한 시간 가격 예시는 입력 토큰 50,000개, 출력 토큰 15,000개, 런타임을 합해 $0.705이며, 캐시 읽기를 적용한 예시는 총 $0.525입니다.
무료 체험: 검증한 가격 페이지에는 Managed Agents 무료 체험이 공개되어 있지 않습니다.
예산 통제 방식은 이례적으로 구체적입니다. 세션을 만들 때 공개 정가 기준의 엄격한 한도를 미국 센트 단위 정수로 지정할 수 있습니다. $25 한도는 2500으로 입력합니다. 누적 비용이 한도에 도달하면 세션은 새 모델 요청을 중단하고 일시 정지합니다. 단, 경계를 넘기는 요청은 완료되므로 최종 비용이 명목 한도를 조금 초과할 수 있습니다.
마지막 조건이 중요합니다. 예산 한도는 모델 호출 사이에서 작동하는 제동 장치이지, 최종 청구액이 단 한 센트도 초과하지 않는다는 거래상의 보장은 아닙니다. 또한 세션 생성 시점에 설정해야 합니다. 예산 없이 만든 세션에는 나중에 한도를 추가할 수 없지만, 기존 한도는 변경하거나 제거할 수 있습니다.
관리형 접근의 가장 분명한 근거는 Anthropic의 별도 장기 실행 하네스 실험에서 나옵니다. 플래너, 생성기, 평가기로 구성한 하네스는 여섯 시간 동안 실행돼 $200를 썼고, 단독 에이전트는 20분 동안 $9를 썼습니다. 이 한 번의 시연에서 하네스 비용은 22.22배였지만, Anthropic의 평가에 따르면 결과는 실질적으로 더 완성도가 높았습니다. 이를 보편적인 배수로 받아들여서는 안 됩니다. 신뢰성을 높이려면 빠른 첫 시도보다 훨씬 많은 모델 시간이 들 수 있다는 솔직한 경고입니다.
한계는 결합도입니다. 관리형 세션 모델은 선택지가 분명하게 정해져 있고, 현재 managed-agents-2026-04-01 베타 헤더를 전제로 문서화돼 있으며, Anthropic의 모델 및 런타임 과금 체계를 따릅니다. Claude가 이미 실행 모델이고 세션 환경이 업무에 맞을 때는 훌륭합니다. 반면 모델 중립적인 런타임, 커스텀 분산 토폴로지, 저장된 모든 상태 전환에 대한 완전한 통제가 필요한 기업에는 기본 선택으로 적합하지 않습니다.
- 관리형 컨테이너와 상태가 소규모 팀이 운영해야 할 런타임 범위를 줄입니다
- 세션별 정가 예산으로 통제되지 않는 모델 비용에 상한을 두기 쉽습니다
- 런타임 비용은 세션이 실행 중일 때만 부과됩니다
- 다른 배포 경계가 필요한 팀을 위한 셀프 호스팅이 문서화돼 있습니다
- 이미 Claude 중심으로 운영하는 코딩 업무에 잘 맞습니다
- 개방형 오케스트레이션 프레임워크보다 공급업체와 모델에 더 강하게 결합됩니다
- 요청 사이에서 예산을 집행하므로 최종 비용이 한도를 조금 넘을 수 있습니다
- 예산 없이 만든 세션에는 나중에 한도를 추가할 수 없습니다
- 현재 Managed Agents 인터페이스는 여전히 베타로 문서화돼 있습니다
- 안정적인 하네스 기반 업무는 짧은 단독 에이전트 시도보다 훨씬 비쌀 수 있습니다
기업이 관리형 실행 환경을 원하고 Claude를 중심에 두는 데 동의한다면 Claude Managed Agents를 선택하십시오. 런타임뿐 아니라 실제 작업 에이전트도 함께 비교하는 팀은 AI 코딩 에이전트 가이드에서 인접한 모델 및 에이전트 선택지를 확인할 수 있습니다.
3. Microsoft Agent Framework: Azure와 .NET 내구성에 가장 적합
Microsoft Agent Framework는 이미 Azure 또는 .NET 시스템을 운영하면서 며칠이나 몇 주 동안 대기할 수 있는 워크플로가 필요한 조직에 가장 잘 맞습니다. 오픈소스 프레임워크는 MIT 라이선스로 Python과 .NET을 지원합니다. Durable Extension은 세션을 영구 저장하고 작업을 체크포인트하며, 실패를 복구하고 여러 호스트에 실행을 분산합니다. 관리형 세션보다 인프라 선택 폭은 넓지만, Microsoft 중심의 운영 모델은 더 가파릅니다.

가장 적합한 용도: 사람이나 외부 시스템을 기다렸다가 다시 시작하는 Azure 또는 .NET 기반 엔터프라이즈 워크플로.
차별점: 사람이나 외부 이벤트를 기다리는 동안 내구성 있는 대기 상태는 컴퓨팅 자원이나 모델 토큰을 소비하지 않습니다.
가격: MIT 라이선스 프레임워크는 $0입니다. Azure 호스팅, 저장 공간, 모델 호출, 네트워킹, 관측성 비용은 별도입니다. Azure Functions Flex Consumption에는 매월 무료 실행 250,000건과 100,000 GB-seconds가 포함되고, Consumption에는 1 million건의 요청과 400,000 GB-seconds가 포함됩니다. 유료 요금은 지역과 계약에 따라 다릅니다.
무료 체험: 프레임워크는 무료 오픈소스입니다. Azure가 공개한 월별 무료 제공량은 기간 제한이 있는 프레임워크 체험이 아니라 자격을 충족한 사용량에 적용됩니다.
이 제품이 장기 실행에서 갖는 강점은 체크포인트 저장과 내구성 있는 오케스트레이션의 차이에서 나옵니다. 일반 체크포인트는 한 애플리케이션 런타임 안에서 그래프를 복원할 수 있습니다. Microsoft의 Durable Extension은 워크플로 진행 상태를 Durable Task 인프라에 두므로 무상태 워커가 프로세스 재시작이나 호스트 변경을 거쳐서도 작업을 재개할 수 있습니다. 승인을 위해 사흘을 기다리는 구매 절차, 문서를 기다리는 보험 청구, 몇 주 동안 열려 있을 수 있는 규정 준수 워크플로에 더 잘 맞습니다.
기다리는 동안 컴퓨팅 자원이나 모델 토큰을 쓰지 않는다는 점이 실질적인 경제적 이점입니다. 관리자 승인을 기다리는 프로세스라면 비싼 워커를 계속 실행하거나 모델에 답변이 왔는지 반복해서 물어서는 안 됩니다. 내구성 있는 인프라가 대기 상태를 기록하고 컴퓨팅 자원을 해제한 뒤 이벤트가 오면 재개합니다.
Microsoft는 Azure Functions 호스팅과 셀프 호스팅 워커를 문서화했습니다. 셀프 호스팅에서도 체크포인트, 재개, 결정론적 오케스트레이션, 사람의 응답 대기, 분산 실행은 유지되지만 API와 수명 주기 관리, 네트워킹, 인증, 배포 책임은 운영자에게 돌아갑니다. 인프라 운영을 피하는 지름길이 아니라 어떤 인프라를 팀이 소유할지 고르는 선택입니다.
표준 워크플로 체크포인트는 인메모리, 파일, Cosmos DB 저장소를 사용할 수 있습니다. 편리한 선택이 늘 안전한 것은 아닙니다. Python pickle 기반 체크포인트 데이터는 역직렬화할 때 코드를 실행할 수 있으므로 신뢰 경계 안에만 둬야 합니다. 신뢰할 수 없는 테넌트나 외부 업로드에서 온 체크포인트 블롭을 절대 받아들이지 마십시오.
한계는 플랫폼 종속성과 개념적 무게입니다. Durable Task의 시맨틱, Azure 리소스, 상태 저장소, 결정론적 오케스트레이션, 에이전트 추상화를 합치면 소규모 애플리케이션 대부분이 필요로 하는 것보다 큰 시스템이 됩니다. 워크플로가 몇 분 안에 끝나고 한 번의 재시작 실패를 감수할 수 있다면 LangGraph나 관리형 세션을 이해하고 운영하기가 대체로 더 쉽습니다.
- 워크플로가 며칠 또는 몇 주 동안 실행되며 분산 워커가 바뀌어도 복구할 수 있습니다
- 사람과 외부 이벤트를 기다리는 동안 컴퓨팅 및 모델 비용이 발생하지 않습니다
- Python과 .NET을 함께 지원해 혼합형 Microsoft 엔지니어링 조직에 적합합니다
- Azure Functions와 셀프 호스팅 배포 경로가 문서화돼 있습니다
- MIT 라이선스라 프레임워크 자체는 무료입니다
- 운영 모델이 단일 프로세스 프레임워크보다 무겁습니다
- Azure 비용은 함수, 저장 공간, 모델, 네트워킹, 관측성 전반에서 발생합니다
- 셀프 호스팅을 선택하면 중요한 수명 주기와 보안 책임이 운영자에게 넘어갑니다
- Pickle 기반 체크포인트 데이터는 엄격한 신뢰 경계를 요구합니다
- Microsoft 플랫폼 관례 때문에 이동성이 떨어질 수 있습니다
4. NVIDIA NOOA: 에이전트 연구를 위한 최고의 오픈 하네스
NVIDIA NOOA는 타입이 지정된 메모리, 툴, 평가기, 에이전트 조합이 모델 성능에 미치는 영향을 연구하는 팀에 가장 적합한 오픈 연구용 하네스입니다. NVIDIA Object Oriented Agents는 모델에 종속되지 않는 Python 프레임워크이며, 메모리는 사람이 읽을 수 있는 SQLite 파일에 타입이 지정된 객체와 관계를 표현합니다. 임시로 만든 메모를 모아 둔 폴더보다 점검하기 쉽고, 과거 메시지를 프롬프트에 그대로 밀어 넣는 것보다 의도적인 구조입니다.

가장 적합한 용도: 실질적인 샌드박스 안에서 커스텀 에이전트 아키텍처를 개발하는 연구 그룹과 고급 개발자.
차별점: NVIDIA의 ARC-AGI-3 평가에서 타입 관계형 메모리가 파일 기반 메모보다 RHAE를 11.8점 높였습니다.
가격: Apache 2.0 소프트웨어는 $0입니다. 모델 토큰과 컴퓨팅, 저장 공간, 보안 샌드박스 비용은 별도입니다. NVIDIA가 보고한 ARC-AGI-3 구성의 게임당 비용은 GPT-5.5가 $17.85, GPT-5.6-sol이 약 $13.30입니다.
무료 체험: 프레임워크는 무료 오픈소스이며 호스팅 플랜이나 기간 제한 체험이 필요하지 않습니다.
NOOA가 중요한 이유는 NVIDIA가 점수와 리소스 근거를 모두 공개하기 때문입니다. SWE-bench Verified에서 NVIDIA는 벤치마크 전용 프롬프트 없이 253줄짜리 범용 에이전트를 사용해 GPT-5.5로 82.2%, Claude Opus 4.6으로 79.8%를 기록했다고 보고했습니다. 82.2% 실행은 작업당 모델 호출 29회와 약 1.1 million개의 토큰을 사용했습니다. NVIDIA는 이를 66회 호출과 2.2 million개의 토큰으로 78.2%를 기록한 결과와 비교합니다. 더 나은 하네스 설계가 완료율뿐 아니라 낭비도 줄일 수 있음을 보여주는 대목입니다.
ARC-AGI-3에서 NVIDIA는 GPT-5.5로 평균 RHAE 50.2%와 게임당 $17.85, GPT-5.6-sol로 85.1%와 게임당 약 $13.30을 보고했으며, 두 구성 모두 두 시간 제한을 적용했습니다. 이는 특정 벤치마크에 맞춘 NVIDIA의 구성이지 어떤 기업의 업무 목록에 대한 보장이 아닙니다. 방향성에 가치가 있습니다. 메모리 구조와 재사용 가능한 스킬, 평가, 모델 선택이 점수와 비용의 경계를 함께 움직일 수 있습니다.
한계는 저장소에 분명하게 적혀 있습니다. NVIDIA는 NOOA를 아직 거친 부분이 있는 연구용 소프트웨어라고 설명합니다. 에이전트는 모델이 생성한 코드를 실행할 수 있고, 그 코드는 비공개 데이터를 유출하거나 파일을 삭제하고 환경을 바꿀 수 있습니다. AST 검사와 차단 목록은 뻔한 패턴을 거를 수 있지만 격리 수단은 아닙니다. 실제 경계는 기본 파일시스템이나 제한 없는 네트워크에 접근할 수 없는 컨테이너, 가상 머신 또는 OpenShell 환경 같은 격리된 운영체제 샌드박스여야 합니다.
이 안전 요구사항은 예산을 바꿉니다. ‘무료 오픈소스’는 라이선스 비용이 없다는 뜻이지 운영 비용까지 없다는 뜻이 아닙니다. 제대로 된 파일럿에는 격리된 컴퓨팅 자원, 일회용 인증 정보, 제한된 외부 통신, 산출물 검토, 그리고 에이전트의 객체 저장소가 어떻게 변화하는지 이해하는 담당자가 필요합니다.
- Apache 2.0 코드와 사용법이 간단한 Python 패키지
- 타입 관계형 메모리가 SQLite에서 사람이 읽을 수 있는 형태로 유지됩니다
- 공개 결과에 호출 수, 토큰 사용량, 점수, 게임당 비용이 포함됩니다
- 모델 중립적 아키텍처로 통제된 연구 비교가 가능합니다
- 범용 에이전트 근거가 벤치마크 전용 프롬프트 묶음보다 유용합니다
- NVIDIA가 명시적으로 아직 거친 부분이 있는 연구용 소프트웨어라고 설명합니다
- 안전하게 사용하려면 OS 수준 샌드박스와 제한된 인증 정보가 필요합니다
- SQLite는 점검하기 쉽지만 자동으로 분산 프로덕션 메모리 서비스가 되지는 않습니다
- 벤치마크 결과만으로 다른 비즈니스 워크플로의 성능을 예측할 수 없습니다
- 프로덕션 배포 패턴이 상위 세 제품보다 덜 성숙했습니다
하네스 설계 자체를 연구하고 확장하는 것이 목적일 때 NOOA를 선택하십시오. 공개 벤치마크 수치가 가장 새롭고 흥미롭다는 이유만으로 기본 프로덕션 런타임으로 고르면 안 됩니다.
5. CrewAI: 역할 기반 멀티 에이전트 프레임워크에 가장 적합
CrewAI는 서로 다른 역할을 협업 에이전트에 배정했을 때 프로세스가 실제로 개선되는 경우에 가장 좋은 선택입니다. 단, 바깥 프로세스는 Flow가 통제해야 합니다. Crews는 자율 협업을 담당하고, Flows는 이벤트 기반 상태와 분기, 반복, 영구 저장을 제공합니다. 따라서 내구성 있는 설계는 ‘에이전트들이 끝날 때까지 대화하게 두기’가 아닙니다. 구조화된 Flow가 제한된 작업 구간을 Crew에 열어 주고, 돌아온 결과를 검증하는 형태입니다.

가장 적합한 용도: 서로 다른 에이전트 책임이 유용한 역할 기반 리서치, 검토, 콘텐츠 또는 운영 프로세스.
차별점: Flow는 기본적으로 SQLite에 상태를 영구 저장하고 저장된 상태 식별자에서 재개할 수 있으며, 커스텀 영구 저장 백엔드도 지원합니다.
가격: Basic은 $0이며 비주얼 에디터, AI 코파일럿, GitHub 연동, 월 워크플로 실행 50회를 포함합니다. Enterprise 가격은 별도 문의이며 SSO, RBAC, 워크로드 아이덴티티, PII 마스킹, 정책, 클라우드 또는 프라이빗 배포 선택지, 45일 온보딩 프로그램을 추가합니다.
무료 체험: Basic은 계속 사용할 수 있는 무료 플랜이며, CrewAI는 Enterprise 체험도 제공합니다.
CrewAI의 가장 좋은 패턴은 에이전틱 영역을 결정론적인 외피로 감싸는 것입니다. 공급업체 실사를 예로 들어 보겠습니다. Flow가 문서를 받고 사례 식별자를 기록한 뒤 필수 검사를 배정합니다. 리서치 Crew는 보안, 재무, 제품 질문을 나눠 맡을 수 있습니다. 이후 Flow가 스키마 유효성 검증을 통과한 출력을 요구하고, 예외는 사람에게 보내며, 기준 시스템을 업데이트하기 전에 승인을 기록합니다. 역할은 분석 안에서 도움을 줍니다. 최종적으로 되돌릴 수 없는 행동까지 맡겨서는 안 됩니다.
영구 저장 기능은 유용하지만 과대평가하기 쉽습니다. Flow 또는 메서드 수준에서 영구 저장을 적용하면 기본적으로 SQLite에 상태가 저장됩니다. 단일 머신 파일럿에는 충분하고 개발 중에 점검하기도 쉽습니다. 그러나 그 자체로 여러 워커를 위한 분산 상태 서비스가 되지는 않습니다. CrewAI는 커스텀 영구 저장 백엔드를 지원하며, 머신 손실을 견디거나 복제본 간 조정이 필요한 프로세스에서는 이 경로가 중요해집니다.
한계는 조정 비용입니다. 역할을 추가할 때마다 메시지와 모델 호출, 지연 시간이 늘 수 있고 두 에이전트가 같은 실수를 서로 강화할 기회도 하나 더 생깁니다. 조직도를 데모에서 멋있게 보이게 하기 위해서가 아니라, 별도의 컨텍스트와 툴 권한 또는 평가 관점을 제공할 때만 역할을 둬야 합니다.
- 자율적인 Crews와 구조화된 Flows가 명확하게 분리됩니다
- Flow의 상태, 분기, 반복, 재시작 영구 저장이 일반적인 비즈니스 프로세스를 지원합니다
- 무료 Basic 플랜에 월 워크플로 실행 50회가 포함됩니다
- Enterprise 통제 기능에는 SSO, RBAC, 워크로드 아이덴티티, PII 마스킹이 포함됩니다
- 오픈소스 MIT 프레임워크라 Python으로 깊이 있게 커스터마이징할 수 있습니다
- 기본 SQLite 영구 저장은 단일 머신용 출발점입니다
- 멀티 에이전트 역할 대화가 판단의 질은 높이지 않은 채 호출 수와 지연 시간만 늘릴 수 있습니다
- Enterprise 가격은 공개되지 않았습니다
- 45일 온보딩 프로그램은 상당한 엔터프라이즈 구현 작업이 필요하다는 신호입니다
- 결정론적 함수가 더 안전한 곳에도 팀이 자율적인 Crews를 과도하게 사용할 수 있습니다
역할 분리가 시스템의 존재 이유일 때 CrewAI를 선택하십시오. 실제로 필요한 것이 툴과 승인을 내구성 있게 잇는 순서뿐이라면 LangGraph나 Microsoft Agent Framework가 더 깔끔한 제어 계층을 제공합니다.
감당할 수 없는 실패를 기준으로 고르십시오
선택을 뒤집는 것은 기능 수가 아니라 실패 유형입니다. 모델이나 워커 또는 사람이 작업 중간에 사라진 뒤에도 반드시 유지돼야 할 조건부터 정하십시오.

개발자가 명시적인 애플리케이션 상태와 모델 선택의 자유, 모든 체크포인트에 대한 통제를 원한다면 LangGraph를 선택하십시오. 제품팀에 가장 적합한 중립적인 기본값입니다.
업무가 Claude 중심이고 팀이 컨테이너와 세션 관리를 직접 만드는 대신 구매하고 싶다면 Claude Managed Agents를 선택하십시오. 독립적인 작업이 많고 각각 비용 한도가 필요할 때 세션별 예산이 특히 유용합니다.
프로세스가 이미 Azure 또는 .NET 안에 있고 사람이나 시스템을 며칠 동안 기다릴 수 있다면 Microsoft Agent Framework를 선택하십시오. 결정적인 강점은 에이전트의 영리함이 아니라 분산 환경에서의 내구성 있는 실행입니다.
목표가 하네스 자체에 관한 연구이고 팀이 일회용 샌드박스를 강제할 수 있다면 NVIDIA NOOA를 선택하십시오. 현재 벤치마크 근거는 훌륭하지만, 배포 판단은 저장소의 연구용 경고를 따라야 합니다.
서로 다른 역할이 업무를 실질적으로 개선하고 Flow로 이를 제한할 수 있다면 CrewAI를 선택하십시오. 역할이 장식에 불과하다면 없애고 더 단순한 런타임을 고르십시오.
LangGraph와 Microsoft 사이의 명확한 분기점은 인프라 범위입니다. 영구 애플리케이션 체크포인트로 작업을 복구할 수 있다면 LangGraph가 더 단순합니다. 워커가 이동할 수 있고 대기 시간이 몇 주에 이르며 Durable Task가 이미 아키텍처에 포함된다면 Microsoft의 추가 장치가 타당합니다. LangGraph와 Claude의 분기점은 소유권입니다. 유연성을 위해 런타임을 직접 만들지, 집중을 위해 세션을 구매할지 결정하면 됩니다.
장기 실행 AI 에이전트의 신뢰성에는 실제로 얼마가 듭니까?
프레임워크가 무료여도 안정적인 에이전트는 성공한 작업 하나당 더 비쌀 수 있습니다. 재시도 횟수만의 문제가 아닙니다. 계획, 평가, 더 풍부한 메모리, 샌드박스 툴, 재생에 안전한 통합에는 실패한 결과를 줄이기 전부터 토큰이나 엔지니어링 시간이 듭니다.

Anthropic의 장기 실행 실험은 예산에 가장 분명한 경고를 줍니다. 단독 시도는 $9와 20분, 플래너·생성기·평가기 하네스는 $200와 여섯 시간이 들었습니다. 비율은 22.22배입니다. 작업과 결과 품질을 감안하면 이는 보편적 규칙이 아니라 하나의 시연이지만, 하네스가 같은 모델 호출을 무료로 감싼 장치라는 가정을 무너뜨립니다.
현재 확인할 수 있는 세 가지 비용 범위만 봐도 가격을 하나의 비교 수치로 압축할 수 없는 이유가 드러납니다.
- 관리형 실행: Anthropic의 한 시간 예시는 $0.705이므로 비슷한 세션 100개의 비용은 $70.50입니다. 실제 비용은 모델, 토큰, 캐싱, 실행 시간에 따라 달라집니다.
- 공유 운영: LangSmith Plus 좌석 다섯 개는 사용량 기반 컴퓨팅과 저장 공간을 제외하고 월 $195입니다. 프레임워크는 무료지만 협업 관측성은 별도 예산 항목입니다.
- 연구 실행: NVIDIA는 GPT-5.6-sol NOOA 플릿의 ARC-AGI-3 게임당 비용을 약 $13.30, GPT-5.5는 $17.85로 보고했습니다. 이는 소프트웨어 엔지니어링 티켓이 아니라 벤치마크 구성을 설명하는 수치입니다.
이 값들은 같은 단위의 제품 가격이 아닙니다. 억지로 같은 것처럼 다루기보다 각각의 단위를 보여주는 편이 더 유용합니다. 실무적인 기준은 승인된 결과당 비용입니다. 모델, 런타임, 저장 공간, 관측성, 검토에 쓴 총비용을 안전하지 않은 부작용 없이 승인 절차를 통과한 산출물 수로 나눕니다.
월요일 실행안: 모델을 더 사기 전에 복구 훈련부터 하십시오
월요일에는 평소 한 시간 이상 걸리는 워크플로 하나를 고르고 내구성의 단위를 정의합니다. 풀 리퀘스트, 실사 사례, 고객 온보딩 또는 명확한 승인 테스트가 있는 리서치 보고서가 좋은 후보입니다.
화요일까지 초기 상태, 첫 외부 읽기, 마지막 안전 체크포인트, 첫 번째 되돌릴 수 없는 행동, 최종 승인이라는 다섯 가지 경계를 그립니다. 실행에 지출 한도를 둡니다. 하네스가 이 중 하나를 표현하지 못한다면 다른 모델의 벤치마크 점수보다 그 공백이 더 중요합니다.
수요일에는 되돌릴 수 없는 행동 직전, 직후, 모델 생성 도중이라는 세 시점에서 워커를 종료합니다. 상태 손실, 반복 전송, 중복 쓰기, 근거 없이 완료를 주장하는 에이전트가 있는지 살핍니다. 복구 시간과 사람의 개입을 기록합니다.
목요일에는 빠진 멱등성 키, 승인, 평가기, 체크포인트 또는 샌드박스 규칙을 추가합니다. 금요일에는 훈련을 반복하고 승인된 결과당 비용을 계산합니다. 그런 다음에야 더 강한 모델이나 관리형 런타임 또는 다른 프레임워크에 예산을 배정할지 판단하십시오.
이것이 AVO가 비즈니스에 주는 결론입니다. 월요일의 구매 대상이 자동으로 Opus 5, LangGraph 또는 새로운 멀티 에이전트 아키텍처가 되는 것은 아닙니다. 먼저 복구 경로 하나를 측정해야 시스템의 어느 부분이 실제로 약한지 알 수 있습니다.
피해야 할 선택
널리 알려진 이름 가운데 일부는 다른 곳에서 여전히 유용하더라도 새로운 장기 실행 시스템에는 맞지 않습니다.
새로운 Microsoft 프로젝트에 AutoGen을 쓰는 경우
AutoGen은 Microsoft가 유지보수 모드로 전환하고 신규 사용자에게 Microsoft Agent Framework를 권장했기 때문에 새로운 Microsoft 기반 에이전트 개발의 기본값으로 부적합합니다. 기존 AutoGen 시스템을 서둘러 다시 작성할 필요는 없지만, 후속 프레임워크가 이미 권장 경로가 된 상황에서 새로운 아키텍처를 시작해서는 안 됩니다.

기존 배포는 안정적으로 유지하고 인터페이스를 격리한 뒤 비즈니스 위험에 따라 마이그레이션을 계획하십시오. 오래된 튜토리얼과 예시가 많다는 이유만으로 새로운 결합을 만들지 마십시오.
되돌릴 수 없는 업무에 단순 압축 루프를 쓰는 경우
대화 기록을 주기적으로 요약하는 단일 에이전트는 내구성 있는 하네스가 아닙니다. 컨텍스트 압축은 컨텍스트 길이를 줄일 수 있지만 어떤 부작용이 이미 발생했는지 입증하거나, 타입이 지정된 워크플로 위치를 보존하거나, 재생을 안전하게 만들지는 못합니다. 되돌릴 수 있는 탐색에만 사용하십시오. 외부 상태와 멱등성 없이 결제, 삭제, 고객 커뮤니케이션, 병합, 배포를 맡겨서는 안 됩니다.
NVIDIA AVO를 프로덕션 구매 대상으로 보는 경우
AVO는 하네스 아키텍처의 중요성을 보여주는 근거이지, 지원 플랜과 가격을 갖춘 공개 제품이 아닙니다. 그 결과는 아키텍처 검토의 질문을 바꿔야 합니다. NVIDIA가 실제 제품으로 평가할 수 있는 무언가를 제공하기 전에는 구매 주문서에 올라가서는 안 됩니다.
승인 절차 없는 멀티 에이전트 역할극
에이전트가 많다고 신뢰성이 자동으로 높아지지는 않습니다. 플래너, 빌더, 리뷰어가 모두 같은 부실한 컨텍스트를 공유하고 결정론적 승인 테스트도 없다면, 시스템은 독립성을 더하지 않은 채 추론만 늘린 셈입니다. 별도의 근거와 권한 또는 이전 답을 뒤집을 수 있는 검사가 있을 때만 역할을 추가하십시오.
자주 묻는 질문
2026년 최고의 AI 에이전트 하네스는 무엇인가요?
LangGraph는 명시적인 그래프 상태, 영구 체크포인트, 재생, 사람의 통제를 결합하면서도 워크플로를 특정 모델 공급업체에 가두지 않으므로 프로덕션 장기 실행 작업에 가장 좋은 종합 하네스입니다. 관리형 실행이 우선이면 Claude Managed Agents, 분산 워커 전반의 Azure 및 .NET 내구성이 중요하면 Microsoft Agent Framework가 더 낫습니다.
장기 실행 에이전트에 효과적인 하네스는 무엇인가요?
LangGraph, Claude Managed Agents, Microsoft Agent Framework, NVIDIA NOOA, CrewAI는 서로 다른 운영 모델에서 효과적입니다. 올바른 상태를 영구 저장하고, 부작용을 중복하지 않은 채 재개하며, 완료를 검증하고, 팀의 격리 경계에 맞는 제품이 효과적인 선택입니다.
Claude 하네스란 무엇인가요?
Claude 하네스는 Claude 모델 주변의 런타임을 뜻합니다. 프롬프트, 툴, 영구 상태, 계획, 평가, 예산, 복구 규칙이 포함됩니다. Claude Agent SDK로 이 장치를 직접 만들 수 있고, Claude Managed Agents는 이를 위한 관리형 세션 환경을 제공합니다.
Claude Code는 에이전트인가요, 하네스인가요?
Claude Code는 자체 하네스 동작을 갖춘 에이전트 제품입니다. Claude Agent SDK와 Managed Agents 인터페이스는 개발자가 더 넓은 에이전트 시스템을 구축하거나 운영하게 해줍니다. 차이는 통제 범위에 있습니다. 에이전트는 작업을 수행하고, 하네스는 작업 상태와 툴, 복구, 검증이 작동하는 방식을 관리합니다.
Claude Code용 AI 하네스가 있나요?
있습니다. Anthropic은 Agent SDK를 중심으로 플래너, 생성기, 평가기 역할을 포함한 장기 실행 하네스 패턴을 문서화했으며, 상태 유지 실행을 위한 Managed Agents 세션도 제공합니다. 공급업체 독립성이 중요하다면 LangGraph 같은 모델 중립 프레임워크로 Claude 모델을 오케스트레이션할 수도 있습니다.
Pi와 Claude Code 하네스의 핵심 차이는 무엇인가요?
브랜드 경쟁이 아니라 아키텍처 비교로 접근해야 합니다. 내구성 있는 상태, 툴 권한, 모델 이동성, 체크포인트와 재생 시맨틱, 검증, 배포 소유권을 비교하십시오. 커스터마이징하기 쉬운 하네스가 장기 실행 업무에서도 자동으로 더 안전한 것은 아닙니다. 실패 복구와 부작용을 점검할 수 있는지가 결정적인 기준입니다.
AI Business Workflow Audit Checklist 받기
무료 AI Business Workflow Audit Checklist는 가능성 있는 에이전트 작업을 담당자, 상태 경계, 승인 절차, 예산 한도, 중단 규칙이 명확한 파일럿으로 바꿔 줍니다. 체크리스트와 다음 검증형 구축 가이드를 받아보려면 구독하십시오.
2026년 9월 2일




