Agnost AI — eval이 놓친 운영 대화 실패를 찾아, 수정 PR까지 여는 에이전트 개선 플랫폼

"Your Agents Should Get Better Every Day."
운영 채팅·음성 대화를 읽고, 사용자가 막히거나 이탈하는 지점을 찾아, 팀이 검토할 수 있는 수정안과 PR로 연결합니다.
Y Combinator 백드 스타트업 Agnost AI는 AI 에이전트의 평가(eval)와 실제 운영(production) 사이의 간극을 메우는 도구입니다. 대시보드에 트레이스만 쌓아 두는 관측(observability) 도구와 달리, 실패 패턴을 진단한 뒤 프롬프트·가드레일·엣지케이스 처리 개선안을 PR 형태로 제안하는 점이 핵심 차별점입니다.
TL;DR
- eval 통과 ≠ 운영 성공 — 실제 채팅·음성 대화에서 막힘, 재시도, 이탈 신호를 지속적으로 분석
- 관측을 넘어 개선까지 — 실패 카테고리를 만들고, 영향도가 큰 패턴을 수정안·PR로 전환 (팀은 리뷰 후 머지)
- 3줄 SDK 또는 OpenTelemetry — OpenAI, Anthropic, LangChain 등 어떤 LLM·프레임워크든 약 2분 연동
- 무료부터 시작 — Free(1,000 events/월) → Starter $49 → Pro $499 → Enterprise 커스텀
- AI 제품 KPI 프레임워크 — Intent Resolution Rate, Frustration Index 등 대화형 제품 전용 지표 철학을 제품에 반영
핵심 정보 한눈에 보기
| 항목 | 내용 |
|---|---|
| 서비스명 | Agnost AI |
| 한 줄 설명 | 운영 대화에서 AI agent 실패를 찾는 도구 |
| 카테고리 | AI 툴 / 개발도구 (agent observability · improvement) |
| 개발사 | Agnost Tech Inc (Y Combinator) |
| 플랫폼 | 웹 |
| 가격 | Free / Starter $49·월 / Pro $499·월 / Enterprise 커스텀 |
| 연동 | SDK 3줄 또는 OpenTelemetry, 모든 LLM·프레임워크 |
| 대상 | AI 에이전트·대화형 제품을 운영하는 팀 |
| 공식 사이트 | agnost.ai |
| newflix 등록일 | 2026년 7월 18일 |
| newflix 페이지 | newflix.io/s/agnost |
어떤 문제를 풀까?
AI 에이전트 팀은 보통 이렇게 일합니다. 테스트셋과 eval 스위트를 만들고, 점수가 올라가면 배포하고, LangSmith·Phoenix·Sentry 같은 도구로 트레이스와 에러율을 봅니다. 그런데 대시보드상 지표는 멀쩡한데 사용자는 조용히 떠나는 일이 반복됩니다.
Agnost AI가 지적하는 핵심은 이렇습니다.
- Eval은 “알려진 미지(known unknowns)”만 잡는다
팀이 미리 정의한 케이스에서는 통과해도, 실제 사용자가 던지는 표현·의도·엣지케이스는 테스트셋 밖에 있습니다. - 전통 제품 지표는 대화 품질을 설명하지 못한다
DAU, 세션 길이, 리텐션은 “앱을 열었는지”는 보여 주지만, “의도가 해결됐는지·신뢰가 쌓였는지”는 보여 주지 않습니다. 같은 12턴 대화가 깊은 몰입일 수도, 다섯 번 같은 질문을 반복하다 포기한 좌절일 수도 있습니다. - 관측만으로는 개선 루프가 닫히지 않는다
트레이스를 읽는 데 시간을 쓰고, 어느 프롬프트를 고칠지 회의하고, 수동으로 PR을 쓰는 동안 실패 패턴은 계속 쌓입니다.
Agnost AI의 포지션은 여기서 출발합니다. 운영 대화를 읽고 → 실패·마찰 신호를 분류하고 → 팀이 검토할 수 있는 수정(PR)까지 제안해, “차트 보는 시간”을 “머지하는 시간”으로 바꿉니다.
제품 철학 — "에이전트가 매일 나아져야 한다"

OG·랜딩 카피에 반복되는 메시지는 단순합니다. "Your Agents Should Get Better Every Day."
에이전트를 한 번 배포하고 끝내는 시스템이 아니라, 프로덕션 대화가 다음날의 개선 입력이 되는 루프를 만들자는 주장입니다. Y Combinator 백드라는 점은 초기 인프라·에이전트 팀 대상 GTM과 맞물려 있습니다.
공식 FAQ 기준으로 Agnost AI가 실제로 손대는 개선 범위는 다음과 같습니다.
- 프롬프트·가드레일 조정
- 새로운 엣지케이스 처리
- 하네스 또는 Weights & Biases 설정 변경
각 PR은 "놓친 의도", "반복 버그", "업그레이드를 막는 마찰"처럼 실제 대화 신호에 연결되고, 머지 전에 사람이 리뷰합니다. 완전 무인 배포가 아니라 자동 제안 + 인간 승인 모델입니다.
주요 기능 딥다이브
1) 운영 채팅·음성 대화의 지속 분석
연결 직후 Agnost AI는 실제 프로덕션 대화를 읽어 제품에 의미 있는 실패 카테고리를 생성합니다. 예시 유형은 다음과 같습니다.
- 깨진 워크플로(broken workflows)
- 반복 재시도(repeated retries)
- 온보딩·설정 마찰(setup friction)
- 이탈·이탈 위험(churn risk)
- 기능 요청·의도 불일치
newflix 요약도 같은 축을 가리킵니다. 운영 대화를 계속 분석하고, eval이 놓친 실패 패턴을 찾고, 사용자가 막히거나 좌절하는 구간을 식별합니다.
2) Intent 중심 분석 대시보드

공식 사이트의 인터랙티브 데모(ClipForge AI 워크스페이스)를 보면 제품 정보 구조가 잘 드러납니다. 사이드바는 크게 세 축입니다.
| 영역 | 메뉴 | 역할 |
|---|---|---|
| Analyse | User Stories, Intents, Violations | 사용자 스토리·의도·정책 위반 분석 |
| Observe | Tool Calls, Errors, Events | 도구 호출·에러·이벤트 관측 |
| Improve | Alerts, Auto Improve | 알림과 자동 개선 루프 |
Intents 화면에는 의도별 활동 차트, 메시지 수, 최근 발생 시각, 상태(Active / Suggested)가 표시됩니다. Suggested 상태 의도에는 Approve / Reject 버튼이 있어, 모델이 제안한 의도 분류를 팀이 큐레이션할 수 있습니다. 데모 데이터 예시 의도만 봐도 제품 톤이 명확합니다.
- "Rage after incorrect background replacement"
- "Broken export link after render completed"
- "Export stalled at 99% during final mux"
- "Plan limit discovered only at export"
즉 추상적인 "에러 로그"가 아니라, 사용자가 실제로 겪은 실패 스토리 단위로 문제를 묶어 보여 줍니다. "Copy as Markdown", "Ask AI" 같은 액션도 있어 분석 결과를 문서·대화로 바로 넘길 수 있습니다.
3) 관측(Observe)에서 개선(Improve)으로
Agnost AI는 스스로를 순수 관측 도구와 구분합니다. 공식 FAQ 요지:
Observability는 읽기 전용이다. 트레이스와 대시보드를 보여 주고 일은 팀에 남긴다.
Agnost AI는 행동한다. eval을 통과했지만 운영에서 깨지는 실패를 진단하고, 검토용 수정을 제안한다.
그래서 Improve 영역의 Auto Improve와 "리뷰 가능한 PR 오픈"이 제품 스토리의 종착점입니다. Lopus AI 사례에서는 대화 속에 묻힌 버그를 찾아 16/18개의 자율 PR이 머지됐다는 수치가 소개됩니다. Odysser CTO는 채팅 안에서 1,247개의 기능 요청이 표면화됐다고 말합니다. 숫자는 마케팅 인용 수치이므로 절대 벤치마크로 과신하기보다, "대화 속에 이미 있는 신호를 제품 백로그로 끌어올린다"는 방향성으로 이해하면 됩니다.
4) 연동: 2분, 3줄, OpenTelemetry
- 어떤 LLM·프레임워크든 동작 (OpenAI, Anthropic, LangChain, 커스텀 스택)
- SDK 약 3줄 또는 OpenTelemetry로 데이터 전송
- "설정 거의 없이 커피가 식기 전에 프로덕션 연결"을 목표로 한 온보딩 카피
에이전트 스택이 이미 OTel을 쓰는 팀이면 기존 파이프라인에 얹기 쉽고, 아직 관측이 얕은 팀이면 SDK부터 시작하는 경로를 택할 수 있습니다.
실제 사용 시나리오
1. AI 코딩 어시스턴트 팀
Eval 점수는 올랐는데 리텐션이 정체됩니다. Agnost로 운영 대화를 보면 같은 에러를 세 번 다른 방식으로 물어보다 포기한 패턴이 보입니다. 해당 의도를 Active로 승인하고, 프롬프트·도구 설명 수정 PR을 리뷰·머지합니다.
2. 보이스 BDR / 세일즈 에이전트
미팅 예약률이 들쭉날쭉합니다. 전환된 대화와 실패한 대화의 의도·감정 신호를 비교해, 스크립트와 가드레일을 좁힙니다. Corgi Insure 사례처럼 실제로 전환된 대화 패턴을 표면화하는 용도입니다.
3. AI 컴패니언 / 튜터 제품
DAU는 괜찮지만 유료 전환이 약합니다. 대화 깊이·좌절 신호·의도 해결률을 함께 보면, 페이월 직전에 신뢰를 잃는 구간이 드러납니다. 블로그에서 강조하는 대화 단위 데이터 없이 하는 페이월 A/B는 노이즈라는 관점과 맞습니다.
4. 에이전트 품질 온콜
Tool Calls·Errors 화면으로 도구 실패를 보고, Alerts로 급증 패턴을 받고, Auto Improve로 후보 수정안을 쌓아 아침 스탠드업에서 PR만 리뷰하는 운영 리듬을 만들 수 있습니다.
가격 정책
공식 랜딩 기준 요금제 요약입니다. (통화 USD, 월간 표시)
| 플랜 | 가격 | 핵심 한도·기능 |
|---|---|---|
| Free | $0 | 의도·감정 시그널, 실패 탐지·해결, NL 데이터 쿼리, 월 1,000 events, 7일 보관 |
| Starter | $49/월 | Free 전부 + 자동 에이전트 개선, 월 10,000 events, 30일 보관, 온보딩 지원 |
| Pro | $499/월 | Starter 전부 + 월 1,000,000 events, 90일 보관, 우선 지원, Founders Slack |
| Enterprise | 커스텀 | VPC/셀프호스트, 커스텀 보관·SLA, 감사 로그, 커스텀 개선 워크플로, 우선 기능 요청 |
newflix 메타데이터에도 가격 라벨이 무료(free) 로 잡혀 있어, 평가·파일럿은 Free 티어에서 시작하기 쉽게 설계된 것으로 보입니다. 이벤트 볼륨이 큰 프로덕션 에이전트는 Starter 또는 Pro로 넘어가는 구조입니다. Enterprise는 규제·보안이 까다로운 조직용 옵션입니다.
참고: 이벤트 정의·초과 과금·연간 할인 여부는 공식 사이트/세일즈 확인이 필요합니다. 이 글은 공개 랜딩 문구 기준입니다.
경쟁 서비스 비교
Agnost AI는 LLM 트레이스 뷰어와 에이전트 자동 개선 사이에 걸쳐 있습니다.
| 비교 축 | Agnost AI | LangSmith / Phoenix 등 | Sentry (AI/에러) | 수작업 로그 리뷰 |
|---|---|---|---|---|
| 주 목적 | 실패 탐지 + 수정 PR | 트레이스·eval·디버깅 | 예외·성능 모니터링 | 샘플링 품질 검수 |
| 입력 | 채팅·음성 대화 | 스팬·트레이스·데이터셋 | 스택·트랜잭션 | 임의 대화 샘플 |
| 출력 | 의도/실패 카테고리, 알림, 리뷰용 PR | 대시보드, 데이터셋, 프롬프트 실험 | 이슈 티켓 | 회의 노트 |
| 루프 닫힘 | 관측→진단→제안까지 | 관측·실험 중심 | 장애 대응 중심 | 사람 의존 |
| 강점 | 프로덕션 unknown 실패, 제품 KPI 관점 | 개발자 디버깅 깊이 | 기존 APM 스택 연동 | 맥락 풍부 |
| 약점 | 신생 툴, 생태계·레퍼런스 규모 | 개선 자동화는 별도 | 대화 의도 분석은 약함 | 스케일 불가 |
같이 쓰기 좋은 조합
- LangSmith/Phoenix + Agnost: 개발 중 eval·트레이스는 기존 툴, 운영 대화 실패→PR 루프는 Agnost
- Sentry + Agnost: 인프라/런타임 예외는 Sentry, 사용자가 화났지만 예외는 안 난 실패는 Agnost
순수 트레이스 뷰어만 필요하고 PR 자동화까지 원하지 않는다면 기존 observability로 충분할 수 있습니다. 반대로 eval 점수는 높은데 이탈·전환이 안 나오는 팀이라면 Agnost의 문제 정의가 더 잘 맞습니다.
블로그가 보여주는 측정 프레임워크

Agnost 팀은 제품뿐 아니라 블로그로 대화형 AI KPI를 적극 교육합니다. 대표적으로 The 6 Metrics Every AI-Native Product Should Track 에서 강조하는 축은 다음과 같습니다.
- Intent Resolution Rate (IRR) — 의도가 해결된 대화 비율. 수익·리텐션과 가장 직접 연결된다고 주장
- Conversation Depth (결과별 세그먼트) — 해결된 대화의 깊이 vs 포기한 대화의 깊이
- Frustration Index — 재질문, 짧은 부정 후속, 긴 응답 후 이탈 등의 합성 신호
- Activation Conversation — 첫 주 특정 대화 패턴이 장기 리텐션을 예측
- Conversation Health Score — 사용자별 최근 N개 대화 건강도 (이탈 선행 지표)
- Silence Before Churn — 이탈 직전 메시지 길이·후속률 감소 패턴

에이전트 제품 전용으로는 Task Completion Rate, Path Efficiency, Trust signals, Recovery Rate, Delegation Depth 같은 Agent Experience 시그널도 정리합니다. 세션 수·토큰 사용량만 보면 사용자가 에이전트를 제한적으로만 쓰게 된 상태를 건강한 사용으로 오해할 수 있다는 경고입니다.

콘텐츠 포지션 자체도 제품 메시지와 일치합니다. "Evals Catch Known Unknowns. Production Catches Unknown Unknowns." 같은 헤드라인으로, 테스트 통과와 사용자 성공을 분리해 설명합니다.

수익화 관점에서는 페이월 A/B만 돌리면 세그먼트별 효과가 상쇄되어 평균만 좋아 보일 수 있다고 지적합니다. 업그레이드 직전 대화 맥락을 같이 봐야 한다는 주장으로, 제품의 대화 분석 → 액션 스토리를 강화합니다.
장단점 요약
장점
- eval과 운영 사이의 빈칸을 정확히 겨냥 — 많은 팀이 느끼는 문제를 제품 한 줄로 정의
- 관측에서 멈추지 않고 PR까지 — 개선 루프를 닫으려는 설계
- Intent 단위 UI — 실패를 사용자 스토리처럼 읽고 승인·거절 가능
- 연동 부담이 낮음 — SDK 3줄 또는 OpenTelemetry, 프레임워크 비종속
- Free 티어 존재 — 소량 이벤트로 먼저 검증 가능
- 측정 프레임워크가 탄탄 — IRR, Frustration Index 등 콘텐츠·제품 철학 일치
- YC 및 초기 고객 인용 — Google MCP Toolbox, Exa, Lopus AI 등 레퍼런스 메시지
단점
- 아직 신생 카테고리 플레이어 — 성숙한 관측 플랫폼 대비 레퍼런스·플러그인 폭은 좁을 수 있음
- 이벤트 한도 민감 — Free 1,000 / Starter 10,000 events는 트래픽 큰 에이전트에 빠르게 부족
- Pro $499는 점프가 큼 — 중간 규모 팀의 가격 사다리 고민 가능
- 자동 PR 품질은 워크로드 의존 — 모든 제안이 바로 머지 가능하지는 않음 (리뷰 전제)
- 한국어 전용 문서·지원 여부는 미확인 — 글로벌 영문 제품 중심
- 대화 데이터 민감성 — 암호화·보관 정책은 반드시 Trust Centre/약관 확인 필요
보안·프라이버시 메모
대화 로그는 사실상 사용자 발화·업무 맥락을 포함합니다. 공식 FAQ는 전송 중 암호화 등 보안을 강조하지만, 도입 전에는 다음을 확인하는 것이 안전합니다.
- 데이터 보관 기간(플랜별 7/30/90일)과 삭제 정책
- 학습/모델 개선 목적 사용 여부
- 리전·VPC/셀프호스트(Enterprise) 필요 여부
- PII 마스킹·레드액션 옵션
- 감사 로그·SSO 등 엔터프라이즈 통제
민감 업종(금융·의료·사내 코드 에이전트)이라면 Free 파일럿 전에 Trust Centre와 약관을 먼저 보는 편이 좋습니다.
총평
Agnost AI는 "에이전트를 더 똑똑한 모델로 갈아끼우기"가 아니라, 이미 쌓이는 운영 대화에서 실패를 캐내고 개선 PR로 돌리는 운영 체제에 가깝습니다. eval 스위트와 트레이스 툴을 이미 쓰는 팀일수록, 그 다음에 남는 질문 — 왜 사용자는 여전히 막히는가? — 에 대한 답이 됩니다.
지금 AI 에이전트를 프로덕션에 올려 둔 팀, 특히 다음 중 하나에 해당한다면 공식 사이트와 newflix 페이지를 함께 살펴볼 만합니다.
- eval은 통과하는데 리텐션·전환이 안 오른다
- 트레이스는 많은데 어디를 고칠지 합의가 안 된다
- 대화 속에 묻힌 기능 요청·버그를 백로그로 못 옮기고 있다
더 자세한 큐레이션 요약은 newflix에서 확인할 수 있습니다:
Agnost AI on newflix · 공식 사이트 agnost.ai
'AI 툴' 카테고리의 다른 글
| ContextVault — 팀 AI가 매번 처음부터 시작하지 않게 만드는 공유 메모리 계층 (1) | 2026.07.30 |
|---|---|
| 30 papers — Ilya Sutskever가 John Carmack에게 건넨다는 그 딥러닝 논문 목록 (0) | 2026.07.27 |
| MindMuse — 일기와 대화만으로 감정·수면·복약 패턴을 비추는 AI 일기장 (0) | 2026.07.24 |
| PixVerse — 텍스트·사진으로 만드는 AI 영상, 소셜 바이럴부터 광고까지 (0) | 2026.07.24 |
| Harper — 나를 위한 기회를 찾아 연결하는 AI 커리어 에이전트 (0) | 2026.07.21 |