TesterArmy — 웹·모바일 앱을 사람처럼 테스트하는 AI QA 에이전트

"URL만 주면 AI 에이전트가 실제 사용자처럼 클릭하고, 로그인하고, 버그 리포트를 남긴다."
TesterArmy는 Y Combinator 백킹을 받은 AI QA 서비스입니다. Playwright·Cypress처럼 테스트 코드를 유지하는 프레임워크가 아니라, 자연어로 여정을 적으면 클라우드 브라우저 에이전트가 실행·검증·증거(스크린샷·영상·로그)까지 남기는 서비스형 E2E 테스트입니다.
TL;DR
- 스크립트 없는 E2E — 로그인·온보딩·결제 같은 흐름을 평문으로 적으면 에이전트가 셀렉터 대신 비전·행동으로 수행
- 웹 + iOS/Android — 같은 프로젝트에서 웹·모바일 웹·네이티브 빌드(Expo/EAS 포함) 테스트 가능
- PR·배포·운영 모니터링 — GitHub PR 체크, Vercel/Netlify 프리뷰, 스케줄 모니터링, Slack/Discord 알림
- 증거 중심 리포트 — 단계별 결과, 이슈 설명, 스크린샷, 실행 영상, 공유 가능한 읽기 전용 링크
- 가격은 런 단위 — 신규 5회 무료 체험 후 Hobby $99/월(250런)·Startup $299/월(1,000런)·Enterprise 커스텀
핵심 정보 한눈에 보기
| 항목 | 내용 |
|---|---|
| 서비스명 | TesterArmy |
| 한 줄 설명 | 웹·모바일 앱을 사람처럼 테스트하는 AI QA 에이전트 |
| 카테고리 | 개발도구 / QA 자동화 |
| 플랫폼 | 웹 (클라우드 브라우저·디바이스 실행) |
| 핵심 입력 | 대상 URL 또는 앱 빌드 + 평문 테스트 스텝 |
| 연동 | GitHub, Slack, Discord, Webhook, Vercel, Netlify, Expo EAS, CLI |
| 보안·컴플라이언스 | SOC 2 Type 2, GDPR 표시 / 자격 증명 AES-256-GCM 저장(공식 FAQ) |
| 백킹 | Y Combinator |
| 무료 체험 | 신규 계정 5회 테스트 런 |
| 유료 시작가 | Hobby $99/월 (연간 결제 시 약 15% 할인 표기) |
| newflix 등록일 | 2026년 6월 22일 |
| 공식 사이트 | tester.army |
| 문서 | docs.tester.army |
| newflix 페이지 | newflix.io/s/tester |
어떤 문제를 풀까?
현대 제품팀은 배포 속도는 빨라졌는데 회귀 비용은 그대로입니다. 셀렉터 기반 E2E는 UI가 조금만 바뀌어도 깨지고, OTP·OAuth·봇 방어가 있는 실서비스 흐름은 유지보수가 특히 어렵습니다. 수동 QA는 정확하지만 매번 배포마다 반복하기 버겁습니다.
TesterArmy가 겨냥하는 문제는 세 가지로 정리됩니다.
- 테스트 코드 유지 비용 — Playwright/Cypress 스크립트를 매주 고치는 시간을 제품 개선에 쓰고 싶다.
- 실사용자 여정 검증 — 로그인, 결제, 온보딩처럼 “진짜 사람 손”이 필요한 경로를 배포마다 확인해야 한다.
- 배포 직후 안심 — PR 프리뷰·프로덕션에서 깨진 흐름을 사용자가 발견하기 전에 팀에 알리고 싶다.
newflix 큐레이터 노트처럼, “AI가 사람처럼 앱을 탐색하며 스크립트 없이 버그 리포트를 만들어 주는” 지점이 핵심 가치입니다. 프레임워크를 대체한다기보다, 유지보수 부담이 큰 핵심 여정 레이어를 서비스로 아웃소싱하는 포지션에 가깝습니다.
제품 한눈에 보기 — 랜딩과 포지셔닝

홈 히어로: 핵심 사용자 플로우를 분 단위로 모니터링하고, 웹·모바일을 평문 입력과 미디어/로그 리포트로 커버한다는 메시지를 전면 배치.
공식 랜딩은 “Catch broken flows before customers do / Start monitoring critical user flows in minutes” 톤으로, 기능 나열보다 장애 예방을 앞세웁니다. 히어로 옆 지표 카드는 포지션을 한 줄로 요약합니다.
- WORKING TIME 24/7 — 사람이 퇴근한 뒤에도 스케줄·배포 트리거로 계속 검증
- COVERAGE WEB/MOBILE — 웹만이 아니라 모바일 앱 빌드까지 같은 제품 안에서
- INPUT PLAIN TEXT — 테스트 코드가 아니라 자연어 스텝
- REPORTS MEDIA/LOGS — 통과/실패만이 아니라 스크린샷·녹화·로그 증거
스택 배너에는 Slack, CI/CD, GitHub, Expo, Vercel, Discord, API, Webhook이 등장합니다. “어떤 프레임워크를 쓰든, 배포 파이프라인에 붙일 수 있다”는 메시지입니다.
주요 기능 딥다이브
1) 평문 스텝으로 쓰는 AI E2E
문서 기준 테스트는 “한 사용자 여정”이고, 각 스텝은 로그인·검증·파일 업로드·스크린샷처럼 의도가 분명한 지시문입니다. 예시 톤은 다음과 같습니다.
저장해 둔 admin 계정으로 로그인한다.
Settings에서 Billing을 연다.
현재 플랜이 Pro로 표시되는지 확인한다.
에이전트는 셀렉터 하드코딩 대신 화면을 보고 행동합니다. 공식 소개에 따르면 복잡한 워크플로, 비전 기반 회귀 탐지, Google/비밀번호/이메일·SMS OTP 인증, 전용 메일함·실제 번호 OTP, 파일 업로드, 캡차 처리까지 포함됩니다. 자격 증명은 암호화 저장(AES-256-GCM)된다고 FAQ에 명시되어 있습니다.
2) Saved tests vs Exploration agent
| 방식 | 동작 | 적합한 경우 |
|---|---|---|
| Saved tests | 정의한 스텝을 매번 반복 실행 | 로그인·결제 등 핵심 회귀 |
| Exploration agent | PR 변경을 보고 계획을 만들어 탐색 | 변경점 주변의 예상 밖 이슈 |
실무에서는 핵심 플로우는 saved tests로 고정하고, PR마다 exploration을 얹어 커버리지를 넓히는 조합이 권장됩니다.
3) 프로젝트 모델 — Project → Environment → Test → Group → Run → Trigger
문서의 핵심 객체 모델입니다.
- Project: 하나의 웹/모바일 앱 단위. 테스트·환경·계정·연동·실행 이력 소유
- Environment: Production / Staging / PR Preview 등 “어디에 돌릴지”
- Test: 여정 + 순서 있는 스텝
- Group: PR 회귀·CI 웹훅·스케줄 모니터링의 실행 단위
- Run: 특정 대상에 대한 1회 실행 (그룹 실행 시 테스트마다 런 생성)
- Trigger: 수동, GitHub PR, GitLab/기타 CI, 스케줄
실행 상태와 테스트 결과를 분리하는 점도 실무적으로 중요합니다. completed + PASSED는 정상 통과, completed + FAILED는 제품/설정/스텝 이슈 발견, failed는 워커·브라우저 등 인프라 문제로 실행 자체가 중단된 경우입니다. “실행이 끝났다”와 “제품이 정상이었다”를 혼동하지 말라는 설계입니다.
4) 리포트 — 스크린샷, 영상, 공유 링크

공식 문서 Welcome: Get Started, Auth, Run, PR/프로덕션 모니터링, 마이그레이션 가이드까지 제품 표면적을 한눈에 보여 준다.
Results 탭에서는 스텝별 진행·요약·실패 원인, 이슈 설명, 스크린샷, (가능한 경우) 실행 영상을 제공합니다. 실패 시에는 첫 실패 스텝부터 보고, 환경 URL·자격 증명·스텝 문구를 점검하는 흐름을 문서가 가이드합니다. 읽기 전용 공유 링크로 외부 협업자도 증거를 볼 수 있습니다.
5) 자동화 — GitHub PR, 프리뷰, 스케줄, 알림
- GitHub 네이티브: PR 체크 상태, 코멘트, 회귀 그룹 실행
- 프리뷰: Vercel·Netlify 배포 프리뷰 URL에 동일 테스트 적용
- 기타 CI: 서명된 그룹 웹훅·API·CLI (
ta)로 GitLab/Jenkins/Buildkite 등 연결 - 프로덕션 모니터링: 반복 스케줄 + Slack/Discord/Email 알림
- 모바일: 앱 바이너리 업로드, Dev Build/Metro, GitHub Actions·Expo EAS 자동화
코딩 에이전트 워크플로도 강조됩니다. npm i -g testerarmy 후 ta agent init / ta auth로 CLI를 붙이면, Cursor·Claude Code 같은 에이전트가 프로젝트 생성·테스트 작성·실행까지 대신할 수 있습니다. “에이전트가 만든 UI를 에이전트가 검증”하는 루프를 염두에 둔 설계입니다.
6) Playwright/Cypress와 무엇이 다른가
공식 FAQ 표현을 요약하면 계층이 다릅니다.
- Playwright/Cypress = 프레임워크: 테스트 코드·셀렉터·플레이크 디버깅을 팀이 소유
- Playwright MCP 등 = 에이전트에 브라우저 제어권을 주는 원시 계층
- TesterArmy = 서비스: 평문 여정을 적으면 실행·유지·증거를 대신 제공. 저장소에 테스트 코드가 없어도 됨
즉 “셀렉터를 AI가 고쳐 주는 Playwright”가 아니라, 핵심 여정 QA를 외주화하는 레이어에 가깝습니다. 문서에는 Playwright/Puppeteer/Cypress/Selenium/Appium/Maestro/Mabl/Bug0 마이그레이션 페이지도 준비되어 있습니다.
실제 사용 시나리오
시나리오 A — 스타트업이 핵심 여정 3개를 매일 감시
- 프로젝트에
https://staging.app.com등록 - 테스트 계정·OTP 메일함 설정
- 로그인 / 결제 / 초대 수락을 평문으로 작성 후
Critical flows그룹에 묶기 - 매일 아침 스케줄 + 배포 웹훅 연결
- 실패 시 Slack으로 스크린샷·영상 링크 수신
수동 스모크 테스트를 “배포 후 내가 직접 클릭”에서 “배포 후 에이전트 결과 확인”으로 바꿉니다. 고객 후기 중에는 “첫 E2E가 2분 안에 돌았다”, “배포 후 프로덕션을 직접 확인하던 습관을 Slack 알림으로 대체했다”는 톤이 반복됩니다.
시나리오 B — PR마다 회귀 + 탐색
- GitHub App 연결
- 저장된 회귀 그룹을 PR 배포마다 실행
- Exploration agent로 변경 파일 주변 추가 점검
- PR 체크·코멘트로 실패 증거 공유
프론트엔드 리팩터링이 잦은 팀에서 “셀렉터 깨짐 때문에 CI가 빨간불”이 아니라 “제품 행동이 깨졌는지”에 집중하려는 패턴입니다.
시나리오 C — 코딩 에이전트와 로컬/프리뷰 QA
- CLI 설치 및 API 키 인증
- 에이전트에게
ta docs --json부터 시작해 프로젝트·테스트·실행을 지시 - 로컬 터널/프리뷰 URL에 대해 결과·아티팩트 회수
AI로 UI를 빠르게 만드는 팀일수록, 같은 속도로 검증 루프를 닫는 도구가 필요합니다. TesterArmy는 그 빈칸을 “별도 QA 엔지니어가 스크립트를 짜기 전”에 메우려 합니다.
가격 정책

공식 Pricing: 웹·모바일 테스트를 위한 Hobby·Startup·Enterprise 3단 구조. Startup에 MOST POPULAR 배지.
공식 가격 페이지(2026년 7월 확인) 기준 월간 요금은 다음과 같습니다. 연간 결제 시 약 15% 절감 토글이 있습니다.
| 플랜 | 월 가격 | 대상 | 핵심 포함 |
|---|---|---|---|
| 체험 | $0 | 평가 | 신규 계정 5회 테스트 런 |
| Hobby | $99/월 | 솔로 빌더 | 최대 250 테스트 런, 프로젝트 2, 멤버 무제한(표기), 웹·모바일, GitHub/Slack/Webhook |
| Startup | $299/월 | 소규모 팀 | Hobby 포함 + 1,000 런, 프로젝트 5, frontier 모델 강조 |
| Enterprise | 커스텀 | 조직 | Startup 포함 + Slack Connect SLA, 화이트글러브 온보딩, SSO/SAML, 커스텀 연동 |
FAQ 기준 테스트 런은 채팅·CLI·GitHub 배포·스케줄 등 트리거와 무관하게 1회 실행(최대 약 15분 단위로 카운트되는 구조로 안내)으로 계산됩니다. 팀 규모보다 월간 실행 횟수가 비용의 주축입니다.
주의할 점: $99부터 시작하는 가격대는 “개인 사이드 프로젝트용 무료 Playwright”와 비교하면 비쌉니다. 반대로 QA 인력 시간, 플레이크 디버깅, 장애 대응 비용을 줄이려는 수익형 제품팀에는 런 단위 과금이 예측 가능한 선택지가 될 수 있습니다.
경쟁 서비스와 비교
| 구분 | TesterArmy | Playwright / Cypress | 전통 로우코드 QA (예: Mabl 등) | 관측/에러 툴 (Sentry 등) |
|---|---|---|---|---|
| 계층 | AI 에이전트 QA 서비스 | 코드 프레임워크 | 녹화·모델 기반 테스트 플랫폼 | 런타임 오류·성능 모니터링 |
| 작성 방식 | 평문 스텝 | 코드·셀렉터 | 녹화/플로우 UI | 계측 코드 |
| 유지보수 | 서비스가 실행·적응 | 팀이 스크립트 소유 | 플랫폼이 일부 흡수 | 테스트가 아니라 관측 |
| 강점 | OTP/비전/PR 증거, 빠른 온보딩 | 완전 제어·로컬 재현성 | 엔터프라이즈 프로세스 | 실사용자 오류 포착 |
| 약점 | 월 구독·런 한도, 외부 실행 의존 | 작성·플레이크 비용 | 학습·가격·벤더 락 | 배포 전 여정 검증은 약함 |
같이 쓰기 좋은 조합
- 단위/통합 테스트 + Playwright 스모크 일부 + TesterArmy 핵심 여정
- Sentry/로그로 실사용 오류 추적, TesterArmy로 배포 전·직후 여정 게이트
- Postman 등으로 API 계약 검증, TesterArmy로 UI·인증이 얽힌 E2E
“모든 테스트를 TesterArmy로”보다는, 사람 손이 자주 가고 깨지면 매출·신뢰에 바로 영향 주는 경로에 먼저 두는 편이 비용 대비 효율이 높습니다.
장단점 요약
장점
- 평문 작성·분 단위 온보딩 — 비개발 QA·PM도 스텝 리뷰에 참여하기 쉬움
- 인증 실무 대응 — OAuth, 이메일/SMS OTP, 전용 인박스·번호, Basic Auth, Cloudflare Zero Trust 등
- 증거 품질 — 실패 시 스크린샷·영상·스텝 요약으로 “무엇이 깨졌는지” 공유가 빠름
- 배포 파이프라인 친화 — GitHub PR, Vercel/Netlify 프리뷰, 웹훅, 스케줄 모니터링
- 웹+모바일 단일 제품 — Expo/EAS·앱 업로드 경로 문서화
- 에이전트/CLI 친화 —
taCLI와 코딩 에이전트 워크플로, AI-readable docs - YC·SOC2/GDPR 메시지 — 초기 신뢰 신호와 엔터프라이즈 확장 스토리
단점·주의점
- 가격 허들 — Hobby $99/월부터라 취미·초소형 프로젝트에는 부담
- 런 한도 — 탐색 테스트를 남발하면 250/1,000 런이 빠르게 소진될 수 있음
- 외부 클라우드 실행 — 완전 오프라인·폐쇄망 전용 환경에는 부적합할 수 있음
- 결정론적 재현 — 비전·에이전트 특성상 “로컬에서 동일 셀렉터로 100% 재현” 프레임워크와는 철학이 다름
- 한국어 UI/지원 — 제품·문서는 영어 중심. 한국어 공식 지원 여부는 별도 확인 필요
- 과도한 기대 주의 — 단위 테스트·접근성 감사·보안 펜테스트를 대체하지 않음
이런 팀에게 맞을까?
잘 맞는 경우
- 주 수 회 이상 배포하며 로그인·결제·온보딩 회귀가 아픈 팀
- Playwright를 쓰고 있지만 셀렉터 유지에 지친 소규모 제품팀
- AI로 UI를 빠르게 만들고, 같은 속도로 스모크 검증이 필요한 팀
- QA 전담이 없거나 1명뿐인데 프로덕션 장애 비용이 큰 B2B SaaS
다른 선택을 고민할 경우
- 예산이 거의 없고 오픈소스 프레임워크로 충분한 사이드 프로젝트
- 모든 케이스를 코드로 버전 관리·오프라인 재현해야 하는 규제/임베디드 환경
- API 전용 서비스라 UI E2E 자체가 거의 없는 경우
총평
TesterArmy는 “더 똑똑한 셀렉터 도구”가 아니라 핵심 사용자 여정을 사람처럼 눌러 보고 증거를 남기는 AI QA 레이어입니다. URL(또는 앱 빌드)과 평문 스텝만으로 시작하고, PR·프리뷰·스케줄로 반복 실행하며, 실패 시 미디어 리포트로 팀에 전달하는 흐름이 제품 전체에 일관됩니다.
가격은 가볍지 않지만, 그만큼 타깃이 분명합니다. 배포 속도는 빠른데 수동 스모크와 플레이크 E2E에 시간을 쓰는 팀이라면, 5회 무료 런으로 핵심 플로우 하나만 붙여 보는 평가가 합리적입니다. 반대로 모든 테스트를 대체할 만능 도구로 기대하면 비용과 기대치가 어긋날 수 있습니다.
더 자세한 큐레이션 메모와 태그·출처는 newflix 서비스 페이지에서 이어서 볼 수 있습니다.
→ https://newflix.io/s/tester
→ 공식: https://tester.army · 문서: https://docs.tester.army
본 글은 newflix 서비스 페이지, 공식 사이트·가격·문서(2026년 7월 확인)를 바탕으로 작성되었습니다. 요금·한도·기능은 변경될 수 있으니 도입 전 공식 페이지를 확인해 주세요.
'개발도구' 카테고리의 다른 글
| 가루(Garu) — 브라우저에서 바로 도는 1.4MB 한국어 형태소 분석기 (1) | 2026.07.27 |
|---|---|
| OCTOMO — 고객이 보내는 문자로 SMS 인증 비용을 0원으로 만드는 MO 인증 API (0) | 2026.07.26 |
| 내일도 (Naeildo) — URL 하나면 끝, 9개 보안 AI Agent가 바이브코딩 취약점을 잡아준다 (0) | 2026.07.22 |
| Intuned — AI가 Playwright 스크레이퍼를 만들고 스스로 고치는 브라우저 자동화 플랫폼 (0) | 2026.07.20 |
| Postman — API 개발·테스트·협업까지, 수천만 개발자가 쓰는 API 플랫폼 (1) | 2026.07.19 |