TypeSafe Jev: 말하는 AI 대신, 판단을 돌려주는 AI
고객 문의를 담당 부서로 보내는 데 꼭 긴 답변을 생성해야 할까? TypeSafe AI가 9월 14일 얼리 액세스로 공개한 Jev는 이 질문에서 출발한다.[1] 회사가 ‘System One Model’이라고 부르는 이 모델은 문장을 쓰는 대신, 소프트웨어가 바로 사용할 구조화된 판단과 확률을 반환한다.[1] 한국 시간 9월 21일 기준 공식 발표와 개발 문서로 특징과 한계를 살펴봤다.

챗봇보다 ‘판단 함수’에 가깝다
Jev에는 판단할 자료인 state와 질문인 questions를 나눠 전달한다.[4] 예를 들어 고객 문의가 자료라면 ‘어느 부서가 담당하는가’, ‘얼마나 긴급한가’를 각각 묻는 방식이다. 공식 API는 선택지 중 하나를 고르는 Choice, 기준표에 따라 평가하는 Score, 명제의 참 여부를 0~1로 표현하는 Noul을 제공한다.[4]
여러 질문은 같은 자료를 바탕으로 병렬 평가되며, 복합적인 문제는 작은 질문으로 나누고 결과를 코드에서 조합하도록 권한다.[4] ‘이 요청을 처리해도 되는가’ 하나에 모든 정책을 넣기보다, 조건별 판단을 받은 뒤 최종 실행 규칙은 개발자가 관리하는 접근이다.
빠르고 저렴하다는 주장, 조건도 함께 보자
TypeSafe는 발표문에서 종단 간 응답 시간을 70~500ms, 입력 100만 토큰 가격을 0.042달러로 제시했다.[1] Vercel AI Gateway의 Jev 페이지에도 같은 입력 단가가 기재돼 있다.[3] 다만 겜집이 API를 호출해 속도나 청구액을 실측한 결과는 아니다.
회사의 ‘193.6배 빠르고 444.6배 저렴하다’는 수치는 자체 워크플로 평가에서 나왔으며, 회사도 실제 활용에서 기대할 수 있는 개선 폭의 높은 쪽에 해당한다고 설명한다.[1] 평가 기준은 사람의 정답 라벨이 아니라 다른 대형 모델의 평균 예측이고, 비교 LLM에는 확률 출력을 위한 래퍼를 사용했다.[1] 따라서 이를 모든 작업에서의 속도·비용 우위로 일반화할 수는 없다.
‘환각 없음’은 ‘오답 없음’이 아니다
TypeSafe가 제시한 0% 수치는 실험으로 관측한 모든 오류의 비율이 아니라, 출력이 정해진 스키마를 따른다는 보장에 근거한다.[1] 허용되지 않은 형식을 만들지 않는 것과, 허용된 선택지 중 정답을 고르는 것은 다른 문제다. ‘결제’와 ‘기술 지원’ 중 틀린 부서를 선택해도 형식은 올바를 수 있다.
Pydantic AI 문서도 Jev의 산술·개수 세기·날짜 판단, 여러 단계가 필요한 질문, 답을 유도하는 적대적 입력에 주의를 요구한다.[2] 이 연동에서 제공하는 confidence 역시 정답일 확률 자체가 아니라 확률 분포에서 산출한 지표라고 설명한다.[2] 높은 숫자만 보고 자동 실행을 허용하기보다, 실제 업무의 정답 데이터로 기준을 검증해야 한다.
게임에서도 쓸 수 있을까?
공식 발표에는 Doom 시연도 등장한다. 다만 화면 이미지를 직접 읽는 방식이 아니라 텍스트를 포함한 구조화된 게임 상태를 입력으로 사용했으며, 회사는 일반적인 비AI 봇이 더 잘 플레이할 수도 있다고 밝혔다.[1] 게임 화면을 이해하는 범용 플레이어로 소개하면 시연의 의미를 과장하게 된다.
겜집 관점에서는 ‘AI가 게임 전체를 만든다’보다 NPC의 제한된 행동 선택이나 신고 분류 같은 용도를 먼저 떠올릴 만하다. 이는 적용 아이디어이지 검증된 게임 성능이 아니다. 이동·공격처럼 가능한 행동을 코드로 제한하고, 잘못된 판단의 영향을 작게 만드는 설계가 먼저다.
겜집 해설: LLM을 없애기보다 역할을 나눈다
Jev는 자유로운 글이나 도구 인자를 생성하는 모델이 아니다.[2] 대신 Pydantic AI는 확신이 낮은 요청을 다른 언어 모델로 넘기는 연동 방식을 설명한다.[2] 빠른 분류는 Jev에, 설명과 복잡한 처리는 LLM이나 사람에게 맡기는 구성이 자연스럽다.
도입을 검토한다면 자체 데이터의 오분류율, 사람에게 넘어가는 비율, 실제 응답 지연을 함께 보자. 특히 환불·계정 제재처럼 영향이 큰 작업에서는 모델의 판단과 실행 권한을 분리해야 한다. Jev의 흥미로운 지점은 ‘절대 틀리지 않는 AI’가 아니라, AI의 판단을 소프트웨어의 명시적인 규칙 안에 넣으려는 인터페이스다.
Sources
[1] https://typesafe.ai/blog/introducing-system-one-models-and-jev [2] https://pydantic.dev/docs/ai/models/typesafe [3] https://vercel.com/ai-gateway/models/jev [4] https://docs.typesafe.ai — TypeSafe 공식 개발 문서

