"글도 안 써주고, 말도 안 하고, 코드도 안 짜는 AI 모델이 왜 2억 달러의 기업 가치를 인정받았을까?" 오픈AI의 ChatGPT 및 RLHF 핵심 주역이었던 디오고 알메이다(Diogo Almeida)가 설립한 TypeSafe AI의 신규 모델 Jev가 테크 업계를 뒤흔들고 있습니다. 생성(Generation)을 버리고 순수한 판단(Decision)만을 취한 '시스템 1' AI의 실체를 알기 쉽게 정리합니다.
3줄 요약
- 2026년 9월 15일 공개된 TypeSafe AI의 Jev는 문장이나 코드를 생성하지 않고 오직 정형화된 선택(Choice), 확률(Noul), 점수(Score)만을 반환하는 비생성형(Non-Generative) 의사결정 모델입니다.
- 대니얼 카너먼의 행동경제학 이론인 '시스템 1(빠르고 직관적인 반사신경)'을 AI로 구현하여, 기존 LLM 대비 최대 50배 빠른 70~500ms의 초저지연과 입력 100만 토큰당 0.042달러(출력 토큰 완전 무료)라는 파격적인 비용을 달성했습니다.
- 모든 것을 생성형 거대 모델에 맡기던 비효율적인 '토큰 맥싱' 관행에서 벗어나, 상단에서 Jev가 빛의 속도로 분류·검증하고 하단에서 고성능 LLM이 복잡한 작업을 수행하는 2단 에이전트 파이프라인이 표준으로 자리잡고 있습니다.
왜 생성하지 않는 모델에 열광하는가: '토큰 맥싱'의 피로감
지난 수년간 인공지능 업계의 지상 과제는 "어떻게 하면 더 긴 글을 쓰고, 더 정교한 코드를 생성할 것인가"였습니다. GPT-4에서 GPT-5, 그리고 최신 GPT-6와 Claude Opus에 이르기까지 모델들은 점점 거대해졌고, 사람처럼 유려하게 대화하는 능력을 갖추었습니다.
하지만 실제 엔터프라이즈 환경과 소프트웨어 백엔드에서 AI를 적용하던 엔지니어들은 심각한 현실적 장벽에 부딪혔습니다:
- "이 고객 문의가 환불 요청인지 단순 문의인지 분류하는 데 거대 LLM을 호출하느라 4초가 걸리고 건당 수십 원씩 나갑니다."
- "사용자 입력에 유해한 내용이 있는지 검사하는 단순 'Yes/No' 판단을 위해 1,000토큰짜리 거대 모델의 문맥을 매번 회전시켜야 합니다."
- "단순 라우팅이나 점수 매기기 작업인데도 모델이 가끔 쓸데없는 인사말이나 장황한 서론을 붙여 파싱 에러를 유발합니다."
소프트웨어가 진정으로 필요로 하는 것은 **장황한 미사여구가 아니라, 즉각적이고 확신에 찬 단 하나의 구조화된 결정(Decision)**이었습니다.
인간의 두뇌에 비유하자면, 날아오는 공을 피할 때 우리는 깊은 물리 법칙을 계산하지 않습니다. 뇌의 **'시스템 1(직관과 반사신경)'**이 0.1초 만에 몸을 움직이게 합니다. 반면 기존 AI 시스템은 날아오는 공을 보면서 아인슈타인의 상대성 이론을 장문 에세이로 작성하고 있었던 셈입니다.
Jev란 무엇인가: 세 가지 프리미티브로 작동하는 판단 머신
TypeSafe AI의 Jev는 텍스트 생성을 완전히 거부하도록 설계된 순수 결정 전용(Decision-Only) 모델입니다. 프롬프트로 아무리 시나 소설을 써달라고 부탁해도 글을 쓰지 않습니다. 대신 복잡한 비정형 데이터(사용자 질의, 시스템 로그, 에이전트 실행 기록)를 입력받아 프로그래밍 언어가 즉시 다룰 수 있는 **세 가지 원시 타입(Primitives)**으로만 결과를 반환합니다.
┌───────────────────────────────┐
│ 비정형 입력 (로그/텍스트) │
└──────────────┬────────────────┘
│
[TypeSafe AI Jev 엔진]
│
┌───────────────────────┼───────────────────────┐
▼ ▼ ▼
1. Choice (선택) 2. Noul (확률) 3. Score (점수)
["refund", "tech", ...] [True/False + 확률] [0.0 ~ 1.0 보정 수치]
티켓 라우팅, 의도 분류 보안 검사, 승인 여부 우선순위, 리스크 점수
1. Choice: 다자택일 분류 (Categorical Choice)
사전에 정의된 카테고리 목록 중 가장 적합한 항목을 하나 선택합니다. 고객센터 문의를 '결제', '배송', '기술지원', '단순변심' 등으로 찰나의 순간에 분류할 때 사용됩니다.
2. Noul: 조건 충족 여부와 확신도 (Calibrated Boolean)
특정 조건이 참(True)인지 거짓(False)인지 판단함과 동시에, 모델이 그 판단에 대해 몇 퍼센트의 확신을 갖고 있는지 정밀하게 보정된 확률값을 함께 제공합니다. ("이 트랜잭션이 사기일 확률 94.2%")
3. Score: 연속적인 수치 평가 (Calibrated Score)
0.0에서 1.0 사이, 혹은 정의된 척도 위에서 우선순위나 위험도를 점수화합니다. 수천 건의 지원 티켓 중 어떤 고객을 VIP 큐로 먼저 배치해야 할지 정렬할 때 위력을 발휘합니다.
압도적인 벤치마크: 70ms 지연 시간과 '무료 출력 토큰'
Jev가 소프트웨어 아키텍트들을 가장 열광시킨 지점은 경이로운 속도와 파격적인 과금 모델입니다.
| 비교 항목 | 기존 범용 LLM (GPT-6 Sol / Claude Sonnet 등) | TypeSafe AI Jev | 개선 폭 |
|---|---|---|---|
| 평균 응답 지연(Latency) | 2,500ms ~ 5,000ms | 70ms ~ 500ms | 최대 30~50배 단축 |
| 입력 토큰 비용 (100만 토큰당) | $2.00 ~ $3.00 | $0.042 | 약 50~70배 저렴 |
| 출력 토큰 비용 (100만 토큰당) | $10.00 ~ $15.00 | $0.00 (완전 무료) | 비용 0원 |
| 출력 포맷 무결성 | JSON 파싱 실패 가능성 (0.1~1%) | 타입 불일치 오류 0% (완전 보장) | 스키마 런타임 에러 영구 박멸 |
Jev는 한 글자씩 다음 단어를 예측하는 자동회귀(Autoregressive) 생성 방식을 쓰지 않고, 인코더 기반의 병렬 상태 평가 아키텍처를 채택했습니다.
그 결과 텍스트를 한 줄 한 줄 타이핑하듯 출력하느라 발생하는 지연 시간이 완전히 사라졌으며, 텍스트 토큰을 생성하지 않으므로 출력 토큰 요금이 아예 0원입니다. 백엔드 API 서버를 구축하는 개발자 입장에서는 더 이상 JSON 파싱 정규식을 짜거나 재시도(Retry) 로직에 매달릴 필요가 없어진 것입니다.
2단 하이브리드 파이프라인: 에이전트의 새로운 표준 아키텍처
그렇다면 Jev가 등장했으니 기존의 GPT-6나 Claude 같은 거대 생성 모델은 필요 없어지는 것일까요? 전혀 그렇지 않습니다. 업계의 방향은 두 모델의 분업으로 향하고 있습니다.
[차세대 AI 에이전트 파이프라인]
사용자 요청 유입
│
▼
┌────────────────────────────────────────────────────────┐
│ 1단계: TypeSafe Jev (시스템 1 - 반사신경 게이트) │
│ - 입력 보안 검사: Noul (악의적 프롬프트 확률 0.1% ➔ 통과)│
│ - 인텐트 라우팅: Choice ('복잡한 데이터 분석' 선택) │
│ - 소요 시간: 90ms / 소요 비용: $0.00004 │
└──────────────────────────┬─────────────────────────────┘
│
▼
┌────────────────────────────────────────────────────────┐
│ 2단계: GPT-6 / Claude Opus (시스템 2 - 심층 사고) │
│ - 1단계에서 라우팅된 요청에 대해 심층 추론 및 코드 작성 │
│ - 소요 시간: 4.5초 / 고품질 분석 보고서 생성 │
└────────────────────────────────────────────────────────┘
- 상단 게이트키퍼 (Jev): 모든 유입 트래픽을 맨 앞에서 맞이합니다. 스팸 필터링, 민감정보(PII) 차단, 의도 분류, 캐시 적중 여부를 100ms 이내에 $0.00004의 비용으로 즉시 처리합니다. 단순 문의라면 거대 모델을 부르지도 않고 시스템 1 선에서 즉시 DB 쿼리로 끝냅니다.
- 하단 실행 엔진 (Frontier LLM): Jev가 엄격하게 필터링하고 분류해 준 정제된 작업만을 전달받아, 자신의 장점인 복잡한 코딩, 크리에이티브 글쓰기, 다단계 논리 추론에만 집중합니다.
이 구조를 도입한 기업들은 전체 AI 운영 비용을 60~80% 절감하면서도, 시스템의 체감 반응 속도를 극적으로 끌어올리는 데 성공하고 있습니다.
자주 묻는 질문 (FAQ)
Q1. BERT나 RoBERTa 같은 기존 분류 모델과 무엇이 다른가요?
과거의 BERT 모델은 고정된 라벨로 사전에 전이학습(Fine-tuning)을 거쳐야만 작동했습니다. 반면 Jev는 최신 파운데이션 모델 스케일의 지식을 사전 학습하여, 개발자가 런타임에 동적으로 제공하는 선택지(Choice)와 복잡한 비즈니스 규칙을 제로샷(Zero-shot)으로 즉시 이해하고 분류합니다.
Q2. 오픈소스 모델로 직접 서빙하는 것보다 경제적인가요?
자체 GPU 인프라를 구축해 작은 Llama 모델을 띄우더라도, GPU 인스턴스 유지비, 오토스케일링 지연, 동시성 처리 비용이 발생합니다. 100만 입력 토큰당 0.042달러(한화 약 58원)에 출력 비용이 무료인 완전 관리형 API는 대부분의 스타트업과 엔터프라이즈 환경에서 자체 호스팅보다 훨씬 저렴합니다.
Q3. 복잡한 수학 문제나 다단계 추론도 Jev로 풀 수 있나요?
풀 수 없습니다. Jev는 생각의 과정을 거치지 않는 '직관적 반사신경' 모델입니다. 수식을 전개하거나 여러 단계의 가설을 검증해야 하는 작업은 반드시 Thinking Budget이 탑재된 Gemini나 OpenAI의 추론 모델에 맡겨야 합니다.