KORTRESS
2026-09-25• ai

말하는 대신 판단만 하는 AI: TypeSafe Jev가 바꿀 에이전트 아키텍처와 '시스템 1'의 귀환

by Ko

"글도 안 써주고, 말도 안 하고, 코드도 안 짜는 AI 모델이 왜 2억 달러의 기업 가치를 인정받았을까?" 오픈AI의 ChatGPT 및 RLHF 핵심 주역이었던 디오고 알메이다(Diogo Almeida)가 설립한 TypeSafe AI의 신규 모델 Jev가 테크 업계를 뒤흔들고 있습니다. 생성(Generation)을 버리고 순수한 판단(Decision)만을 취한 '시스템 1' AI의 실체를 알기 쉽게 정리합니다.


3줄 요약

  1. 2026년 9월 15일 공개된 TypeSafe AI의 Jev는 문장이나 코드를 생성하지 않고 오직 정형화된 선택(Choice), 확률(Noul), 점수(Score)만을 반환하는 비생성형(Non-Generative) 의사결정 모델입니다.
  2. 대니얼 카너먼의 행동경제학 이론인 '시스템 1(빠르고 직관적인 반사신경)'을 AI로 구현하여, 기존 LLM 대비 최대 50배 빠른 70~500ms의 초저지연과 입력 100만 토큰당 0.042달러(출력 토큰 완전 무료)라는 파격적인 비용을 달성했습니다.
  3. 모든 것을 생성형 거대 모델에 맡기던 비효율적인 '토큰 맥싱' 관행에서 벗어나, 상단에서 Jev가 빛의 속도로 분류·검증하고 하단에서 고성능 LLM이 복잡한 작업을 수행하는 2단 에이전트 파이프라인이 표준으로 자리잡고 있습니다.

왜 생성하지 않는 모델에 열광하는가: '토큰 맥싱'의 피로감

지난 수년간 인공지능 업계의 지상 과제는 "어떻게 하면 더 긴 글을 쓰고, 더 정교한 코드를 생성할 것인가"였습니다. GPT-4에서 GPT-5, 그리고 최신 GPT-6와 Claude Opus에 이르기까지 모델들은 점점 거대해졌고, 사람처럼 유려하게 대화하는 능력을 갖추었습니다.

하지만 실제 엔터프라이즈 환경과 소프트웨어 백엔드에서 AI를 적용하던 엔지니어들은 심각한 현실적 장벽에 부딪혔습니다:

  • "이 고객 문의가 환불 요청인지 단순 문의인지 분류하는 데 거대 LLM을 호출하느라 4초가 걸리고 건당 수십 원씩 나갑니다."
  • "사용자 입력에 유해한 내용이 있는지 검사하는 단순 'Yes/No' 판단을 위해 1,000토큰짜리 거대 모델의 문맥을 매번 회전시켜야 합니다."
  • "단순 라우팅이나 점수 매기기 작업인데도 모델이 가끔 쓸데없는 인사말이나 장황한 서론을 붙여 파싱 에러를 유발합니다."

소프트웨어가 진정으로 필요로 하는 것은 **장황한 미사여구가 아니라, 즉각적이고 확신에 찬 단 하나의 구조화된 결정(Decision)**이었습니다.

인간의 두뇌에 비유하자면, 날아오는 공을 피할 때 우리는 깊은 물리 법칙을 계산하지 않습니다. 뇌의 **'시스템 1(직관과 반사신경)'**이 0.1초 만에 몸을 움직이게 합니다. 반면 기존 AI 시스템은 날아오는 공을 보면서 아인슈타인의 상대성 이론을 장문 에세이로 작성하고 있었던 셈입니다.


Jev란 무엇인가: 세 가지 프리미티브로 작동하는 판단 머신

TypeSafe AI의 Jev는 텍스트 생성을 완전히 거부하도록 설계된 순수 결정 전용(Decision-Only) 모델입니다. 프롬프트로 아무리 시나 소설을 써달라고 부탁해도 글을 쓰지 않습니다. 대신 복잡한 비정형 데이터(사용자 질의, 시스템 로그, 에이전트 실행 기록)를 입력받아 프로그래밍 언어가 즉시 다룰 수 있는 **세 가지 원시 타입(Primitives)**으로만 결과를 반환합니다.

                  ┌───────────────────────────────┐
                  │    비정형 입력 (로그/텍스트)    │
                  └──────────────┬────────────────┘
                                 │
                     [TypeSafe AI Jev 엔진]
                                 │
         ┌───────────────────────┼───────────────────────┐
         ▼                       ▼                       ▼
   1. Choice (선택)         2. Noul (확률)          3. Score (점수)
   ["refund", "tech", ...]   [True/False + 확률]      [0.0 ~ 1.0 보정 수치]
   티켓 라우팅, 의도 분류      보안 검사, 승인 여부       우선순위, 리스크 점수

1. Choice: 다자택일 분류 (Categorical Choice)

사전에 정의된 카테고리 목록 중 가장 적합한 항목을 하나 선택합니다. 고객센터 문의를 '결제', '배송', '기술지원', '단순변심' 등으로 찰나의 순간에 분류할 때 사용됩니다.

2. Noul: 조건 충족 여부와 확신도 (Calibrated Boolean)

특정 조건이 참(True)인지 거짓(False)인지 판단함과 동시에, 모델이 그 판단에 대해 몇 퍼센트의 확신을 갖고 있는지 정밀하게 보정된 확률값을 함께 제공합니다. ("이 트랜잭션이 사기일 확률 94.2%")

3. Score: 연속적인 수치 평가 (Calibrated Score)

0.0에서 1.0 사이, 혹은 정의된 척도 위에서 우선순위나 위험도를 점수화합니다. 수천 건의 지원 티켓 중 어떤 고객을 VIP 큐로 먼저 배치해야 할지 정렬할 때 위력을 발휘합니다.


압도적인 벤치마크: 70ms 지연 시간과 '무료 출력 토큰'

Jev가 소프트웨어 아키텍트들을 가장 열광시킨 지점은 경이로운 속도와 파격적인 과금 모델입니다.

비교 항목기존 범용 LLM (GPT-6 Sol / Claude Sonnet 등)TypeSafe AI Jev개선 폭
평균 응답 지연(Latency)2,500ms ~ 5,000ms70ms ~ 500ms최대 30~50배 단축
입력 토큰 비용 (100만 토큰당)$2.00 ~ $3.00$0.042약 50~70배 저렴
출력 토큰 비용 (100만 토큰당)$10.00 ~ $15.00$0.00 (완전 무료)비용 0원
출력 포맷 무결성JSON 파싱 실패 가능성 (0.1~1%)타입 불일치 오류 0% (완전 보장)스키마 런타임 에러 영구 박멸

Jev는 한 글자씩 다음 단어를 예측하는 자동회귀(Autoregressive) 생성 방식을 쓰지 않고, 인코더 기반의 병렬 상태 평가 아키텍처를 채택했습니다.

그 결과 텍스트를 한 줄 한 줄 타이핑하듯 출력하느라 발생하는 지연 시간이 완전히 사라졌으며, 텍스트 토큰을 생성하지 않으므로 출력 토큰 요금이 아예 0원입니다. 백엔드 API 서버를 구축하는 개발자 입장에서는 더 이상 JSON 파싱 정규식을 짜거나 재시도(Retry) 로직에 매달릴 필요가 없어진 것입니다.


2단 하이브리드 파이프라인: 에이전트의 새로운 표준 아키텍처

그렇다면 Jev가 등장했으니 기존의 GPT-6나 Claude 같은 거대 생성 모델은 필요 없어지는 것일까요? 전혀 그렇지 않습니다. 업계의 방향은 두 모델의 분업으로 향하고 있습니다.

[차세대 AI 에이전트 파이프라인]

사용자 요청 유입
       │
       ▼
┌────────────────────────────────────────────────────────┐
│ 1단계: TypeSafe Jev (시스템 1 - 반사신경 게이트)         │
│  - 입력 보안 검사: Noul (악의적 프롬프트 확률 0.1% ➔ 통과)│
│  - 인텐트 라우팅: Choice ('복잡한 데이터 분석' 선택)      │
│  - 소요 시간: 90ms / 소요 비용: $0.00004               │
└──────────────────────────┬─────────────────────────────┘
                           │
                           ▼
┌────────────────────────────────────────────────────────┐
│ 2단계: GPT-6 / Claude Opus (시스템 2 - 심층 사고)       │
│  - 1단계에서 라우팅된 요청에 대해 심층 추론 및 코드 작성   │
│  - 소요 시간: 4.5초 / 고품질 분석 보고서 생성             │
└────────────────────────────────────────────────────────┘
  1. 상단 게이트키퍼 (Jev): 모든 유입 트래픽을 맨 앞에서 맞이합니다. 스팸 필터링, 민감정보(PII) 차단, 의도 분류, 캐시 적중 여부를 100ms 이내에 $0.00004의 비용으로 즉시 처리합니다. 단순 문의라면 거대 모델을 부르지도 않고 시스템 1 선에서 즉시 DB 쿼리로 끝냅니다.
  2. 하단 실행 엔진 (Frontier LLM): Jev가 엄격하게 필터링하고 분류해 준 정제된 작업만을 전달받아, 자신의 장점인 복잡한 코딩, 크리에이티브 글쓰기, 다단계 논리 추론에만 집중합니다.

이 구조를 도입한 기업들은 전체 AI 운영 비용을 60~80% 절감하면서도, 시스템의 체감 반응 속도를 극적으로 끌어올리는 데 성공하고 있습니다.


자주 묻는 질문 (FAQ)

Q1. BERT나 RoBERTa 같은 기존 분류 모델과 무엇이 다른가요?

과거의 BERT 모델은 고정된 라벨로 사전에 전이학습(Fine-tuning)을 거쳐야만 작동했습니다. 반면 Jev는 최신 파운데이션 모델 스케일의 지식을 사전 학습하여, 개발자가 런타임에 동적으로 제공하는 선택지(Choice)와 복잡한 비즈니스 규칙을 제로샷(Zero-shot)으로 즉시 이해하고 분류합니다.

Q2. 오픈소스 모델로 직접 서빙하는 것보다 경제적인가요?

자체 GPU 인프라를 구축해 작은 Llama 모델을 띄우더라도, GPU 인스턴스 유지비, 오토스케일링 지연, 동시성 처리 비용이 발생합니다. 100만 입력 토큰당 0.042달러(한화 약 58원)에 출력 비용이 무료인 완전 관리형 API는 대부분의 스타트업과 엔터프라이즈 환경에서 자체 호스팅보다 훨씬 저렴합니다.

Q3. 복잡한 수학 문제나 다단계 추론도 Jev로 풀 수 있나요?

풀 수 없습니다. Jev는 생각의 과정을 거치지 않는 '직관적 반사신경' 모델입니다. 수식을 전개하거나 여러 단계의 가설을 검증해야 하는 작업은 반드시 Thinking Budget이 탑재된 Gemini나 OpenAI의 추론 모델에 맡겨야 합니다.


관련 아티클 함께 읽기

댓글 (0)

첫 번째 댓글을 남겨보세요.