KORTRESS
2026-09-03 news

GPT-6 아스트라(Astra) 정리: 달라진 점과 컴퓨터 조작 사용법

by Ko

컴퓨터 화면을 직접 보고 마우스와 키보드로 사람 대신 프로그램을 다루는 기술이 이번 모델의 핵심입니다. 작동 메커니즘과 경쟁사 대비 실제 비용, 실패 없는 실전 활용법을 정리했습니다.


3줄 요약

  1. GPT-6 아스트라(Astra)는 질문에 텍스트로 답하는 수준을 넘어, 사람처럼 모니터 화면을 보고 마우스와 키보드를 직접 움직여 여러 단계의 컴퓨터 작업을 끝까지 완수하는 모델입니다.
  2. 여러 프로그램을 오가는 복잡한 작업 성공률이 72.6%로 크게 올랐고, 전작(GPT-5.6 Sol) 대비 마우스 조작 반응 속도와 좌표 인식 정확도가 눈에 띄게 개선되었습니다.
  3. 매 행동마다 화면을 캡처해 토큰을 소모하는 구조이므로, 단순 검색보다는 사람이 직접 하면 10분 이상 걸리는 반복적인 컴퓨터 노가다 작업에 투입할 때 가장 효과적입니다.

인공지능에게 긴 글을 요약해 달라고 하거나 기획서 초안을 써달라고 부탁하는 일은 이제 자연스러운 일상이 되었습니다. 하지만 우리가 회사나 일상에서 컴퓨터를 켜고 하는 실제 업무를 돌아보면, 단순히 글을 주고받는 데서 끝나지 않습니다.

웹브라우저를 열어 필요한 사이트에 접속하고, 팝업창을 닫은 뒤 검색창에 키워드를 넣고, 원하는 표나 문서를 내려받아 엑셀에 옮겨 적고, 그 파일을 다시 폴더에 정리하는 일련의 과정이 이어집니다. 지금까지 나온 대화형 인공지능 도구들은 "어떻게 하면 될까요?"라는 질문에는 유창하게 답했지만, 정작 마우스를 잡고 버튼을 누르는 물리적인 일은 사람이 온전히 떠맡아야 했습니다.

오픈AI가 2026년 9월 3일 공개한 **GPT-6 아스트라(Astra)**는 바로 이 번거로운 컴퓨터 조작 과정을 인공지능이 직접 대신하도록 설계된 모델입니다. 화면 속 버튼과 입력창의 위치를 시각적으로 분별하고, 가상 마우스 커서를 움직여 클릭하며, 창을 넘나들며 작업을 마치는 쪽으로 진화했습니다.

이번 모델이 실제로 어떻게 화면을 다루는지, 비용은 얼마나 들고 어떤 작업에 맡겨야 돈값을 하는지 실용적인 관점에서 차근차근 짚어보겠습니다.


컴퓨터 화면을 보고 움직이는 3단계 메커니즘

아스트라가 컴퓨터를 다루는 방식은 사람이 모니터 앞에 앉아 일하는 방식과 매우 닮아 있습니다. 화면 전체를 하나의 시각 정보로 받아들이고, 다음 행동을 결정한 뒤 마우스와 키보드를 움직입니다.

[1단계: 화면 캡처 및 좌표 변환]
모니터 화면 스크린샷 ──> 버튼·입력창의 (X, Y) 픽셀 좌표 계산
                                   │
                                   ▼
[2단계: 다음 행동 계획 수립]
지시문 대조 ──> "팝업창 닫기 버튼 클릭" 및 "입력창에 검색어 타이핑" 결정
                                   │
                                   ▼
[3단계: 가상 조작 및 화면 변화 검증]
마우스 클릭 및 키보드 입력 ──> 화면이 의도대로 바뀌었는지 재캡처 확인

1. 화면 캡처와 좌표 계산

에이전트는 모니터 화면을 실시간 동영상으로 계속 보고 있는 것이 아닙니다. 행동을 취할 때마다 화면 전체의 스크린샷을 찍어 비전 신경망으로 읽어 들입니다. 화면에 떠 있는 버튼의 위치, 텍스트 상자, 아이콘의 중심점을 픽셀 단위의 (X, Y) 좌표로 즉시 계산해 냅니다.

2. 가상 마우스와 키보드 조작

좌표가 정해지면 운영체제 차원의 가상 마우스를 이동시켜 클릭, 더블클릭, 드래그앤드롭을 실행합니다. 글자를 입력할 때는 타이핑 명령을 내리고, 가려진 내용이 있다면 마우스 휠을 굴려 화면을 아래로 내립니다.

3. 화면 변화를 확인하는 피드백 루프

버튼을 눌렀다고 해서 작업이 끝난 것이 아닙니다. 버튼을 누른 뒤 실제로 다음 화면이나 파일 다운로드 창이 떴는지 다시 스크린샷을 찍어 확인합니다. 원하는 변화가 일어났을 때만 다음 단계(예: "파일 저장하기")로 넘어가며, 페이지가 로딩 중이거나 오류 팝업이 떴다면 이를 인지하고 대기하거나 우회합니다.


이전 세대 모델과의 성능 비교표

컴퓨터 조작 성능을 평가하는 공인 기준인 OSWorld 2.0 벤치마크를 바탕으로, 이전 세대인 GPT-5.6 Sol과 비교한 핵심 성능 지표는 다음과 같습니다.

평가 항목이전 세대 (GPT-5.6 Sol)차세대 모델 (GPT-6 아스트라)체감되는 주된 차이점
OSWorld 2.0 작업 성공률38.2%72.6%여러 프로그램을 넘나드는 복합 작업을 성공할 확률이 약 2배 상승
작업당 평균 소요 시간약 4분 12초약 2분 15초화면 캡처 후 다음 조작을 결정하기까지의 지연 시간이 대폭 단축
화면 좌표 인식 정밀도82.4%96.8%작은 닫기(X) 아이콘이나 밀집된 메뉴를 헛누르는 실수가 크게 줄어듦
다중 창(창 전환) 작업2~3개 창 전환 시 경로 이탈최대 12개 창 연속 전환웹브라우저, 엑셀, 사내 메신저를 오가며 데이터를 옮겨 적는 작업 가능
안전 가드레일 등급보통(Medium)중대(Critical) 통과악성 스크립트 실행이나 권한 탈취를 막는 운영체제 안전 기준 통과

이전 모델은 웹브라우저 안에서 검색하고 글을 읽는 데는 능숙했지만, 브라우저 밖으로 나와 엑셀이나 폴더 창을 함께 다루려고 하면 길을 잃거나 멈추는 일이 잦았습니다. 이번 버전은 창 전환 단축키(Alt+Tab 또는 Command+Tab)를 자연스럽게 구사하며 프로그램 사이를 연결하는 능력이 크게 향상되었습니다.


경쟁 모델과 비교해 보는 실제 요금과 비용

컴퓨터를 조작하는 에이전트를 쓸 때 가장 먼저 따져봐야 할 부분은 실제 발생하는 비용입니다.

컴퓨터 조작 모델은 매 스텝마다 화면 전체 스크린샷(이미지 1장당 약 1,200~1,600개 토큰)을 입력으로 받아들이기 때문에, 일반 텍스트 대화보다 토큰 소모량이 10배 이상 큽니다.

현재 컴퓨터 조작을 지원하는 주요 경쟁 모델들의 토큰 단가와, 10단계 조작(화면 10회 캡처 + 조작) 1회를 완수했을 때의 실제 체감 비용을 비교하면 다음과 같습니다.

모델명1.05M(105만 토큰) 입력 가격1.05M(105만 토큰) 출력 가격10단계 작업 1회당 체감 비용비용 대비 특징
GPT-6 아스트라 (OpenAI)10.00달러50.00달러약 0.20 ~ 0.35달러 (약 280~480원)단가는 가장 높지만, 여러 프로그램을 오가는 복잡한 사무 작업 성공률(72%)이 가장 뛰어납니다.
Claude 3.7 Sonnet (Anthropic)3.00달러15.00달러약 0.07 ~ 0.12달러 (약 90~160원)코딩 에디터나 브라우저 기반의 조작 작업에서 가격 대비 성능이 좋습니다.
Gemini 2.0 Pro (Google)1.25달러5.00달러약 0.03 ~ 0.06달러 (약 40~80원)웹 검색과 정보 수집 위주의 간단한 조작에 비용 부담이 가장 적습니다.
GPT-5.6 Sol (이전 세대)2.50달러10.00달러약 0.05 ~ 0.08달러 (약 70~110원)단가는 저렴하나 단일 창을 벗어난 복합 작업에서 실패율이 높아 재실행 비용이 듭니다.

비용 대비 경제성을 따지는 기준

단순히 "이 질문에 답해줘" 수준의 일이나 30초면 사람이 직접 찾는 검색에 아스트라를 쓰는 것은 명백한 낭비입니다.

하지만 **"경쟁사 웹페이지 3곳을 열어 가격표를 캡처하고, 엑셀에 수치를 옮겨 적은 뒤 바탕화면에 저장하는 일"**처럼 사람이 직접 붙잡고 15분20분 동안 마우스를 클릭해야 하는 단순 노가다 작업이라면 이야기가 달라집니다. 1회 작업당 300400원의 비용으로 사람의 집중력과 20분의 시간을 아낄 수 있다면 충분히 경제성이 성립합니다.


내 업무에 지금 도입해도 좋을지 판단하는 기준

새로운 기술이 아무리 뛰어나도 모든 작업에 무조건 어울리는 것은 아닙니다. 현재 아스트라의 컴퓨터 조작 기능을 지금 바로 맡겼을 때 가장 효과적인 작업과, 아직은 사람이 직접 하는 편이 안전한 작업을 비교해 보시기 바랍니다.

지금 바로 맡기면 좋은 작업

  • 매일 반복되는 웹사이트 조회 및 캡처: 매일 아침 특정 사이트에 들어가 실시간 지표를 확인하고 스크린샷을 찍어 메신저나 폴더에 모으는 일
  • 서식 복사 및 단순 데이터 입력: 웹페이지나 PDF에 적힌 고객 문의 목록이나 주소 데이터를 사내 관리 도구의 빈칸에 하나씩 옮겨 적는 일
  • 규칙에 따른 대량 파일 이름 변경 및 분류: 다운로드 폴더에 쌓인 수십 개의 문서 이름을 [날짜_파일명] 규칙에 맞춰 바꾸고 폴더별로 나누는 일

아직은 사람이 직접 하는 편이 안전한 작업

  • 금융 거래 및 결제 승인: 결제 비밀번호, 일회용 인증번호(OTP), 공인인증서 입력이 필요한 모든 결제 행위 (보안상 자동 차단됨)
  • 중요 계약 체결 및 대외 공식 발송: 거래처에 공식 견적서를 전송하거나 법적 서류에 전자서명을 하는 최종 승인 단계
  • 보안 캡차(CAPTCHA)가 걸려 있는 사이트: '로봇이 아닙니다' 체크박스나 그림 맞추기 보안 장치가 작동하는 사이트는 에이전트가 통과하지 못하므로 사람이 직접 풀어주어야 합니다.

자주 묻는 질문

인공지능이 컴퓨터를 조작하는 동안 마우스를 같이 써도 되나요?

동시에 마우스를 잡으시면 안 됩니다. 아스트라는 사용자의 실제 운영체제 마우스 커서와 키보드를 직접 제어하기 때문에, 사람이 마우스를 건드리면 화면 캡처 시점의 좌표와 실제 커서 위치가 어긋나 엉뚱한 곳을 클릭하게 됩니다. 작업이 끝날 때까지 컴퓨터를 그대로 두거나, 듀얼 모니터 환경에서 별도의 가상 데스크톱 화면을 띄워 분리해 두는 방식을 권장합니다.

일반 대화창(Chat)에서 바로 시켜도 컴퓨터를 조작해 주나요?

그렇지 않습니다. 웹브라우저의 일반 텍스트 대화창은 컴퓨터 운영체제에 대한 접근 권한이 없습니다. 컴퓨터 조작 기능을 쓰려면 전용 데스크톱 앱을 설치한 뒤 '작업(Work)' 모드 또는 개발자 전용 환경에서 실행 권한을 허용해 주어야 합니다.

보안이나 개인정보가 유출될 위험은 없나요?

오픈AI는 아스트라 모델의 보안 평가를 거쳐 악성 스크립트 실행이나 시스템 파일 임의 변조를 막는 차단막을 설치했다고 발표했습니다. 다만 모니터 전체를 캡처하는 방식이기 때문에, 화면 한구석에 개인 카카오톡 대화창이나 통장 잔고 같은 민감한 정보가 떠 있다면 해당 이미지도 서버로 전송될 수 있습니다. 작업을 시키기 전에 불필요한 개인 창은 미리 닫아두는 습관이 필요합니다.

캡차(로봇 확인)가 뜨면 어떻게 되나요?

인공지능은 캡차를 스스로 풀지 못하도록 안전 규정이 적용되어 있습니다. 화면에 '로봇이 아닙니다'나 이미지 퍼즐이 나타나면 에이전트는 작업을 잠시 멈추고 사용자에게 "캡차를 직접 풀어주세요"라는 알림을 보냅니다. 사용자가 마우스로 인증을 마쳐주면 다음 작업을 알아서 이어갑니다.

한 번 실패했을 때 다시 시키면 요금이 또 나가나요?

네, 그렇습니다. 컴퓨터 조작은 매 시도마다 화면 캡처 토큰이 실시간으로 소모되므로, 작업 도중 엉뚱한 버튼을 눌러 실패하더라도 그동안 사용된 토큰 비용은 그대로 청구됩니다. 따라서 처음 지시문을 작성할 때 URL, 버튼명, 저장 파일명을 명확히 적어 첫 시도에 성공하도록 유도하는 것이 비용을 아끼는 가장 좋은 방법입니다.


공식 출처 및 관련 정보

댓글 (0)

첫 번째 댓글을 남겨보세요.

GPT-6 아스트라(Astra) 정리: 달라진 점과 컴퓨터 조작 사용법