Basis, GPT-6 Astra로 세무 워크북을 2배 빠르게 완성

Published · AI Daily — AI-assisted deep research, methodology & disclosure

GPT-6 Astra는 50개 탭의 세무 워크북을 GPT-5.6 Sol보다 2배 빠르게 완료했으며, 사용자 의도에 대한 더 강력한 이해로 Basis는 실제 사용에 대한 확신을 높였습니다.

배경

2026년 9월, OpenAI는 세무 소프트웨어 플랫폼 Basis를 통해 최신 추론 모델 GPT-6 Astra의 실제 테스트 결과를 공개했다. 이 테스트는 50개 탭으로 구성된 복잡한 세무 워크북을 처리하는 과제로, 소득 명세서, 공제 일정, 감가상각 표, 세액 공제 계산 등 수십 개의 상호 의존적인 시트를 포함했다. Basis는 GPT-6 Astra가 이전 모델인 GPT-5.6 Sol보다 워크북을 2배 빠르게 완료했으며, 사용자 의도에 대한 이해도 크게 향상되었다고 보고했다.

이 작업은 단순한 텍스트 생성이 아니었다. 여러 시트 간 데이터 추출, 현행 세법 규정과의 일치, 다단계 산술 추론, 그리고 숙련된 세무사와 유사한 순차적 워크플로 조정이 필요했다. Basis 엔지니어링 팀은 속도 향상과 함께 수동 수정 및 반복 프롬프트가 크게 줄었다고 강조했다. 이전 모델들은 서로 다른 탭을 연결하는 암묵적 논리를 자주 오해하여 인간 회계사의 개입이 필요했지만, Astra는 사용자의 포괄적 목표를 추론할 수 있었다.

심층 분석

2배의 속도 향상은 모델 추론 파이프라인의 근본적인 재설계에서 비롯되었다. GPT-5.6 Sol과 비교해 Astra는 더 효율적인 장문 컨텍스트 메모리 압축 메커니즘과 적응형 추론 경로 플래너를 도입했다. 50개 탭의 워크북을 마주했을 때, 모델은 더 이상 각 시트를 외부 도구 호출이나 단편적인 사고 연쇄가 필요한 고립된 프롬프트로 취급하지 않는다. 대신, 탭 간의 종속성을 식별하고, 세법 규칙에 따라 계산 순서를 정하며, 데이터 입력 오류나 규정 준수 위험을 나타낼 수 있는 이상 항목을 표시하면서 전체 세무 논리 체인을 한 번의 일관된 패스로 구성한다. 이러한 총체적 접근 방식은 이전 버전에서 장문 컨텍스트에서 주의력 감퇴로 인해 이전 탭의 출력을 추적하지 못하던 비효율적인 왕복 작업을 제거했다.

결정적으로, Astra는 '사용자 의도 이해'를 얕은 지시 따르기에서 목표 주도형 자율 계획으로 끌어올렸다. 예를 들어, 사용자가 "이 법인의 연방 및 주 신고서를 작성하라"는 지시와 함께 워크북을 제출하면, 모델은 어떤 양식이 필수인지, 어떤 수치를 지원 탭에서 가져와야 하는지, 연방 계산과 주 계산 간에 공제를 어떻게 배분할지 독립적으로 결정해야 한다. Astra의 향상된 사고 연쇄 추론은 새로운 정보가 처리될 때마다 업데이트되는 동적 작업 그래프를 유지함으로써 이를 달성하며, 필수 필드가 누락된 경우에도 정상적으로 복구하고 진정으로 필요할 때만 사용자에게 프롬프트를 표시한다. 그 결과 단순히 출력 속도가 빨라진 것이 아니라, 첫 패스 정확도가 높아져 전체 워크북 완료 속도가 관찰된 대로 2배 향상되었다.

산업 영향

중소형 회계법인을 대상으로 하는 Basis에게 이러한 성능 도약은 즉각적인 상업적 무게를 지닌다. AI 지원에도 불구하고 이전에는 수 시간의 인적 검토가 필요했던 복잡한 세무 워크북을 이제는 절반의 시간에 더 적은 개입으로 처리할 수 있다. 이를 통해 Basis는 인건비를 비례적으로 늘리지 않고도 고객 처리량을 증가시킬 수 있으며, 플랫폼을 보조 도구에서 반자동 신고 서비스로 발전시킬 수 있는 길을 열어준다. 향상된 의도 이해는 회계사의 인지 부담을 줄여, 그들의 전문 지식을 데이터 검증보다는 고부가가치 자문 업무로 전환할 수 있게 한다.

이번 시연은 AI 및 세무 소프트웨어 환경 전반에 걸쳐 경쟁 압력을 강화한다. 규제가 엄격한 전문 분야에서 측정 가능한 작업별 속도 이점을 제공하는 OpenAI의 능력은 Anthropic과 Google DeepMind 같은 경쟁사에 도전장을 내민다. Anthropic의 Claude 시리즈는 오랫동안 장문 문서 이해와 안전성으로 높이 평가받아 왔지만, 세무 워크플로 완료에 대한 Astra의 구체적인 벤치마크는 기업 구매자들을 OpenAI의 API 생태계로 유인할 수 있다. 한편, Intuit(TurboTax)나 Xero와 같은 기존 세무 소프트웨어 거대 기업들은 자체 모델을 구축할지 아니면 파트너십을 맺을지 딜레마에 직면한다. 사내 모델은 선도 연구소의 반복 속도를 따라잡기 어려워, 제3자 추론 모델과의 협력이나 인수를 가속화할 가능성이 높다. 회계 업계의 경우, 단기적으로는 반복적인 수작업이 줄어드는 환영할 만한 효과가 있지만, 중기적으로는 데이터 입력 및 교차 확인에서 전략적 세무 계획 및 고객 상담으로 역할이 전환될 것으로 예상된다.

전망

Astra의 세무 워크북 성공이 다른 산업으로 얼마나 광범위하게 전이될지는 몇 가지 신호에 달려 있다. OpenAI는 감사 작업지, 법률 계약 검토, 보험 청구 심사 등 유사하게 구조화된 장문 문서 추론 작업에 대한 추가 벤치마크를 공개하여 Astra의 범용성을 입증할 것으로 예상된다. Basis에게 중요한 다음 단계는 테스트에서 관찰된 속도와 정확성 향상이 실제 상용 배포에서도 지속된다는 것을 입증하고, 오류율과 인간 개입 빈도에 대한 데이터를 공개하는 것이다. 투명한 지표는 초기 도입자의 열정을 지속적인 기업 신뢰로 전환하는 데 필수적이다.

경쟁사들의 대응은 이미 구체화되고 있다. Anthropic은 전문 문서에 최적화된 Claude 버전을 서둘러 출시할 수 있으며, Google은 Gemini의 추론 기능을 Google Sheets와 더 깊이 통합하여 기본적인 생산성 루프를 만들 수 있다. 보다 광범위하게, GPT-6 Astra의 성능은 대형 모델의 진화에 전환점을 의미한다. 가치 제안이 유창한 텍스트 생성에서 신뢰할 수 있는 다단계 규칙 집약적 전문 워크플로 실행으로 이동하고 있다. 이러한 전환은 금융, 법률, 의료 분야에서 AI 도입을 가속화할 것이지만, 모델 설명 가능성, 감사 가능성 및 규제 준수에 대한 요구도 높아진다. Basis 사례는 추론 모델이 인간 전문 노동의 일부를 대체할 수 있다는 초기 검증이며, 그 대체 속도는 현재 업계 예상을 뛰어넘을 수 있다.

Sources