Basis, GPT-6 Astra로 세무 워크북 2배 빠르게 완성

Published · AI Daily — AI-assisted deep research, methodology & disclosure

GPT-6 Astra는 50개 탭의 세무 워크북을 GPT-5.6 Sol보다 2배 빠르게 완료했으며, 사용자 의도에 대한 더 강력한 이해로 Basis는 실제 사용에 대한 확신을 갖게 되었습니다.

배경

2026년 9월 28일, OpenAI는 기업 세무 자동화 전문 기업 Basis와 협력하여 새롭게 출시한 GPT-6 Astra 모델의 실제 기업 환경 테스트 결과를 공개했다. 이 테스트는 50개의 탭, 복잡한 시트 간 참조, 정교한 세금 계산 규칙으로 구성된 세무 워크북을 대상으로 진행되었으며, 이는 세무 전문가들이 일상적으로 처리하는 고부담·다단계 워크플로를 대표하는 문서다. GPT-6 Astra는 이전 모델인 GPT-5.6 Sol보다 절반의 시간 만에 전체 워크북을 완료하여 2배의 속도 향상을 입증했다. 단순한 처리량 증가를 넘어, 이 테스트는 사용자 의도를 해석하는 모델의 능력이 결정적으로 향상되었음을 보여주었으며, 이로 인해 오류로 인한 재시도와 수동 수정이 크게 줄었다. Basis에게 이 성능은 정확성과 규정 준수가 필수적인 실제 운영 환경에 모델을 배포할 수 있다는 구체적인 확신으로 이어졌다.

Basis는 AI와 전문 세무 서비스의 교차점에서 활동하며, 전통적인 RPA의 취약성과 초기 대규모 언어 모델의 추론 한계로 인해 자동화가 오랫동안 정체되어 있던 분야다. 50개 탭 워크북 테스트는 속도뿐만 아니라, "이번 분기 모든 자회사의 연결 세무 조정을 완료하라"와 같은 모호하고 맥락 의존적인 지시를 단계별 안내 없이 처리할 수 있는 모델의 역량을 스트레스 테스트하기 위해 설계되었다. GPT-6 Astra의 성공은 AI가 제안 보조 도구에서 자율 실행자로 전환되고 있음을 의미하며, 이는 오류가 규제 및 재정적 불이익을 초래할 수 있는 영역에서 특히 중요하다.

심층 분석

GPT-6 Astra의 성능 도약은 추론과 도구 사용을 긴밀하게 결합한 아키텍처 혁신에 뿌리를 두고 있다. OpenAI는 Astra 시리즈가 "사고 사슬 + 행동 사슬" 최적화를 통합했다고 설명했는데, 이는 모델이 행동하기 전에 내부적으로 작업 실행 경로를 시뮬레이션하는 방식이다. 세무 워크북 시나리오에서 이는 상위 수준 지시를 구문 분석하고, 관련 탭 찾기, 핵심 수치 추출, 관할권별 세율 규칙 적용, 조정 분개 생성과 같은 일련의 하위 작업으로 분해한 후, 최소한의 이탈로 실행하는 것을 의미했다. GPT-5.6 Sol도 유능했지만, 긴 컨텍스트와 상호 의존적인 계산에 직면했을 때 때때로 단계 누락이나 논리적 비약을 보여 인간 운영자가 개입하여 재프롬프트해야 했다. Astra의 향상된 어텐션 메커니즘과 계획 모듈은 50개 탭에 걸쳐 일관성을 유지하면서 첫 번째 시도에서 더 정확한 작업 순서를 생성하여 종단 간 처리 시간을 거의 50% 단축시켰다.

마찬가지로 중요한 것은 모델의 강화된 의도 이해 능력이다. 세무 워크플로에서 "현 회계연도의 이연법인세만 조정하고 이미 마감된 기간은 무시하라"와 같은 하나의 제약 조건을 잘못 해석하면 규정 준수 실패로 이어질 수 있다. GPT-6 Astra는 이러한 암묵적 경계를 포착하는 개선된 능력을 보여주었으며, 명시적인 열거 없이도 시간적·범위적 제한을 올바르게 적용했다. 이러한 미묘한 차이가 전문 서비스에서 빠른 모델과 신뢰할 수 있는 모델을 구분하며, Basis가 실제 배포에 대한 확신을 높인 주된 이유다. 오류 수정 주기의 감소는 처리량을 가속화할 뿐만 아니라 인간 검토자의 인지 부하를 낮추어, 이제 일상적인 검증 대신 예외 처리에 집중할 수 있게 한다.

산업 영향

Basis에게 즉각적인 영향은 날카로워진 경쟁 우위다. 세무 워크북 자동화는 지속적인 난제였다. 전통적인 RPA 솔루션은 높은 유지보수 비용이 들고 문서 구조가 변할 때 실패하기 쉬우며, 초기 LLM 기반 접근 방식은 인간의 노력을 대체하는 데 필요한 정밀성과 속도에 어려움을 겪었다. GPT-6 Astra의 성능은 대형 모델이 이제 복잡한 전문 문서에서 실용적인 수준의 효율성을 달성할 수 있음을 보여준다. 이를 통해 Basis는 AI 생성 제안을 제공하는 것에서 완전히 자동화된 워크북 처리로 제품을 발전시킬 수 있으며, 잠재적으로 고객의 인건비를 절감하고 시트 라이선스 대신 처리량이나 정확성 보장에 연동된 새로운 가격 모델을 가능하게 할 수 있다.

파급 효과는 세무 기술과 더 넓은 AI 에이전트 환경 전반으로 확장된다. Intuit, Xero와 같은 글로벌 기존 기업들과 Kingdee, Yonyou와 같은 중국 업체들은 이미 대형 모델을 자사 제품군에 적극적으로 통합하고 있다. Basis와의 OpenAI 벤치마크 테스트는 이러한 노력을 가속화할 가능성이 높으며, 고성능 추론 모델을 통합하기 위한 경쟁이 심화될 것이다. 복잡한 다단계 작업에 이러한 모델을 활용할 수 있는 선도 기업들은 대형 기업 고객을 확보하고 모델 성능을 더욱 정교화하는 독점 데이터 플라이휠을 구축할 수 있는 유리한 위치를 점할 것이다. 세무를 넘어, 이 테스트는 금융 감사, 법률 문서 검토, 규제 준수와 같은 인접한 고부담 영역에서 AI 에이전트의 실행 가능성을 검증한다. 이러한 작업들은 동일한 멀티모달, 장기적, 고정밀 프로파일을 공유하기 때문이다. 이는 기술이 데모에서 생산으로 이동할 수 있음을 입증함에 따라 수직형 에이전트 스타트업과 벤처 투자의 새로운 물결을 촉발할 수 있다.

전망

Basis는 GPT-6 Astra를 핵심 제품군에 통합할 계획을 확인했으며, 다음 세무 신고 시즌 전에 자동화된 세무 워크북 모듈을 출시하는 것을 목표로 하고 있다. 이 일정은 테스트 결과를 고객 대면 기능으로 전환하려는 회사의 긴박감을 강조한다. 향후 몇 달간 주시해야 할 몇 가지 중요한 신호가 있다. OpenAI가 기업들이 세무 특화 도구 체인을 구축할 수 있도록 Astra의 에이전트 개발 프레임워크를 개방할지 여부, 세무 당국과 규제 기관이 AI 생성 신고서에 어떻게 대응할지, 특히 감사 추적 및 책임 소재와 관련하여, 그리고 Anthropic의 Claude나 Google의 Gemini와 같은 경쟁 모델이 유사한 작업에서 Astra의 성능을 따라잡거나 능가할 수 있을지 여부다. 이는 경쟁 역학을 변화시킬 수 있다.

더 멀리 내다보면, 50개 탭 워크북을 안정적으로 처리할 수 있는 능력은 더 큰 규모의 기업 ERP 데이터 추출을 처리하거나 심지어 전략적 세무 계획 결정에 참여하는 것도 가능한 영역에 들어섰음을 시사한다. 모델이 더 깊은 맥락 이해와 계획 능력을 획득함에 따라, 세무 서비스 산업은 수동 준비자에서 AI 감독 전문가로의 고용 구조 변화와 실시간 지속적 규정 준수를 향한 서비스 모델의 재정의를 목격할 수 있다. Basis와 GPT-6 Astra의 협력은 이러한 변혁의 출발점으로 기억될 수 있으며, AI가 지식 근로자를 보조하는 것에서 그들의 가장 복잡한 작업을 자율적으로 실행하는 것으로 이동할 수 있음을 보여주는 구체적인 증거다.

Sources

FAQ

Basis가 GPT-6 Astra로 세무 워크북 테스트에서 무엇을 달성했나요?

GPT-6 Astra는 50개 탭의 세무 워크북을 GPT-5.6 Sol보다 2배 빠르게 완료했으며, 사용자 의도 이해가 향상되어 오류와 수동 수정을 줄였습니다.

GPT-6 Astra의 성능이 세무 자동화에 중요한 이유는 무엇인가요?

복잡한 다단계 세무 작업을 자율적으로 처리할 수 있음을 입증하여 효율성과 실무 적용에 대한 신뢰를 높이고 업계를 재편할 가능성이 있습니다.

이 테스트 이후의 다음 단계는 무엇인가요?

Basis는 Astra를 핵심 제품에 통합할 예정이며, 규제 대응, 경쟁사 동향, 더 큰 기업 재무 작업으로의 확장을 주목해야 합니다.