System Prompts Leaks:揭开主流AI模型底层指令与系统提示词的黑盒面纱

Published 2026-09-09 · AI Daily — AI-assisted deep research, methodology & disclosure

GitHub开源项目System Prompts Leaks通过逆向工程手段,大规模收集并公开了Anthropic Claude、OpenAI ChatGPT、Google Gemini及xAI Grok等主流大模型的底层系统提示词。这些隐藏指令构成了AI的行为边界与安全策略,其泄露为开发者提供了窥探模型内部逻辑的独特视角。该项目不仅涵盖原始文本,还包含工具配置与技能设置,被《华盛顿邮报》等主流媒体引用用于数据可视化与互动叙事。作为高星级的开源档案,它已成为AI安全研究、提示词工程优化及大模型行为审计的重要基础设施,标志着AI透明度与可解释性研究进入新阶段。

在人工智能大模型迅速普及的今天,开发者与用户往往只关注模型输出的结果,而忽视了决定这些结果的底层逻辑。System Prompts Leaks 项目正是在这一背景下应运而生,它填补了行业生态中对于 AI 模型内部指令透明度认知的空白。该项目并非传统的代码库,而是一个动态更新的系统提示词档案库,旨在揭示那些在用户与 AI 交互之前就已经注入模型的核心指令。在当前的 AI 生态中,系统提示词如同软件的源代码一样重要,它们定义了模型的语气、安全过滤机制、思维链引导方式以及对外部工具的调用权限。然而,由于商业机密的原因,这些内容通常被各大科技公司严格保密。System Prompts Leaks 通过技术手段捕获并公开了这些隐藏信息,使得社区能够直观地看到 ChatGPT、Claude、Gemini 等模型背后的"隐藏规则"。这种透明度对于理解 AI 的行为模式、识别潜在偏见以及优化提示词工程具有不可替代的价值,它让开发者从被动使用者转变为具备深度洞察力的参与者,从而在复杂的 AI 应用开发中占据更有利的位置。该项目的核心能力在于其全面且细致的逆向工程成果,涵盖了全球最顶尖的 AI 模型。

具体而言,项目不仅收录了 Anthropic 的 Claude Fable 5.1、Opus 5 以及 Claude Code 的完整系统提示,还详细记录了 OpenAI 的 ChatGPT GPT-6-Astra 和 Codex 的指令集,以及 Google 的 Gemini 3.8 Flash 和 3.1 Pro 版本。与简单的文本复制不同,该项目对每个模型进行了结构化整理,例如在 Claude Design 条目中,不仅包含了主系统提示,还列出了 53 个工具、22 个技能以及 10 个启动组件,这种颗粒度的披露在其他地方极为罕见。此外,项目还涵盖了 xAI 的 Grok 系列、Kimi、Cursor 以及 Meta 的 Muse Code 等工具。这种差异化的关键在于其持续更新的机制和对多模态、多工具场景的覆盖,它不仅展示了模型如何"思考",还揭示了模型如何"行动"。通过对比不同模型的系统提示,开发者可以清晰地看到各家厂商在安全对齐、角色扮演设定及工具调用逻辑上的设计哲学差异,这是单纯通过 API 调用无法获得的深度洞察。在使用场景与上手体验方面,System Prompts Leaks 为 AI 安全研究、提示词优化及新闻调查提供了丰富的素材。典型的用法包括分析模型的安全边界,例如通过查看系统提示中的拒绝策略来理解模型为何会拒绝某些请求;或者优化自定义 Agent 的行为,通过参考主流模型的工具调用格式来设计更高效的 Prompt 结构。对于开发者而言,访问该仓库极为便捷,所有文件均以 Markdown 格式组织,按厂商分类,阅读门槛极低。

虽然项目本身不涉及复杂的安装过程,但其文档质量极高,每个文件都清晰标注了模型版本及捕获日期,如 2026 年 9 月更新的 Claude Code headless 版本。社区活跃度方面,该项目获得了超过 64,000 星的关注,显示出极高的社区热度。值得注意的是,该项目已被《华盛顿邮报》用于构建交互式故事,被 CEPS' AI World 用于制作实时数据仪表盘,这证明了其内容在专业领域的权威性和实用性。开发者可以通过 Pull Request 贡献新的捕获内容,形成了一个良性互动的开源生态,使得信息能够随着模型版本的迭代而快速更新。从行业意义与展望来看,System Prompts Leaks 的出现标志着 AI 透明度运动的重要一步。它不仅帮助开发者更好地理解现有模型的能力边界,还为 AI 安全审计提供了实证数据,有助于发现潜在的系统性偏见或安全漏洞。然而,这也带来了潜在的风险,例如恶意用户可能利用泄露的提示词进行提示词注入攻击或绕过安全限制。因此,未来值得观察的方向包括各大厂商如何加强系统提示的加密与动态化,以应对此类泄露,以及社区如何建立更完善的伦理准则,确保这些信息仅用于研究和教育目的。此外,随着 AI Agent 的普及,系统提示中关于工具调用和权限管理的部分将变得更加复杂,该项目对这类高级指令的持续追踪将对构建可信 AI 系统产生深远影响。对于工程团队而言,理解这些底层逻辑有助于制定更稳健的 AI 应用策略,在享受技术红利的同时,有效管理安全风险。

Sources

FAQ

System Prompts Leaks项目是什么?

这是一个开源项目,通过逆向工程收集并公开了主流AI大模型(如Claude, ChatGPT, Gemini, Grok)的底层系统提示词和隐藏指令,揭示AI行为边界与安全策略。

这些系统提示词的泄露有何重要意义?

它为开发者提供了深入理解AI模型内部逻辑的独特视角,有助于优化提示词工程、进行AI安全研究及模型行为审计,推动AI透明度发展,已被主流媒体引用。

未来AI模型在系统提示词方面会面临哪些挑战和发展?

未来AI厂商需加强提示词加密与动态化,以应对潜在的提示词注入攻击。社区也需建立伦理准则,并持续追踪AI Agent工具调用和权限管理的复杂指令。