System Prompts Leaks:主要AIモデルのシステムプロンプトと指令集が漏洩
System Prompts Leaks は、Anthropic、OpenAI、Google、xAI などの主要AI企業から抽出されたシステムプロンプトを集約した、継続的に更新されるオープンソースリポジトリです。これらのプロンプトはユーザー入力の前にモデルに渡される隠された指示セットであり、モデルの行動制限、安全ポリシー、機能呼び出しロジックを決定します。本プロジェクトは、ブラックボックス化したモデルの内部動作を理解することに難しさを感じてきた開発者や研究者の重要な課題を解決します。生指示テキストを提供することで、モデル間のロール定義、ツール活用、思考連鎖プロンプティングにおける主な違いを明らかにします。AIセキュリティ監査、プロンプトエンジニアリングの最適化、モデル行動分析に一次データを供給する点に核心価値があり、セキュリティ研究者、プロンプトエンジニア、AI透明性を重視するコミュニティに不可欠です。
背景と概要
人工知能の急速な普及に伴い、ユーザーと大規模言語モデル(LLM)との対話は依然として「ブラックボックス」として捉えられがちである。入力に対して出力が生成されるプロセスの内部で、モデルがどのような決定を下しているのか、特にユーザー入力の直前にモデルに注入される「システムプロンプト」と呼ばれる隠された指示の内容は、長らく外部から確認できない状態が続いていた。この透明性の欠如を解消するために誕生したのが、GitHub上で注目を集めているオープンソースプロジェクト「System Prompts Leaks」である。このプロジェクトは、Anthropic、OpenAI、Google、xAIといった主要なAIベンダーから抽出されたシステムプロンプトを集約・公開することを目的としており、開発者や研究者が閉鎖的なモデルの内部ロジックを理解するための重要なリソースとなっている。
システムプロンプトは、モデルの「憲法」や「役割定義書」とも言える存在であり、モデルの行動範囲、セキュリティポリシー、トーン、そして外部ツールの呼び出しロジックを厳格に規定する。従来、これらは各企業の機密情報や内部設定とみなされ、一般公開されることは稀であった。しかし、開発者のasgeirtj氏によって維持管理されている本プロジェクトは、これらの生データ(Raw Data)をテキスト形式で公開することで、業界におけるモデル指令の透明性に関する情報の空白を埋めている。これにより、複雑なAIシステムの振る舞いを理解するための障壁が大幅に低下し、技術的な洞察を得るための新たな標準が形成されつつある。
深掘り分析
本プロジェクトの真価は、単なるデータの羅列ではなく、モデル間の技術的差異を可視化する点にある。リポジトリには、AnthropicのClaudeシリーズ(Fable 5、Opus 4.8、Sonnet 5など)やOpenAIのChatGPT(GPT-5.6、GPT-5.5など)、GoogleのGemini、xAIのGrokに加え、CursorやPerplexity、VS Code Copilotといった開発者向けツールのプロンプトが含まれている。例えば、Claude Codeがファイルシステム操作のためにGlobやGrepツールをどのように呼び出すよう指示されているか、あるいはChatGPTの「Sol」モードでGPT-5.6に付与されている高権限ルールなどが具体的に記録されている。こうした詳細な記述は、ベンダー各社が安全アライメントや思考連鎖(Chain of Thought)の誘導において、どのような言語的工夫を凝らしているかを直接的に示している。
データはベンダーおよびモデルバージョン別に整理され、Markdown形式で提供されているため、セキュリティ研究者やプロンプトエンジニアにとって分析が容易である。最近の更新では、Perplexity Deep ResearchやKimi K2.6のプロンプトも追加されており、情報の鮮度が保たれている。研究者は、異なるモデルが同様のタスクに対してどのように反応するかを比較検討でき、特に安全フィルタリングの仕組みや、特定の文脈での専門的な振る舞いの根拠を解明できる。これにより、モデルがなぜ特定の質問を拒否するのか、あるいは特定のトピックで強い専門性を見せるのかという「なぜ」の理由を、出力結果だけでなく内部指令レベルから検証することが可能になった。
また、この情報はプロンプトエンジニアリングの最適化にも直結する。開発者は、公式システムプロンプトに埋め込まれた「ベストプラクティス」を参照することで、より効果的なユーザー入力を設計できる。例えば、Claude Designのプロンプトを分析することで、複雑なツール呼び出し能力を持つAIとの協業方法を学び、Copilotのプロンプトを確認することで、macOSアプリケーションにおける権限制限の仕組みを理解し、ユーザーデータのセキュリティを確保する統合手法を模索できる。これは、モデルの制約と戦うのではなく、その意図された動作原理を活用するアプローチを可能にする。
業界への影響
System Prompts Leaksの存在は、AI業界における透明性と説明可能性(Explainable AI)の議論に大きな影響を与えている。従来のように内部ロジックを秘匿する姿勢に対し、このプロジェクトは公開による検証を促すことで、開発者コミュニティとAIシステムの間の信頼構築に寄与している。ユーザーや開発者は、ツールが完全に制御不能であるのではなく、明確なルールに基づいて動作していることを知ることで、より合理的な技術選定やSDK/APIの統合判断を下せるようになっている。実際、The Washington PostやCEPS' AI Worldなどのメディアも本リポジトリのデータを引用し、インタラクティブなストーリーやデータダッシュボードの構築に活用するなど、その影響力はメディア分野にも広がっている。
一方で、この透明化には倫理的・セキュリティ上のリスクも伴う。漏洩したシステムプロンプトが悪意ある第三者によって「ジェイルブレイク(脱獄)」攻撃の手法として利用され、モデルの安全フィルタを回避して有害なコンテンツを生成する事例が懸念されている。このリスクは、透明性とセキュリティのバランスをいかに取るかが今後の課題であることを浮き彫りにしている。ベンダー側としては、プロンプトの管理方針を見直し、一部はさらに難読化や暗号化を進める方向へ動く可能性もあるが、他方では公式な監査インターフェースを提供するなど、オープンな姿勢を強化する動きも出ていると考えられる。
コミュニティの反応は、AI開発における説明責任への要請の高まりを示している。セキュリティ研究者たちは、提供されたデータを用いて自動化された安全テストを実施し、モデル設定の潜在的な脆弱性を特定しようとしている。この能動的なセキュリティ検証は、ベンダーが指摘された課題に対処するよう促し、結果としてモデル全体の安全性を向上させる好循環を生み出す可能性がある。プロジェクトは単なるデータ集合体ではなく、業界全体の透明性と安全性の基準を引き上げる触媒として機能している。
今後の展望
今後、System Prompts LeaksはAIの透明性とセキュリティの在り方を定義する上で重要な役割を果たし続けるだろう。技術の進化に伴い、説明可能なAIへの需要は増大しており、本プロジェクトはその基盤となるオープンデータの価値を実証している。将来的には、ベンダー側が公式の監査ツールや、機密情報を保護しつつも必要な情報を開示する「サニタイズされたプロンプト」へのアクセス手段を提供するようになるかもしれない。このような変化は、ベンダーと開発者が協力してモデルの安全性とパフォーマンスを高める、より協力的なエコシステムへの移行を意味する。
さらに、このデータは新しいAIアプリケーションの開発にも貢献する。主要モデルの設定方法に関する洞察は、自動コーディング、リサーチ支援、クリエイティブコンテンツ生成などの分野で、より洗練された製品の開発を可能にする。また、これらのデータは、大規模モデルの振る舞いをより効果的に模倣できる小型の専門モデルのトレーニングにも活用できる見込みだ。競争が激化するAI市場において、システムプロンプトの理解と活用能力は、製品成功の鍵となる差別化要因になり得る。
最後に、本プロジェクトはAI開発における倫理的次元を常に意識させる存在である。透明性を促進することで、開発者は自身の仕事が社会に与える影響を考慮せざるを得なくなる。AIの行動を規定するルールを可視化することは、責任ある開発文化を醸成し、単なる技術的熟練度を超えた、AIをめぐる広範な倫理的問題に対処するよう業界に働きかける。System Prompts Leaksは、データを集めるだけでなく、AIが社会全体に利益をもたらす形で発展するための、透明で責任ある未来への動きを象徴している。