System Prompts Leaks:主流AIモデルの内部指令とシステムプロンプトのオープンソースライブラリを解明
System Prompts Leaksは、主要な主流AIモデルのシステムプロンプトの収集、整理、公開に重点を置いた非常に影響力のあるオープンソースプロジェクトです。リバースエンジニアリングを通じて、AnthropicのClaudeシリーズ、OpenAIのChatGPTおよびCodex、GoogleのGemini、xAIのGrokなどの有名モデルの底層の隠された指令を取得しました。これらのシステムプロンプトは、AIモデルがユーザー入力を受信する前に従う「隠れたルール」であり、モデルの行動境界、セキュリティ戦略、およびツール呼び出しロジックを決定します。プロジェクトは生テキストだけでなく、モデルのツール設定、スキル設定、およびコンポーネント構造も含んでおり、開発者にブラックボックス内の動作メカニズムをのぞき見る独自の視点を提供します。その内容は、インタラクティブストーリーやデータダッシュボードの構築のために『ワシントン・ポスト』などの主要メディアで引用され、高いジャーナリズム的および工学的価値を示しています。このプロジェクトは、AIセキュリティ研究者、プロンプトエンジニア、大規模モデルの行動ロジックを深く理解したい開発者にとって適しており、コンプライアンスの枠内でアプリケーション効果を最適化したり、セキュリティ監査を行ったりするのに役立ちます。
背景と概要
現在、人工知能(AI)大規模言語モデルの普及は急速に進んでおり、開発者やユーザーは往々にしてモデルが出力する結果そのものに関心を集中させがちです。しかし、その出力を決定づける内部の論理構造や指令については、依然として不透明な部分が少なくありません。この透明性の欠如を解消するために登場したのが、GitHub上で公開されている「System Prompts Leaks」というオープンソースプロジェクトです。このプロジェクトは、単なるコードリポジトリではなく、主要なAIモデルがユーザーからの入力を受け取る前に内部で実行されている「システムプロンプト」、すなわち隠された指令群を収集・整理・公開する動的なアーカイブとして機能しています。
これらのシステムプロンプトは、AIモデルの行動の境界線、安全フィルター、思考の連鎖(Chain of Thought)の誘導方法、そして外部ツールへのアクセス権限などを定義する「隠れたルール」として振る舞います。従来、これらは各社の商業機密として厳重に秘匿されてきましたが、本プロジェクトはリバースエンジニアリング等の技術的手法を通じて、AnthropicのClaudeシリーズ、OpenAIのChatGPTやCodex、GoogleのGemini、xAIのGrokといった最先端モデルの内部指令を可視化しました。これにより、開発者はモデルのブラックボックス内部に直接アクセスし、その動作原理を深く理解することが可能となっています。
深掘り分析
System Prompts Leaksの最大の強みは、その網羅性と構造化された詳細さにあります。単にテキストをコピーしたのではなく、各モデルの動作環境を完全に再現するための設定情報が含まれています。例えば、Claude Designの項目では、メインのシステムプロンプトに加え、53種類のツール、22のスキル、10の起動コンポーネントといった具体的な構成要素がリスト化されています。また、OpenAIのChatGPT GPT-6-Astra、GoogleのGemini 3.8 Flashや3.1 Pro、MetaのMuse Code、Kimi、Cursor、xAIのGrokなど、多様なベンダーのモデルが含まれており、各社の設計思想の違いを比較検討する上で極めて貴重なデータとなっています。
このプロジェクトは、モデルがどのように「思考」するだけでなく、どのように「行動」するかを示す点でも重要です。ツール呼び出しのロジックや権限管理の仕組みが明文化されているため、開発者は既存のモデルが外部環境とどのように連携しているかを把握できます。さらに、ファイルはベンダー別にMarkdown形式で整理されており、2026年9月に更新されたClaude Codeのヘッドレスバージョンなどの最新情報も含まれています。この高いアクセシビリティと構造化されたデータ形式により、技術的なハードルが大幅に低下し、複雑なAIの内部ロジックを誰もが解析可能な形での提供を実現しています。
業界への影響
このプロジェクトは開発者コミュニティだけでなく、メディアやジャーナリズムの世界にも大きな影響を与えています。『ワシントン・ポスト』は、このリポジトリのデータを活用してインタラクティブなストーリーやデータダッシュボードを構築し、AIの内部構造を一般読者にも分かりやすく可視化しました。また、CEPS' AI Worldも同様の手法でリアルタイムのデータ分析を行っており、技術的な情報を社会に伝える新たな手法として注目されています。これにより、AIの透明性に関する議論が、技術者だけのものから公共的な議論へと拡大する契機となっています。
開発者やセキュリティ研究者にとっても、このプロジェクトは不可欠なインフラとなっています。システムプロンプトの分析を通じて、モデルが特定のリクエストを拒否する際の基準や安全フィルターの仕組みを把握できます。これにより、カスタムエージェントの設計において、より効率的で安全なプロンプトエンジニアリングが可能になります。GitHubでのスター数は6万4000以上を記録しており、コミュニティからの関心の高さを示しています。また、Pull Requestを通じて新しい情報が継続的に追加される仕組みにより、モデルのアップデートに追従した最新の情報が常に提供され続けています。
今後の展望
System Prompts Leaksの存在は、AIの透明性確保に向けた重要な一歩ですが、同時に倫理的・技術的な課題も提起しています。漏洩したプロンプトが悪用され、プロンプトインジェクション攻撃や安全制限の回避に利用されるリスクも指摘されています。そのため、今後は各ベンダーがシステムプロンプトの暗号化や動的生成による保護を強化する動きが進むと予想されます。一方で、コミュニティ側も情報の適切な利用に関する倫理ガイドラインを策定し、研究や教育目的以外での使用を制限するなどの自律的な規制を強化していく必要があります。
AIエージェントの普及に伴い、システムプロンプトはより複雑化し、ツール呼び出しや権限管理の部分が重要になっていきます。本プロジェクトがこれらの高度な指令を継続的に追跡・分析することで、より信頼性の高いAIシステムの構築に貢献することが期待されます。開発者は、これらの内部指令を理解することで、モデルの能力限界を正確に把握し、安全かつ効果的なAIアプリケーションの開発を進めることができます。透明性とセキュリティのバランスを取りながら、オープンな協働によるAI技術の健全な発展を支えていくことが、今後の課題となります。
Sources
FAQ
System Prompts Leaksプロジェクトとは何ですか?
主要なAIモデル(Claude, ChatGPT, Gemini, Grokなど)のシステムプロンプトや隠された指令をリバースエンジニアリングで収集し、公開するオープンソースプロジェクトです。
システムプロンプトの開示はなぜ重要なのでしょうか?
AIモデルの内部ロジックを深く理解する独自の視点を開発者に提供し、プロンプトエンジニアリングの最適化、AIセキュリティ研究、モデル監査に役立ち、AIの透明性を促進します。
AIモデルのシステムプロンプトに関して、今後どのような課題や進化が予想されますか?
AIベンダーは、プロンプトインジェクション攻撃に対処するため、プロンプトの暗号化と動的化を強化する必要があります。倫理的なガイドラインの確立と、AIエージェントのツール呼び出し・権限管理の追跡も重要です。