テスト仕様
AIエージェント — Claude Code、GitHub Copilot、Gemini CLI — は、隔離された開発環境で Auth0 の連携タスクを実行します。各エージェントは、実際の開発環境で開発者が使うのと同じツール、つまりワークスペース、シェル、Auth0 CLI のようなファイル操作ツールを使用します。プロンプトは短く実践的で、「Next.js アプリに認証を追加して」のようなものであり、手順を一つずつ示すレシピ形式ではありません。 各モデルは、Auth0 ツールあり・なしの両方でテストされます (MCP Server と Agent Skills) 。このスコア差によって、開発者体験に対する Auth0 の AI ツールの効果を定量的に測定できます。スコアの評価軸
各実行は、プロセス50%、出力50%の2つのカテゴリに分けられた8つの評価軸で採点されます。5つの評価軸は、Auth0ツールを使ったエージェントのエンドツーエンドのプロセスを評価します。残りの3つは最終出力を評価します。各評価軸は個別に0~100点で採点され、その後、重み付けして総合スコアに反映されます。グレード
総合スコアは次のアルファベットグレードに対応します。
グレードは、開発者の感覚に合うように調整されています。91点なら、最小限のレビューで受け入れられるコードだと感じられるはずです。55点なら、修正にかなり手間がかかると感じられるはずです。
結果のバリデーション
すべての grader は、文章や説明ではなく、生成されたコードを検証します。grader は、コードがコンパイル可能であること、実在するパッケージを import していること、実際の SDK メソッドを呼び出していること、そしてセキュリティ上の脆弱性を持ち込んでいないことを確認します。 結果は複数のレベルでバリデーションされます。- 存在チェック: 必須の SDK シンボル、import、設定キーが出力に含まれていること。
- ハルシネーション検出: 存在しないパッケージ、誤った SDK バリアント、捏造された API メソッドを検出すること。
- セキュリティチェック: ハードコードされた資格情報、安全でないストレージに保存されたトークン、ソースコード内のシークレットを検出すること。
- 構造バリデーション: コードが正しく構成されていること — 適切なコンポーネントが適切なファイルに配置され、ライフサイクル フックが適切に処理され、middleware が正しい順序になっていること。
- バージョンの正確性: エージェントが、非推奨のパターンではなく、現在の API を使用していること (確認されるのは、エージェントが最新のドキュメントにアクセスできる場合のみ) 。
- 総合レビュー: LLM judge が実装全体の正確性を評価すること。
推定コストと所要時間
結果ページには、各構成の推定コストと推定所要時間が表示されます。これらの値は、Auth0 MCP + スキルを有効にした状態での1回の eval 実行に基づいています。推定コスト
コストは、eval 実行中に消費された合計トークン数 (入力トークン + 出力トークン) に、モデルプロバイダーが公開しているトークン単価を掛けて算出されます。Auth0 が eval の実行に課金することはありません。このコストは、同等のトークン使用量に対してモデルプロバイダーへ支払う金額を示しています。 トークンの価格は、モデルやプロバイダーによって異なります。最新の料金については、各プロバイダーの料金ページを参照してください。推定時間
Time とは、プロンプトの送信から最終出力までの eval 実行における実際の経過時間です。これには、ファイルの読み取り、ツールの呼び出し、API 応答の待機、コードの記述など、エージェントによるすべての活動が含まれます。 Time は、次の要因によって変動することがあります。- モデルプロバイダー API のレイテンシとレート制限
- 必要なツール呼び出しの回数 (タスクの複雑さによって異なります)
- eval 環境とモデルプロバイダー間のネットワーク状況
- プロバイダー側のキューの深さと負荷