deepeval Claude Code プラグイン
Claude Code プラグインClaude Code開発AI エージェント・AI アプリ開発監視・オブザーバビリティコード品質・レビュー・テスト以下の解説は生成 AI によるものです。出典と照らし合わせてご確認ください。
本プラグインは、DeepEval を使った評価やトレーシング、データセット構築、Confident AI レポートの生成、評価結果に基づく改善サイクルを AI アシスタントに追加するスキル集です。README によると DeepEval は pytest に似た使い勝手を持つオープンソースの Python 製 LLM 評価フレームワークで、G-Eval や RAG 系指標、エージェント向け指標、マルチターン指標などを備え、OpenAI や LangChain、LangGraph、CrewAI などのフレームワークと連携します。Confident AI は同じ開発チームによるクラウドおよびオンプレミス対応のプラットフォームで、ホームページによるとトレーシング、本番監視、データセット整理、レッドチーミングなどをチームで扱う機能を追加します。README のクイックスタート部分では、コーディングエージェントがこのスキルを使ってテストスイートを作成し、deepeval test run を実行し、失敗した指標を修正していく流れが示されています。どこまでが自動化されどこからが手作業かの詳細はソースに記載がなく不明です。
連携サービスについて
Confident AI はホームページによると LLM アプリケーション向けの評価・可観測性プラットフォームで、トレーシング、本番トレースからのデータセット自動整理、AI レッドチーミング、ガバナンス機能を備え、クラウド版とオンプレミス版の両方が提供されています。
deepeval でできること
- G-Eval や RAG系指標、エージェント系指標、マルチターン指標などを使ったDeepEvalのテストケースを作成・実行する
- アプリケーションコードにトレーシングを組み込み、LLM呼び出しやツール呼び出し、エージェントの各ステップを記録する
- トレースから評価用データセットを構築する、または自動生成する
- 結果をConfident AIに同期し、レポート共有・本番監視・チームでの協業に活用する
- 評価結果をもとにプロンプトやモデル、構成を見直し、改善サイクルを回す
出典
deepeval の変更履歴
- Claude Code プラグイン deepeval が追加