言語:JapaneseEnglish

deepeval Claude Code プラグイン

作者
Confident AI
カテゴリ
開発
トピック
AI エージェント・AI アプリ開発 · 監視・オブザーバビリティ · コード品質・レビュー・テスト
カタログ掲載開始
2026-07-15 (UTC)
解説の最終更新
2026-07-16 (UTC)
ソース元(GitHub)最終更新日
2026-08-28 (UTC)(昨日)

以下の解説は生成 AI によるものです。出典と照らし合わせてご確認ください。

本プラグインは、DeepEval を使った評価やトレーシング、データセット構築、Confident AI レポートの生成、評価結果に基づく改善サイクルを AI アシスタントに追加するスキル集です。README によると DeepEval は pytest に似た使い勝手を持つオープンソースの Python 製 LLM 評価フレームワークで、G-Eval や RAG 系指標、エージェント向け指標、マルチターン指標などを備え、OpenAI や LangChain、LangGraph、CrewAI などのフレームワークと連携します。Confident AI は同じ開発チームによるクラウドおよびオンプレミス対応のプラットフォームで、ホームページによるとトレーシング、本番監視、データセット整理、レッドチーミングなどをチームで扱う機能を追加します。README のクイックスタート部分では、コーディングエージェントがこのスキルを使ってテストスイートを作成し、deepeval test run を実行し、失敗した指標を修正していく流れが示されています。どこまでが自動化されどこからが手作業かの詳細はソースに記載がなく不明です。

連携サービスについて

Confident AI はホームページによると LLM アプリケーション向けの評価・可観測性プラットフォームで、トレーシング、本番トレースからのデータセット自動整理、AI レッドチーミング、ガバナンス機能を備え、クラウド版とオンプレミス版の両方が提供されています。

deepeval でできること

  • G-Eval や RAG系指標、エージェント系指標、マルチターン指標などを使ったDeepEvalのテストケースを作成・実行する
  • アプリケーションコードにトレーシングを組み込み、LLM呼び出しやツール呼び出し、エージェントの各ステップを記録する
  • トレースから評価用データセットを構築する、または自動生成する
  • 結果をConfident AIに同期し、レポート共有・本番監視・チームでの協業に活用する
  • 評価結果をもとにプロンプトやモデル、構成を見直し、改善サイクルを回す

出典

deepeval の変更履歴

  • Claude Code プラグイン deepeval が追加

一覧に戻る