Development ★ 18,759

eval

AgentHub oturumundaki agent sonuçlarını metrik veya LLM judge ile değerlendirin ve sıralayın. Kullanıcı /hub:eval komutunu çalıştırdığında veya tamamlanan AgentHub agent'ları puanlamak, karşılaştırmak ya da kazananı seçmek istediğinde kullanılır.

cd ~/.claude/skills
git clone https://github.com/alirezarezvani/claude-skills.git claude-skills

/hub:eval — Agent Sonuçlarını Değerlendir

Bir oturum için tüm agent sonuçlarını sırala. Metrik tabanlı değerlendirmeyi (komut çalıştır), LLM hakim (diff karşılaştır) veya hibrid değerlendirmeyi destekler.

Kullanım

/hub:eval                           # En son oturumu yapılandırılmış kriterlere göre değerlendir
/hub:eval 20260317-143022           # Belirli bir oturumu değerlendir
/hub:eval --judge                   # LLM hakim modunu zorunlu kıl (metrik yapılandırmasını yoksay)

Ne Yaptığı

Metrik Modu (eval komutu yapılandırılmış)

Her agent'ın worktree'sinde değerlendirme komutunu çalıştır:

python {skill_path}/scripts/result_ranker.py \
  --session {session-id} \
  --eval-cmd "{eval_cmd}" \
  --metric {metric} --direction {direction}

Çıktı:

RANK  AGENT       METRIC      DELTA      FILES
1     agent-2     142ms       -38ms      2
2     agent-1     165ms       -15ms      3
3     agent-3     190ms       +10ms      1

Winner: agent-2 (142ms)

LLM Hakim Modu (eval komutu yok veya --judge bayrağı)

Her agent için:

  1. Diff'i al: git diff {base_branch}...{agent_branch}
  2. Agent'ın result post'unu oku: .agenthub/board/results/agent-{i}-result.md
  3. Tüm diff'leri karşılaştır ve şuna göre sırala:
    • Doğruluk — Görevi çözer mi?
    • Basitlik — Değiştirilen daha az satır daha iyi (eşit doğruluk durumunda)
    • Kalite — Temiz yürütme, iyi yapı, gerileme yok

Sıralamaları açıklama ile sunun.

İçerik görevi için LLM hakim çıktısı örneği:

RANK  AGENT    VERDICT                               WORD COUNT
1     agent-1  Strong narrative, clear CTA            1480
2     agent-3  Good data points, weak intro           1520
3     agent-2  Generic tone, no differentiation       1350

Winner: agent-1 (strongest narrative arc and call-to-action)

Hibrid Modu

  1. Önce metrik değerlendirmesini çalıştır
  2. En iyi agent'lar birbirinden %10 içindeyse, bağlantıları kırmak için LLM hakimi kullan
  3. Hem metrik hem de niteliksel sıralamaları sun

Değerlendirmeden Sonra

  1. Oturum durumunu güncelle:
python {skill_path}/scripts/session_manager.py --update {session-id} --state evaluating
  1. Kullanıcıya söyle:
    • Sıralanmış sonuçlar ve vurgulanmış kazanan
    • Sonraki adım: /hub:merge kazananı birleştirmek için
    • Veya /hub:merge {session-id} --agent {winner} açık olmak için

Benzer skill'ler

Daha fazla: Development →