AgentHub oturumundaki agent sonuçlarını metrik veya LLM judge ile değerlendirin ve sıralayın. Kullanıcı /hub:eval komutunu çalıştırdığında veya tamamlanan AgentHub agent'ları puanlamak, karşılaştırmak ya da kazananı seçmek istediğinde kullanılır.
cd ~/.claude/skills
git clone https://github.com/alirezarezvani/claude-skills.git claude-skills mkdir -p ~/.claude/skills/eval
curl -fsSL https://raw.githubusercontent.com/alirezarezvani/claude-skills/HEAD/.gemini/skills/eval/SKILL.md \
-o ~/.claude/skills/eval/SKILL.md Bir oturum için tüm agent sonuçlarını sırala. Metrik tabanlı değerlendirmeyi (komut çalıştır), LLM hakim (diff karşılaştır) veya hibrid değerlendirmeyi destekler.
/hub:eval # En son oturumu yapılandırılmış kriterlere göre değerlendir
/hub:eval 20260317-143022 # Belirli bir oturumu değerlendir
/hub:eval --judge # LLM hakim modunu zorunlu kıl (metrik yapılandırmasını yoksay)
Her agent'ın worktree'sinde değerlendirme komutunu çalıştır:
python {skill_path}/scripts/result_ranker.py \
--session {session-id} \
--eval-cmd "{eval_cmd}" \
--metric {metric} --direction {direction}
Çıktı:
RANK AGENT METRIC DELTA FILES
1 agent-2 142ms -38ms 2
2 agent-1 165ms -15ms 3
3 agent-3 190ms +10ms 1
Winner: agent-2 (142ms)
Her agent için:
git diff {base_branch}...{agent_branch}.agenthub/board/results/agent-{i}-result.mdSıralamaları açıklama ile sunun.
İçerik görevi için LLM hakim çıktısı örneği:
RANK AGENT VERDICT WORD COUNT
1 agent-1 Strong narrative, clear CTA 1480
2 agent-3 Good data points, weak intro 1520
3 agent-2 Generic tone, no differentiation 1350
Winner: agent-1 (strongest narrative arc and call-to-action)
python {skill_path}/scripts/session_manager.py --update {session-id} --state evaluating
/hub:merge kazananı birleştirmek için/hub:merge {session-id} --agent {winner} açık olmak için2 veya daha fazla bağımsız görevin paralel olarak yürütülebileceği ve aralarında state paylaşımı ya da sıralı bağımlılık olmadığı durumlarda kullanın.
Ayrı bir oturumda inceleme kontrol noktaları ile yürütülecek yazılı bir uygulama planınız olduğunda kullanın.
Mevcut oturumda bağımsız görevlerle uygulama planlarını yürütürken kullanın
Herhangi bir hata, test başarısızlığı veya beklenmeyen davranışla karşılaştığınızda, çözüm önerisi sunmadan önce kullanın.
Herhangi bir feature ya da bugfix uygulamaya başlamadan önce kullanın.
Yeni beceriler oluştururken, mevcut becerileri düzenlerken veya dağıtımdan önce becerileri doğrularken kullanın.