Source profileQuality 67/100Review permissions

affaan-m/ECC/docs/tr/skills/eval-harness/SKILL.md

eval-harness

Eval-driven development (EDD) ilkelerini uygulayan Claude Code oturumları için formal değerlendirme çerçevesi

Source repository stars
234,327
Declared platforms
1
Static risk flags
1
Last source update
2026-07-27
Source checked
2026-07-28

Decision brief

What it does—and where it fits

Claude Code oturumları için eval-driven development (EDD) ilkelerini uygulayan formal değerlendirme çerçevesi.

Best for

    Not for

    • Tasks that require unconfirmed production actions or broad system permissions.
    • Environments where the pinned source and install steps cannot be inspected.

    Compatibility matrix

    Platform support, with evidence labels

    PlatformStatusEvidenceWhat to check
    CodexNot declaredNo explicit evidencePortability before use
    Claude CodeDeclaredSource recordInstall path and trigger
    CursorNot declaredNo explicit evidencePortability before use
    Gemini CLINot declaredNo explicit evidencePortability before use
    Open the compatibility checker

    Installation

    Inspect first. Install second.

    The source command is displayed only when detected. A safe inspection prompt is always available so your agent can explain every action before execution.

    Source-detected install commandSource
    npx skills add https://github.com/affaan-m/ECC --skill "docs/tr/skills/eval-harness"
    Safe inspection promptEditorial

    Inspect the Agent Skill "eval-harness" from https://github.com/affaan-m/ECC/blob/4e973d3eaf92d97f8d2e2d8abb39d8bdc8711b38/docs/tr/skills/eval-harness/SKILL.md at commit 4e973d3eaf92d97f8d2e2d8abb39d8bdc8711b38. List every install step, command, network request, credential, file read/write, external action, and rollback step. Explain whether it fits my task. Do not install or execute anything until I approve.

    Workflow

    What the source asks the agent to do

    1. 01

      Ne Zaman Aktifleştirmeli

      AI destekli iş akışları için eval-driven development (EDD) kurarken

      AI destekli iş akışları için eval-driven development (EDD) kurarkenClaude Code görev tamamlama için geçti/kaldı kriterleri tanımlarkenpass@k metrikleriyle agent güvenilirliğini ölçerken
    2. 02

      Felsefe

      Eval-Driven Development, eval'ları "AI geliştirmenin birim testleri" olarak ele alır: - İmplementasyondan ÖNCE beklenen davranışı tanımla - Geliştirme sırasında eval'ları sürekli çalıştır - Her değişiklikle regresyonları izle - Güvenilirlik ölçümü için pass@k metriklerini kullan

      İmplementasyondan ÖNCE beklenen davranışı tanımlaGeliştirme sırasında eval'ları sürekli çalıştırHer değişiklikle regresyonları izle
    3. 03

      Eval Tipleri

      Claude'un daha önce yapamadığı bir şeyi yapıp yapamadığını test et:

      Claude'un daha önce yapamadığı bir şeyi yapıp yapamadığını test et:Değişikliklerin mevcut fonksiyonaliteyi bozmadığından emin ol:
    4. 04

      Capability Eval'ları

      Claude'un daha önce yapamadığı bir şeyi yapıp yapamadığını test et:

      Claude'un daha önce yapamadığı bir şeyi yapıp yapamadığını test et:
    5. 05

      Regression Eval'ları

      Değişikliklerin mevcut fonksiyonaliteyi bozmadığından emin ol:

      Değişikliklerin mevcut fonksiyonaliteyi bozmadığından emin ol:

    Permission review

    Static risk signals and limitations

    Runs scripts

    medium · line 56

    The documentation asks the agent to run terminal commands or scripts.

    npm test -- --testPathPattern="auth" && echo "PASS" || echo "FAIL"

    Runs scripts

    medium · line 59

    The documentation asks the agent to run terminal commands or scripts.

    npm run build && echo "PASS" || echo "FAIL"

    Evidence record

    Why each signal appears

    EvidenceSourceComputedTestedEditorial
    SignalValueEvidence typeMeaning
    Quality score67/100ComputedDocumentation, specificity, maintenance, and trust rules
    Repository stars234,327SourceRepository attention, not individual Skill quality
    Compatibility1 platformsSourceDeclared in the catalog source record
    Usage guideautomated source guideEditorialGenerated or reviewed according to the visible evidence level

    Pinned source

    Provenance and original SKILL.md

    Repository
    affaan-m/ECC
    Skill path
    docs/tr/skills/eval-harness/SKILL.md
    Commit
    4e973d3eaf92d97f8d2e2d8abb39d8bdc8711b38
    License
    MIT
    Collected
    2026-07-28
    Default branch
    main
    View the original SKILL.md

    Eval Harness Skill

    Claude Code oturumları için eval-driven development (EDD) ilkelerini uygulayan formal değerlendirme çerçevesi.

    Ne Zaman Aktifleştirmeli

    • AI destekli iş akışları için eval-driven development (EDD) kurarken
    • Claude Code görev tamamlama için geçti/kaldı kriterleri tanımlarken
    • pass@k metrikleriyle agent güvenilirliğini ölçerken
    • Prompt veya agent değişiklikleri için regresyon test paketleri oluştururken
    • Model versiyonları arasında agent performansını benchmark ederken

    Felsefe

    Eval-Driven Development, eval'ları "AI geliştirmenin birim testleri" olarak ele alır:

    • İmplementasyondan ÖNCE beklenen davranışı tanımla
    • Geliştirme sırasında eval'ları sürekli çalıştır
    • Her değişiklikle regresyonları izle
    • Güvenilirlik ölçümü için pass@k metriklerini kullan

    Eval Tipleri

    Capability Eval'ları

    Claude'un daha önce yapamadığı bir şeyi yapıp yapamadığını test et:

    [CAPABILITY EVAL: feature-name]
    Görev: Claude'un başarması gereken şeyin açıklaması
    Başarı Kriterleri:
      - [ ] Kriter 1
      - [ ] Kriter 2
      - [ ] Kriter 3
    Beklenen Çıktı: Beklenen sonucun açıklaması
    

    Regression Eval'ları

    Değişikliklerin mevcut fonksiyonaliteyi bozmadığından emin ol:

    [REGRESSION EVAL: feature-name]
    Baseline: SHA veya checkpoint adı
    Testler:
      - existing-test-1: PASS/FAIL
      - existing-test-2: PASS/FAIL
      - existing-test-3: PASS/FAIL
    Sonuç: X/Y geçti (önceden Y/Y)
    

    Grader Tipleri

    1. Code-Based Grader

    Kod kullanarak deterministik kontroller:

    # Dosyanın beklenen pattern içerip içermediğini kontrol et
    grep -q "export function handleAuth" src/auth.ts && echo "PASS" || echo "FAIL"
    
    # Testlerin geçip geçmediğini kontrol et
    npm test -- --testPathPattern="auth" && echo "PASS" || echo "FAIL"
    
    # Build'in başarılı olup olmadığını kontrol et
    npm run build && echo "PASS" || echo "FAIL"
    

    2. Model-Based Grader

    Açık uçlu çıktıları değerlendirmek için Claude kullan:

    [MODEL GRADER PROMPT]
    Aşağıdaki kod değişikliğini değerlendir:
    1. Belirtilen sorunu çözüyor mu?
    2. İyi yapılandırılmış mı?
    3. Edge case'ler işleniyor mu?
    4. Hata işleme uygun mu?
    
    Puan: 1-5 (1=kötü, 5=mükemmel)
    Gerekçe: [açıklama]
    

    3. Human Grader

    Manuel inceleme için işaretle:

    [HUMAN REVIEW REQUIRED]
    Değişiklik: Neyin değiştiğinin açıklaması
    Sebep: Neden insan incelemesi gerekli
    Risk Seviyesi: DÜŞÜK/ORTA/YÜKSEK
    

    Metrikler

    pass@k

    "k denemede en az bir başarı"

    • pass@1: İlk deneme başarı oranı
    • pass@3: 3 denemede başarı
    • Tipik hedef: pass@3 > %90

    pass^k

    "Tüm k denemeler başarılı"

    • Güvenilirlik için daha yüksek çıta
    • pass^3: Ardışık 3 başarı
    • Kritik yollar için kullan

    Eval İş Akışı

    1. Tanımla (Kodlamadan Önce)

    ## EVAL DEFINITION: feature-xyz
    
    ### Capability Eval'ları
    1. Yeni kullanıcı hesabı oluşturabilir
    2. Email formatını doğrulayabilir
    3. Şifreyi güvenli şekilde hash'leyebilir
    
    ### Regression Eval'ları
    1. Mevcut login hala çalışıyor
    2. Oturum yönetimi değişmedi
    3. Logout akışı sağlam
    
    ### Başarı Metrikleri
    - capability eval'lar için pass@3 > %90
    - regression eval'lar için pass^3 = %100
    

    2. Uygula

    Tanımlanan eval'ları geçmek için kod yaz.

    3. Değerlendir

    # Capability eval'ları çalıştır
    [Her capability eval'ı çalıştır, PASS/FAIL kaydet]
    
    # Regression eval'ları çalıştır
    npm test -- --testPathPattern="existing"
    
    # Rapor oluştur
    

    4. Rapor

    EVAL REPORT: feature-xyz
    ========================
    
    Capability Eval'ları:
      create-user:     PASS (pass@1)
      validate-email:  PASS (pass@2)
      hash-password:   PASS (pass@1)
      Genel:           3/3 geçti
    
    Regression Eval'ları:
      login-flow:      PASS
      session-mgmt:    PASS
      logout-flow:     PASS
      Genel:           3/3 geçti
    
    Metrikler:
      pass@1: %67 (2/3)
      pass@3: %100 (3/3)
    
    Durum: İNCELEMEYE HAZIR
    

    Entegrasyon Kalıpları

    İmplementasyondan Önce

    /eval define feature-name
    

    .claude/evals/feature-name.md konumunda eval tanım dosyası oluşturur

    İmplementasyon Sırasında

    /eval check feature-name
    

    Mevcut eval'ları çalıştırır ve durumu raporlar

    İmplementasyondan Sonra

    /eval report feature-name
    

    Tam eval raporu oluşturur

    Eval Depolama

    Eval'ları projede sakla:

    .claude/
      evals/
        feature-xyz.md      # Eval tanımı
        feature-xyz.log     # Eval çalıştırma geçmişi
        baseline.json       # Regression baseline'ları
    

    En İyi Uygulamalar

    1. Kodlamadan ÖNCE eval'ları tanımla - Başarı kriterleri hakkında net düşünmeyi zorlar
    2. Eval'ları sık çalıştır - Regresyonları erken yakala
    3. pass@k'yı zaman içinde izle - Güvenilirlik trendlerini gözle
    4. Mümkün olduğunda code grader kullan - Deterministik > olasılıksal
    5. Güvenlik için insan incelemesi - Güvenlik kontrollerini asla tam otomatikleştirme
    6. Eval'ları hızlı tut - Yavaş eval'lar çalıştırılmaz
    7. Eval'ları kodla versiyonla - Eval'lar birinci sınıf artifact'lardır

    Örnek: Kimlik Doğrulama Ekleme

    ## EVAL: add-authentication
    
    ### Faz 1: Tanımla (10 dk)
    Capability Eval'ları:
    - [ ] Kullanıcı email/şifre ile kayıt olabilir
    - [ ] Kullanıcı geçerli kimlik bilgileriyle giriş yapabilir
    - [ ] Geçersiz kimlik bilgileri uygun hatayla reddedilir
    - [ ] Oturumlar sayfa yeniden yüklemelerinde kalıcıdır
    - [ ] Logout oturumu temizler
    
    Regression Eval'ları:
    - [ ] Halka açık rotalar hala erişilebilir
    - [ ] API yanıtları değişmedi
    - [ ] Veritabanı şeması uyumlu
    
    ### Faz 2: Uygula (değişir)
    [Kod yaz]
    
    ### Faz 3: Değerlendir
    Çalıştır: /eval check add-authentication
    
    ### Faz 4: Raporla
    EVAL REPORT: add-authentication
    ==============================
    Capability: 5/5 geçti (pass@3: %100)
    Regression: 3/3 geçti (pass^3: %100)
    Durum: YAYINLA
    

    Product Eval'ları (v1.8)

    Davranış kalitesi sadece birim testlerle yakalanamadığında product eval'ları kullan.

    Grader Tipleri

    1. Code grader (deterministik assertion'lar)
    2. Rule grader (regex/şema kısıtlamaları)
    3. Model grader (LLM-as-judge rubric)
    4. Human grader (belirsiz çıktılar için manuel karar)

    pass@k Kılavuzu

    • pass@1: doğrudan güvenilirlik
    • pass@3: kontrollü yeniden denemeler altında pratik güvenilirlik
    • pass^3: kararlılık testi (3 çalıştırmanın tümü geçmeli)

    Önerilen eşikler:

    • Capability eval'ları: pass@3 >= 0.90
    • Regression eval'ları: yayın-kritik yollar için pass^3 = 1.00

    Eval Anti-Kalıpları

    • Prompt'ları bilinen eval örneklerine overfitting yapmak
    • Sadece mutlu-yol çıktılarını ölçmek
    • Geçme oranlarını kovalamken maliyet ve gecikme kaymasını görmezden gelmek
    • Yayın kapılarında kararsız grader'lara izin vermek

    Minimal Eval Artifact Düzeni

    • .claude/evals/<feature>.md tanımı
    • .claude/evals/<feature>.log çalıştırma geçmişi
    • docs/releases/<version>/eval-summary.md yayın snapshot'ı

    Alternatives

    Compare before choosing