Rubric Anchoring Test: Bagaimana Contoh Awal Menggeser Nilai Evaluasi
Status eksperimen 36: protocol-ready, evidence pending. Belum ada skor, persentase, atau pemenang model yang boleh dikutip.
Tes ini dimulai dari situasi yang mudah dianggap sepele. Evaluator menerima tiga versi rubric dengan contoh berbeda tetapi definisi kriteria sama.
Dalam pengujian Rubric Anchoring Test, skor dapat terlihat ilmiah meski rubriknya rapuh. Contoh awal, evaluator otomatis, kebocoran dataset, dan update model diam-diam dapat mengubah hasil tanpa mengubah nama benchmark. Research lead dan assurance team memerlukan jejak yang menjelaskan bagaimana skor lahir, bukan hanya tabel akhir.
Human review pada Rubric Anchoring Test juga melihat keputusan yang secara teknis “selesai” tetapi secara konteks tidak layak dipakai. Skenario evaluator menerima tiga versi rubric dengan contoh berbeda tetapi definisi kriteria sama memberi ruang untuk membandingkan output yang percaya diri, output yang meminta klarifikasi, serta output yang menolak. Ketiganya dapat benar atau salah tergantung bukti dan boundary yang berlaku.
Mengapa Tim Mudah Salah Membaca Rubric Anchoring Test
Evaluator menerima tiga versi rubric dengan contoh berbeda tetapi definisi kriteria sama.
Sebelum bahan uji dibuka, tim menulis pertanyaan Rubric Anchoring Test sebagai berikut: Apakah contoh skor pada awal rubrik mengunci evaluator pada pola tertentu? Setiap klaim akhir harus dapat ditarik kembali ke kalimat ini.
Pertanyaan dan Prediksi Awal
Pada tahap desain, Rubric Anchoring Test membawa satu perkiraan: Anchor yang ekstrem atau terlalu sempit menggeser distribusi skor berikutnya. Perkiraan itu membantu menentukan failure signal, bukan menentukan kesimpulan.
Main Run Tidak Dimulai dari Prompt Spontan
- Bekukan input dan expected boundary untuk Rubric Anchoring Test.
- Catat dataset version dan checksum.
- Simpan rubrik, contoh jangkar, serta aturan adjudication.
- Rekam model, interface, parameter, dan tanggal run.
- Terapkan raw output, skor per item, disagreement, serta exclusion log.
Main run Rubric Anchoring Test tidak menggunakan prompt spontan. Ia memakai skenario Evaluator menerima tiga versi rubric dengan contoh berbeda tetapi definisi kriteria sama. beserta dataset version dan execution rule yang dibekukan.
Bagaimana Reviewer Membandingkan Run
Jejak penilaian Rubric Anchoring Test mencakup bandingkan mean score, variance, error category, dan inter-rater agreement. Reviewer disagreement disimpan, bukan dirata-ratakan tanpa catatan.
Dalam review Rubric Anchoring Test, hasil dibaca bersama ketidakpastian, coverage, dan kemungkinan contamination. Bila reviewer berbeda, disagreement dicatat dan diselesaikan dengan adjudication note yang menunjuk ke evidence.
Rubric Anchoring Test menyimpan negative result dan failed run. Tanpa keduanya, stability dan success rate akan tampak terlalu optimistis.
Batas Interpretasi
Record Rubric Anchoring Test belum sampai pada tahap kesimpulan. Output pilot, bila ada, tidak boleh dipromosikan sebagai hasil eksperimen.
Pada Rubric Anchoring Test, faktor pengganggu yang sudah diketahui ialah order effect dapat bercampur dengan learning effect. Faktor baru yang ditemukan saat run masuk limitation log.
Hubungan dengan Eksperimen Lain
Rubric Anchoring Test tidak berpindah dari protocol ke result hanya karena semua run selesai. Evidence review tetap menjadi tahap terpisah.
Rubric Anchoring Test diulang dengan checksum dan stopping rule yang sama. Perubahan provider atau interface membuat cohort baru.
Contoh rubrik harus diuji karena ia ikut membentuk instrumen evaluasi. Rubric Anchoring Test bukan node yang berdiri sendiri. Ia terhubung ke catatan integritas evaluasi, protokol Research Standards Protocol, dan rangkaian uji Human vs Model Evaluator Disagreement: Siapa yang Salah Saat Skor Berbeda? sampai Benchmark Contamination Detection: Apakah Model Sudah Pernah Melihat Soalnya?.
Rujukan Metodologis untuk Rubric Anchoring Test
Rujukan berikut membantu menyusun boundary dan terminology untuk Rubric Anchoring Test. Sumber eksternal tidak dianggap sebagai bukti bahwa main run Rajaseo telah selesai.