Apa yang terjadi
Pada 7 Agustus 2026, NIST mengumumkan dan merilis Draf Publik Awal NIST AI 200-2, 'The TEVV-Athlon Framework for Evaluating AI Systems.' Ini adalah dokumen baru yang mengoperasionalkan metodologi Test, Evaluation, Verification, and Validation (TEVV) yang diminta (namun sebelumnya tidak ditentukan) dalam fungsi Measure dari NIST AI Risk Management Framework. Kerangka ini mendefinisikan metode empat tahap (Articulate & Organize, Define & Construct, Apply & Measure, Synthesize & Interrogate) untuk organisasi membangun penilaian sistem AI yang disesuaikan ('TEVV-Athlons') mencakup statistical ML, LLMs, multimodal models, dan agentic systems. Periode komentar publik 60 hari dibuka hingga 6 Oktober 2026.
Mengapa penting
Ini adalah metodologi NIST pertama yang bersifat preskriptif untuk mengoperasionalkan fungsi 'Measure' dari AI RMF yang diadopsi secara luas, yang sebelumnya kekurangan metodologi evaluasi yang konkret. Ini memberikan organisasi, auditor, tim procurement, dan evaluator pendekatan terstruktur dan dapat diperluas untuk menghasilkan bukti keamanan/kinerja sistem AI — relevan langsung dengan jaminan keamanan AI, red-teaming, dan program validasi pra-penerapan di sektor-sektor yang telah mendasarkan tata kelola pada AI RMF.
Tindakan yang diperlukan
Tim keamanan dan tata kelola AI harus meninjau draf dan mengirimkan komentar sebelum 6 Oktober 2026; tim yang membangun program evaluasi AI/TEVV harus mulai memetakan praktik red-team dan benchmark yang ada ke struktur TEVV-Athlon empat tahap sebelum finalisasi.