Fine Tuning Nemotron Tembus Medali Emas IOI & IMO: Ini Resepnya
NVIDIA membuktikan model open-weight bisa tembus standar medali emas olimpiade koding dan matematika lewat resep spesialisasi yang terukur. Yuk, bedah rahasianya!
· 8 menit baca

Inti singkat
- NVIDIA membuktikan fine tuning Nemotron sukses mencetak skor level medali emas di IOI 2026 dan IMO 2026.
- Kombinasi SFT, RL, dan inferensi generate-evaluate-refine jadi kunci utama tanpa perlu melatih base model baru dari nol.
- Di IOI 2026, Nemotron-3-Ultra-CC meraih skor 535,4 dari 600 poin, melampaui skor kontestan manusia tertinggi.
- Seluruh dataset, checkpoint model, dan pipeline pengujian dibagikan gratis oleh tim NVIDIA lewat repositori Hugging Face dan GitHub.
Daftar isi8 bagian
- 01
- 02
- 03
- 04
- 05
- 06
- 07
- 08
NVIDIA membuktikan bahwa satu keluarga model dasar bisa diadaptasi untuk memecahkan dua kompetisi sains tersulit di dunia melalui teknik fine tuning Nemotron yang tepat sasaran. Melalui pendekatan terstruktur yang menggabungkan supervised fine-tuning (SFT), reinforcement learning (RL), serta sistem inferensi berulang, varian Nemotron 3 sukses menembus level medali emas di ajang International Olympiad in Informatics (IOI) 2026 dan International Mathematical Olympiad (IMO) 2026, seperti diumumkan tim peneliti NVIDIA lewat blog resmi Hugging Face.
Banyak developer selama ini mengira kalau mau bikin AI dengan penalaran super rumit, kita harus melatih model raksasa baru dari nol pakai modal jutaan dolar. Ternyata eksperimen terbaru NVIDIA mematahkan anggapan itu. Daripada bikin arsitektur anyar, tim mereka memilih memoles fondasi Nemotron 3 memakai resep spesialisasi yang bisa dipakai ulang berkali-kali.

Panduan gratis · gratis
Panduan Cepat API AI untuk Developer
Dari request pertama sampai siap produksi: contoh kode, streaming, kontrol biaya, keamanan API key, dan penanganan error.
- Contoh request dengan cURL, Python, dan JavaScript
- Streaming dan format OpenAI vs Anthropic
- Cara mengontrol biaya token
- Checklist keamanan dan siap produksi
Hasil Ujian IOI 2026 dan IMO 2026: Seberapa Jago Model Ini?
Menang di olimpiade koding dan matematika itu dua dunia yang beda banget. IOI menuntut kode program yang efisien, lolos hidden test cases, serta tunduk pada batasan waktu dan memori yang ketat. Di sisi lain, IMO menuntut pembuktian matematika formal dalam bahasa alami yang runtut tanpa celah logika.
Menariknya, spesialisasi Nemotron berhasil menaklukkan kedua ranah itu sekaligus. Berikut perbandingan hasil pengujian resmi dan simulasi yang dilaporkan tim NVIDIA:
| Kompetisi | Model Spesialisasi Nemotron | Skor Akhir | Ambang Batas Emas | Keterangan Pengujian |
|---|---|---|---|---|
| IOI 2026 | Nemotron-3-Ultra-CC (SFT + GenCorrect) | 535,4 / 600 | 361,12 poin | Berjalan live dengan batasan waktu, submit, dan tanpa internet sama seperti manusia (tidak resmi). Skor melampaui manusia tertinggi (498,27). |
| IMO 2026 | Nemotron 3 Ultra (Gabungan General, SFT, dan RL) | 30 / 42 | 29 poin | Dinilai langsung oleh juri resmi IMO. Berhasil dapat nilai sempurna pada 4 dari 6 soal pembuktian. |
Pengujian di IOI 2026 dilakukan secara prospektif tanpa pengawasan juri resmi kompetisi, tapi model diikat aturan yang persis sama dengan peserta manusia: waktu terbatas, kuota submit terbatas, dan tanpa akses internet sama sekali. Sementara untuk IMO 2026, lembar jawaban pembuktian matematika yang dihasilkan model langsung dinilai oleh tim juri resmi IMO.
Resep 4 Langkah: Gimana Cara Fine Tuning Nemotron Jadi Spesialis?
Kunci sukses proyek ini bukan sekadar menjalankan skrip pelatihan bawaan, melainkan merancang alur spesialisasi yang matang. Tim NVIDIA merangkum metode mereka menjadi resep 4 pilar yang bisa diaplikasikan ke berbagai domain rumit lainnya:
- Fondasi model yang kokoh: Memulai eksperimen dari model dasar Nemotron 3 yang memang sudah punya kemampuan penalaran umum yang mumpuni.
- Kurasi data dan jejak penalaran (reasoning traces): Mengumpulkan bank soal spesifik domain dan memproduksi jejak pemikiran sintetis berkualitas tinggi.
- Post-training terarah: Menerapkan supervised fine-tuning (SFT) dan menambahkan reinforcement learning (RL) di area batas kemampuan model.
- Loop inferensi berbasis umpan balik: Mengawinkan model hasil pelatihan dengan sistem inferensi yang bertugas membuat draf, mengevaluasi kesalahan, lalu memperbaiki jawaban secara otomatis.
Dengan pola ini, developer nggak perlu pusing memikirkan pre-training miliaran token dari nol. Cukup fokus pada kurasi data latihan dan perancangan sistem evaluasi saat inferensi.
Bedah Kasus IOI: Dari Nemotron-3-Nano sampai Ultra-CC dan GenCorrect
Untuk ajang kompetisi pemrograman, tim NVIDIA mengumpulkan 22.000 masalah koding dan membuat synthetic reasoning traces. Dari data ini, mereka melatih dua model spesialis: Nemotron-3-Nano-CC (total 30 miliar parameter dengan 3 miliar parameter aktif) serta Nemotron-3-Ultra-CC (total 550 miliar parameter dengan 55 miliar parameter aktif).

Dari eksperimen pada soal IOI 2025, kita bisa melihat dampak bertahap dari tiap proses post-training:
- Model Nano tanpa modifikasi cuma dapat 130 poin.
- Setelah tahap SFT, nilainya melonjak ke 280 poin.
- Ditambah optimasi RL, skornya naik tipis ke 291 poin.
- Saat dipadukan dengan GenCorrect (strategi iteratif buat generate, evaluate, dan refine kode), performa Nano meroket ke 468 poin, melompati batas medali emas 438,3 poin.
Menariknya, untuk model kelas berat seperti Ultra-CC, cukup satu putaran (epoch) SFT saja sudah mampu mengalahkan model Nano yang sudah dipoles penuh pakai SFT dan RL di berbagai benchmark seperti IOI, ICPC, dan LiveCodeBench Pro. Sistem Ultra-CC dengan GenCorrect inilah yang akhirnya dipakai pada simulasi IOI 2026 hingga mengantongi skor fantastis 535,4 poin.
Bedah Kasus IMO: Latih AI Menulis Pembuktian Matematika Murni
Beda koding, beda pula matematika olimpiade. Di ajang IMO, AI nggak bisa sekadar menebak angka akhir. Model harus menyusun argumen pembuktian panjang tanpa bantuan alat komputasi luar (formal prover), tanpa alat eksternal, dan tanpa koneksi internet.

Untuk melatih model penalaran ini, NVIDIA menyiapkan korpus SFT berisi 414.890 contoh pembuktian yang sudah disaring ketat dari 15.818 soal unik. Data latihan ini nggak cuma berisi jawaban benar, tapi juga memuat:
- Pembuatan draf pembuktian awal.
- Evaluasi dan deteksi celah logika pada argumen.
- Cara merespons kritik dan merevisi bagian yang salah.
- Tahap meta-verifikasi untuk menilai apakah argumen sudah tuntas dan valid.
Selain SFT, NVIDIA melatih checkpoint terpisah menggunakan RL pada 9.597 soal pembuktian yang berada tepat di ambang batas kemampuan model. Hasilnya keren banget: model SFT sangat lihai menghasilkan draf awal yang variatif, sedangkan model RL sangat jago dalam menilai dan memoles kualitas akhir. Menggabungkan kedua model ini dalam siklus kritik-revisi menghasilkan skor 30 dari 42 poin di IMO 2026.
Kenapa Test-Time Compute dan Post-Training Nggak Bisa Dipisah?
Satu pelajaran penting dari laporan teknis ini adalah batas antara fine-tuning dan alur inferensi kini makin kabur. Medali emas yang diraih Nemotron bukan hasil dari model pintar yang bekerja sendirian, bukan juga hasil dari brute-force sampling ribuan jawaban asal tebak.
Pada kasus IOI, sistem inferensi GenCorrect butuh model spesialis yang paham cara membaca pesan eror dan memperbaiki bug. Kalau model dasarnya nggak dilatih mengenali draf yang rusak, loop evaluasi bakal mandek. Begitu juga di IMO, model penilai butuh ketajaman logika buat mendeteksi kekeliruan matematika. Sinergi antara model spesialis dan sistem inferensi pencarian inilah yang mengangkat performanya ke level manusia terbaik.
Akses Model dan Data di Nemotron Hugging Face
Kabar baiknya buat komunitas developer, NVIDIA nggak menyimpan metode ini rapat-rapat. Mereka merilis aset proyek ini ke publik lewat ekosistem open-weight di platform Hugging Face dan repositori terbuka:
- Nemotron Labs IMO 2026 Collection: Berisi checkpoint SFT dan RL, dua dataset pelatihan lengkap, serta tolok ukur baru Nemotron-IMO-Bench berisi 200 soal level olimpiade.
- NeMo-Skills Repository: Repositori NeMo-Skills memuat alur inferensi lengkap, prompt, draf pembuktian IMO, serta panduan cepat (quickstart) yang bisa direplikasi langsung.
- Koleksi Pemrograman IOI: Model Nemotron-3-Ultra-CC beserta metodologi GenCorrect sudah tersedia di Hugging Face, lengkap dengan pipeline evaluasi di repositori NeMo-Skills.
- Makalah Ilmiah Resmi: Dokumentasi teknis lengkap bisa dipelajari langsung lewat arXiv untuk makalah IMO 2026 dan makalah IOI 2026.
Langkah keterbukaan ini sejalan dengan komitmen NVIDIA dalam membagikan riset model spesialisasi efisien ke publik. Selain proyek olimpiade ini, tim NVIDIA juga aktif merilis inovasi lain seperti pengumuman riset NVIDIA Kumo Tabular yang menggarap efisiensi dan akurasi prediksi data tabular.

Pola riset terbuka seperti ini makin memperkaya alternatif bagi developer, mirip dengan ekosistem model yang pernah kita ulas di artikel Beam Reflection AI model open weight.
Langkah Praktis Menerapkan Loop Reasoning Nemotron untuk Proyekmu
Kalau kamu tertarik mengadopsi prinsip kerja tim NVIDIA untuk aplikasi bisnis atau riset internal, kamu bisa mengikuti tahapan praktis berikut:
- Identifikasi Masalah Multi-Langkah: Tentukan alur kerja yang butuh akurasi tinggi, misalnya audit kode backend, verifikasi kalkulasi keuangan, atau pengecekan kepatuhan regulasi.
- Kumpulkan Contoh Kesalahan dan Revisi: Jangan cuma siapkan jawaban ideal. Siapkan dataset berisi draf yang punya bug atau kesalahan hitung, lalu latih model untuk mengenali kesalahan tersebut dan memperbaikinya.
- Terapkan Prompting Evaluator-Generator: Buat arsitektur agentic sederhana di mana satu pemanggilan API bertugas menghasilkan draf solusi, dan pemanggilan berikutnya bertugas mengkritik draf tersebut.
- Ukur Kualitas dengan Benchmark Mandiri: Buat tes tertutup untuk mengukur seberapa sering model berhasil memperbaiki kesalahannya sendiri tanpa intervensi manual manusia.
Berikut contoh template prompt evaluasi mandiri yang meniru alur kerja verifikasi Nemotron:
Kamu adalah sistem verifikasi kode mandiri. Periksa potongan kode Python berikut yang dibuat untuk menyelesaikan masalah algoritma: [MASUKKAN KODE DI SINI] Lakukan analisis dengan langkah berikut:1. Cari potensi edge-case yang bisa memicu Runtime Error atau Time Limit Exceeded.2. Berikan kritik objektif terhadap kompleksitas waktu dan ruang kode di atas.3. Jika ada bug atau ketidakefisienan, tuliskan versi perbaikan kodenya beserta penjelasan perubahan baris demi baris.
Dampak Nyata buat Developer dan Ekosistem AI Indonesia
Keberhasilan eksperimen fine tuning Nemotron ini ngasih sinyal kuat buat para pengembang software dan engineer AI di Indonesia. Kita nggak melulu harus bergantung pada model raksasa tertutup berharga mahal kalau butuh penalaran tingkat tinggi. Model berbasis kecerdasan buatan sumber terbuka terbukti bisa disulap jadi spesialis kelas dunia lewat kurasi dataset yang disiplin.
Buat kebutuhan pembangunan sistem cerdas di industri lokal, mulai dari perbankan sampai startup teknologi, metode generate-verify-refine ini bisa dipakai untuk menekan tingkat halusinasi. Kamu bisa melatih model lokal dengan data regulasi atau bahasa pemrograman spesifik internal perusahaan tanpa takut data sensitif bocor keluar.
Kalau kamu sedang membangun aplikasi berbasis AI dan butuh menguji penalaran model mutakhir seperti Claude Sonnet 4.6 (Rp17.300/Rp86.600 per 1M token) atau DeepSeek V4.1 Flash (Rp160/Rp800 per 1M token) tanpa ribet ganti integrasi kode, kamu bisa langsung mencoba Classai Router. Cukup pakai satu API key standar yang kompatibel dengan SDK OpenAI maupun Anthropic, dan kamu bebas beralih model reasoning terbaik sesuai kebutuhan anggaran proyekmu.
Sumber & referensi
- 01
Hugging Face · 7 Oktober 2026
One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO
Artikel ini ditulis ulang oleh Tim Classai dengan bantuan AI berdasarkan sumber di atas — bukan terjemahan. Ada yang keliru? Kabari kami di [email protected].
Pertanyaan yang sering ditanyakan
Apa keunggulan utama fine tuning Nemotron dibanding melatih model baru?
Fine tuning Nemotron memanfaatkan bobot dasar model Nemotron 3 yang sudah kuat lalu memolesnya dengan SFT dan RL spesifik domain. Cara ini jauh lebih hemat biaya dan waktu komputasi dibanding harus melatih model fondasi baru dari nol.
Berapa skor yang didapatkan Nemotron di IOI 2026 dan IMO 2026?
Di IOI 2026, varian Nemotron-3-Ultra-CC meraih 535,4 dari 600 poin (jauh di atas batas emas 361,12). Sementara di IMO 2026, sistem Nemotron mengantongi nilai 30 dari 42 poin (melebihi batas emas resmi 29 poin).
Apakah pengujian Nemotron di IOI 2026 masuk ranking resmi kompetisi?
Tidak, pengujian IOI 2026 berjalan secara independen tanpa pengawasan panitia resmi sehingga tidak masuk papan peringkat. Namun, model diuji dengan batasan waktu, aturan submisi, dan isolasi internet yang persis sama dengan peserta manusia.
Di mana developer bisa mengunduh model dan dataset Nemotron ini?
Seluruh model checkpoint, kumpulan data latihan, dan kode pipeline inferensi tersedia secara terbuka di platform Hugging Face lewat Nemotron Labs IMO 2026 Collection serta repositori GitHub NeMo-Skills.

Classai Weekly
dari Luthfi · Setiap Senin, 06.30 WIB
Nggak sempat ngikutin berita AI? Biar aku yang rangkumin tiap Senin.
- 5 berita AI paling penting minggu ini — udah disaring, nggak perlu baca puluhan situs
- Kenapa itu penting buat kamu — plus opini jujur Luthfi soal arahnya
- 1 prompt siap pakai yang bisa langsung dicoba
- Pilihan kelas & model AI minggu ini — kadang ada promo khusus pelanggan
Langkah berikutnya
Sudah paham teorinya. Sekarang praktikkan.
Daftar, isi saldo mulai puluhan ribu rupiah, dan panggil model AI pilihanmu dari kode yang sudah ada.
Ditulis oleh
Pengembang Classai Router
Tim Engineering Classai membangun dan menjalankan Classai Router, gateway API AI yang kompatibel dengan format OpenAI dan Anthropic. Kami menulis panduan teknis dari pengalaman mengoperasikan API AI setiap hari.


