Fine Tuning Search Agent di SageMaker: Gimana Caranya?
AWS baru bagiin cara fine tuning search agent pakai multi-turn RL di SageMaker AI — hasilnya bikin agent jauh lebih jarang gagal.
· 5 menit baca

Inti singkat
- AWS ngerilis panduan fine tuning search agent pakai multi-turn RL (MTRL) di Amazon SageMaker AI.
- MTRL melatih model Qwen3.6-27B lewat trajectory penuh, bukan cuma satu langkah kayak RL biasa.
- Di benchmark BrowseComp-Plus, nDCG@10 naik 23,7% dan tingkat gagal turun dari 22,89% jadi 0,68%.
- Setup cuma butuh ubah 3 hyperparameter: max_epochs, global_batch_size, dan rollout_max_concurrency.
- SageMaker MTRL jalan serverless dengan harga per-token, jadi nggak perlu kelola cluster GPU sendiri.
Daftar isi6 bagian
- 01
- 02
- 03
- 04
- 05
- 06
AWS baru bagiin cara fine tuning search agent pakai teknik multi-turn reinforcement learning (MTRL) di Amazon SageMaker AI, dan hasilnya lumayan kerasa: tingkat gagal agent di salah satu benchmark turun dari 22,89% jadi cuma 0,68%. Ini penting banget buat developer yang lagi bangun search agent sendiri tapi capek milih antara model kecil yang nggak reliable atau model gede yang mahal dan lambat.
Menurut postingan resmi AWS Machine Learning Blog yang ditulis Huibin Shen, tim AWS nyobain fine-tuning model Qwen3.6-27B jadi search agent yang bisa milih sendiri mau pakai pencarian keyword (BM25) atau pencarian berbasis makna (vector search). Hasilnya mereka share lengkap dengan angka dan konfigurasi training-nya.
Panduan gratis · gratis
Panduan Cepat API AI untuk Developer
Dari request pertama sampai siap produksi: contoh kode, streaming, kontrol biaya, keamanan API key, dan penanganan error.
- Contoh request dengan cURL, Python, dan JavaScript
- Streaming dan format OpenAI vs Anthropic
- Cara mengontrol biaya token
- Checklist keamanan dan siap produksi
Kenapa Search Agent Susah Dilatih?
Search agent itu beda dari chatbot biasa. Dia harus mutusin sendiri mau cari apa, pakai tool apa, dan kapan berhenti nyari — semua itu dilakukan lewat beberapa ronde interaksi yang saling berkaitan.
Masalahnya, model kecil biasanya nggak bisa diandalkan buat perilaku multi-turn kayak gini kalau cuma dikasih prompt. Model gede (frontier model) sih bisa, tapi kamu bayar mahal dari sisi latensi dan biaya. Supervised fine-tuning (SFT) juga ribet karena butuh contoh trajectory ideal yang mahal dikumpulin dan jarang ada buat kebutuhan spesifik kamu.
RL satu langkah (single-turn RL atau RLVR) juga kurang pas, karena search agent bikin keputusan yang saling nyambung antar ronde. Kalau cuma dioptimasi per langkah, hubungan antar keputusan itu malah kelewat.
Apa itu Multi-Turn RL di Amazon SageMaker AI?
Di sinilah multi-turn RL (MTRL) masuk. Teknik ini ngoptimasi agent lewat seluruh rangkaian langkah sekaligus, dan reward-nya cuma perlu lihat apakah hasil akhirnya bagus atau nggak — nggak perlu rewarding tiap langkah kecil satu-satu.
Amazon SageMaker AI nyediain MTRL sebagai layanan dengan beberapa fitur:
- Interface agent-environment modular — kamu bisa definisiin reward custom dan bentuk percakapan multi-turn sendiri, low-code.
- Eksekusi serverless — RL agentic skala produksi dengan harga per-token, tanpa perlu kelola cluster GPU.
- Rollout asinkron — proses generasi data training dan update gradient jalan paralel.
- Library algoritma native — ada PPO, CISPO, dan IS losses, dipasangkan dengan estimator advantage seperti GRPO, GRPO pass@k, RLOO.
- Training resumable — training panjang bisa dipecah jadi beberapa job biar nggak kena limit waktu.
- Observability lewat MLflow — kamu bisa lihat apa yang dilakukan agent turn demi turn.
MTRL cocok banget buat search agent karena ada reward signal yang jelas (kualitas retrieval), loop interaksi multi-turn (agent nanya dan dapet hasil), dan environment yang well-defined (tool pencarian).
Gimana Cara Kerja Eksperimennya?
Tim AWS pakai model Qwen3.6-27B di region US West (Oregon), dikasih dua tool: lexical search (BM25) buat query dengan kata kunci spesifik, dan vector search buat query yang lebih konseptual. Jumlah turn juga dibatasi biar agent nggak ngelantur kelamaan nyari.
Buat data training dan testing, mereka pakai gabungan dataset publik kayak FRAMES, BRIGHT, Enterprise RAG, ESCI, Musique, dan MLQA buat training, sementara FreshStack, WixQA, BrowseComp-Plus, dan Wands dipakai buat evaluasi.
Reward function-nya pakai nDCG@10 — metrik standar information retrieval yang ngukur seberapa bagus 10 dokumen teratas yang diretrieve dibanding urutan ideal. Kalau agent kena limit turn atau token tanpa selesai, dia dikasih reward -1 biar belajar menghindari kegagalan itu.
Cara Setup Fine Tuning Search Agent di SageMaker
Yang bikin menarik, setup-nya nggak ribet. Tim AWS cuma ubah tiga hyperparameter dan sisanya pakai default:
- Siapin dataset training dan validasi, upload ke Amazon S3 dalam format yang dikenal MTRL.
- Deploy agent endpoint yang expose tool BM25 dan vector search buat dipanggil saat rollout.
- Konfigurasi job training pakai SDK
MultiTurnRLTrainer, setmax_epochs: 1,global_batch_size: 128, danrollout_max_concurrency: 32. - Jalankan
trainer.train()dan monitor reward lewat MLflow sampai kurva plateau. - Evaluasi hasil pakai evaluation job sebelum deploy ke endpoint SageMaker AI atau Amazon Bedrock.
from sagemaker.modules.train import MultiTurnRLTrainer
trainer = MultiTurnRLTrainer(
model_id="qwen3.6-27b",
agent_endpoint="<your-agent-endpoint>",
training_dataset_s3_uri="s3://amzn-s3-demo-bucket/datasets/train/",
validation_dataset_s3_uri="s3://amzn-s3-demo-bucket/datasets/validation/",
hyperparameters={
"max_epochs": 1,
"global_batch_size": 128,
"rollout_max_concurrency": 32,
},
output_s3_uri="s3://amzn-s3-demo-bucket/output/",
)
trainer.train()Hasilnya Gimana? Search Agent Jadi Makin Jago
Setelah fine-tuning, model Qwen3.6-27B yang udah dilatih (finetune) dibandingkan dengan versi aslinya di empat benchmark yang beda. Hasilnya naik di tiga dari empat benchmark, dan tingkat kegagalannya turun drastis di semua benchmark.
| Benchmark | nDCG@10 (base) | nDCG@10 (fine-tuned) | Gagal (base) | Gagal (fine-tuned) |
|---|---|---|---|---|
| WixQA | 0,5725 | 0,6781 | 0,67% | 0,17% |
| Wands | 0,5762 | 0,6112 | 0,00% | 0,00% |
| FreshStack | 0,4112 | 0,4089 | 0,20% | 0,05% |
| BrowseComp-Plus | 0,5136 | 0,6354 | 22,89% | 0,68% |
Kenaikan paling gede ada di BrowseComp-Plus (+23,7% nDCG@10) dan WixQA (+18,4%). Yang paling bikin kagum sih bukan cuma soal kualitas pencarian, tapi reliability-nya: di BrowseComp-Plus, dari 22,89% gagal jadi cuma 0,68% doang. Artinya agent belajar nyelesain tugas dalam batas turn dan token yang dikasih, bukan cuma mikir lebih pintar.
Dampaknya Buat Developer di Indonesia
Buat tim developer atau startup di Indonesia yang lagi bangun fitur search internal — misalnya buat knowledge base customer service, katalog produk, atau dokumentasi teknis — pendekatan ini kasih opsi menarik. Kamu nggak harus pakai model frontier yang mahal buat dapet search agent yang reliable, tapi juga nggak harus bikin dataset demonstrasi yang mahal kayak SFT.
Yang perlu diingat, MTRL di SageMaker ini butuh setup environment dan agent endpoint sendiri, jadi cocoknya buat tim yang udah punya infrastruktur AWS dan paham dasar machine learning. Kalau kamu masih di tahap eksplorasi, bisa belajar dulu soal agent dan API lewat kelas AI untuk Developer biar paham fondasinya sebelum masuk ke level fine-tuning RL kayak gini.
Artikel AWS lain yang nyambung soal SageMaker di konteks bisnis juga bisa dicek di Konversi Sales Naik Pakai AI Bandit di Amazon SageMaker, atau soal cara latih AI agent perusahaan di AutoSynthData Rilis: Cara Baru Latih AI Agent Perusahaan.
Contoh prompt buat eksperimen desain reward function sebelum masuk ke SageMaker:
Saya mau bikin search agent yang milih antara lexical search (BM25) dan vector search tergantung tipe query. Tolong bantu saya rancang reward function sederhana berbasis nDCG@10 buat 10 contoh query produk e-commerce, lengkap dengan kriteria kapan harus kasih penalti.Sumber & referensi
- 01
AWS · 2 Oktober 2026
Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI
Artikel ini ditulis ulang oleh Tim Classai dengan bantuan AI berdasarkan sumber di atas — bukan terjemahan. Ada yang keliru? Kabari kami di halo@classai.id.
Pertanyaan yang sering ditanyakan
Apa itu fine tuning search agent di Amazon SageMaker?
Fine tuning search agent di SageMaker adalah proses melatih ulang LLM biar jago nyari informasi lewat beberapa tool (BM25 dan vector search) pakai teknik multi-turn reinforcement learning (MTRL). AWS pakai pendekatan ini buat ngelatih model Qwen3.6-27B dan hasilnya reliability-nya naik banget.
Apa bedanya multi-turn RL dengan RL biasa?
RL biasa (single-turn RL atau RLVR) cuma ngasih reward per satu langkah jawaban, jadi nggak nangkep hubungan antar keputusan di search agent. Multi-turn RL (MTRL) ngoptimasi seluruh rangkaian langkah sekaligus, dan reward cuma dihitung dari hasil akhirnya.
Seberapa besar peningkatan hasil fine tuning di SageMaker MTRL?
Di benchmark BrowseComp-Plus, nDCG@10 naik 23,7% dan tingkat gagalnya turun dari 22,89% jadi 0,68%. Di WixQA naik 18,4%, tapi di FreshStack malah turun sedikit, jadi hasilnya tergantung jenis task yang dikerjakan.
Apa saja yang perlu disiapkan buat fine tuning search agent pakai MTRL?
Kamu butuh akun AWS dengan akses SageMaker AI, dataset training/validasi yang udah di-upload ke Amazon S3 dengan format yang sesuai, agent endpoint yang expose tool pencarian, dan pemahaman dasar Python serta SageMaker.
Berapa hyperparameter yang perlu diubah buat training MTRL di SageMaker?
Menurut eksperimen AWS, cuma tiga hyperparameter yang diubah dari default: max_epochs, global_batch_size, dan rollout_max_concurrency. Sisanya seperti algoritma dan estimator advantage dibiarin default dan tetap ngasih hasil bagus.

Classai Weekly
dari Luthfi · Setiap Senin, 06.30 WIB
Nggak sempat ngikutin berita AI? Biar aku yang rangkumin tiap Senin.
- 5 berita AI paling penting minggu ini — udah disaring, nggak perlu baca puluhan situs
- Kenapa itu penting buat kamu — plus opini jujur Luthfi soal arahnya
- 1 prompt siap pakai yang bisa langsung dicoba
- Pilihan kelas & model AI minggu ini — kadang ada promo khusus pelanggan
Langkah berikutnya
Sudah paham teorinya. Sekarang praktikkan.
Daftar, isi saldo mulai puluhan ribu rupiah, dan panggil model AI pilihanmu dari kode yang sudah ada.
Ditulis oleh
Pengembang Classai Router
Tim Engineering Classai membangun dan menjalankan Classai Router, gateway API AI yang kompatibel dengan format OpenAI dan Anthropic. Kami menulis panduan teknis dari pengalaman mengoperasikan API AI setiap hari.


