AutoSynthData Rilis: Cara Baru Latih AI Agent Perusahaan
ServiceNow ngerilis AutoSynthData, pipeline yang ubah kegagalan agen AI jadi data latihan sintetis. Di uji coba EnterpriseOps Gym, akurasinya naik lumayan gede cuma dari ribuan task sintetis.
· 6 menit baca

Inti singkat
- AutoSynthData adalah pipeline ServiceNow CoreAI buat bikin data latihan sintetis dari kegagalan agen AI di lingkungan enterprise.
- Di EnterpriseOps Gym Hybrid, Pass@1 Gemma naik 7,2 poin persentase cuma dari 2.000 sampel sintetis dalam 18 jam.
- Di domain ITSM, Pass@1 Gemma melompat dari 18,77% ke 27,18% pakai DeepSeek-V4.1-Flash sebagai teacher model.
- Setiap task sintetis dicek lewat verifikasi positif, negatif, dan review level batch sebelum dipakai buat training.
- Riset ini masih fokus di supervised fine-tuning, tapi mekanismenya kemungkinan bisa diperluas ke reinforcement learning.
Daftar isi7 bagian
- 01
- 02
- 03
- 04
- 05
- 06
- 07
ServiceNow baru ngerilis AutoSynthData, pipeline yang ngubah kegagalan agen AI jadi data latihan sintetis buat bikin agen AI makin jago kerja di sistem enterprise. Di uji coba mereka pakai EnterpriseOps Gym, cara ini berhasil naikin akurasi model sampe puluhan persen cuma dari ribuan task sintetis yang dibuat otomatis.
Buat kamu yang kerja di dunia developer atau lagi ngulik AI agent buat perusahaan, ini kabar yang pantas disimak. Salah satu masalah paling umum pas mau pakai AI agent di perusahaan adalah: model yang kelihatan jago di benchmark umum, tapi nyangkut pas dihadepin sistem internal, aturan bisnis yang spesifik, atau kombinasi tools yang aneh-aneh. Menurut pengumuman resmi ServiceNow CoreAI di Hugging Face, masalah itu yang coba mereka pecahin lewat AutoSynthData.
Panduan gratis · gratis
Panduan Cepat API AI untuk Developer
Dari request pertama sampai siap produksi: contoh kode, streaming, kontrol biaya, keamanan API key, dan penanganan error.
- Contoh request dengan cURL, Python, dan JavaScript
- Streaming dan format OpenAI vs Anthropic
- Cara mengontrol biaya token
- Checklist keamanan dan siap produksi
Apa itu AutoSynthData buat Enterprise Agents?
AutoSynthData itu pipeline otomatis bikinan tim ServiceNow CoreAI buat ngubah "kelemahan" model AI jadi data latihan baru. Caranya: ngetes model target di lingkungan kerja asli, lihat di mana dia gagal, lalu pakai model teacher yang lebih kuat buat nunjukin gimana cara nyelesain task itu dengan bener.
Tim ServiceNow CoreAI nulis gini soal kenapa ini penting: "Perusahaan butuh agen AI yang bener-bener jalan di lingkungan kerja mereka sendiri, sesuai sistem dan aturan yang mereka punya." Intinya, satu task cuma terdiri dari tiga bagian: system specification (aturan dan batasan lingkungan kerja), user prompt (permintaan yang masuk akal buat diminta user), dan verifier (penentu apakah agen berhasil atau gagal).
Supaya task-nya kepake buat training, tiga hal ini harus kepenuhin: feasible (emang bisa diselesain di lingkungan itu), realistis (mirip permintaan asli dari user), dan cukup susah (nunjukin kelemahan model yang sekarang, bukan task yang udah dikuasai).
Gimana AutoSynthData Bikin Task Baru dari Kegagalan Model?
Prosesnya dimulai dari evaluasi. Model target dan model teacher sama-sama dijalanin di task diagnostik di lingkungan kerja yang sama. Dari situ tim nganalisis kemampuan apa yang diuji, di mana model target gagal, dan gimana teacher berhasil nyelesain.
Temuan itu diringkas jadi "capability specification card" yang udah disaring — generator task sama sekali nggak dikasih prompt asli, entitas, atau detail verifier dari task evaluasi. Dia cuma dapat kartu ringkasan, lalu bikin task baru dengan entitas, kondisi awal, kombinasi tools, dan tingkat kesulitan yang beda-beda. Teacher kemudian ngasih contoh cara nyelesainnya, dan itu yang dipakai buat supervised fine-tuning (SFT) model target.
Dua Fase Bikin Data: Target dan Multiply
AutoSynthData ngerjain dataset-nya dalam dua tahap:
- Target — bikin kumpulan sampel inti langsung dari capability specification card. Tiap kandidat task diproses paralel, lalu lewat validasi, eksekusi, evaluasi solver, dan repair sebelum diterima.
- Multiply — ngembangin sampel yang udah diterima jadi varian baru, masing-masing dengan permintaan, kondisi lingkungan, dan verifier sendiri. Satu sampel hasil multiply nggak boleh dipakai buat bikin sampel multiply lagi, jadi penyebarannya tetap terjaga nggak melenceng jauh dari task inti.
Cara AutoSynthData Mastiin Data Latihannya Nggak Ngasal
Bikin task yang kedengaran masuk akal itu gampang, tapi belum tentu kepake buat training. Makanya tiap kandidat task harus lolos beberapa gerbang kualitas:
- Solver evaluation — ngukur tingkat kesulitan. Task yang dipakai idealnya cuma berhasil diselesaikan model target maksimal 1 dari 3 percobaan, tapi teacher berhasil minimal 2 dari 3 percobaan.
- Positive verification — ngecek apakah solusi yang dimaksud emang bener-bener nyelesain task itu.
- Negative verification — ngecek apakah hasil yang salah emang gagal lolos verifikasi, buat nangkep verifier yang terlalu lemah.
- Critique & repair — task yang gagal dikasih ke "kritikus" buat didiagnosis dan diperbaiki, dengan batas percobaan ulang.
Selain level sampel, ada juga review di level batch buat ngecek apakah ada jenis task yang kebanyakan muncul, kemampuan yang kelewat, atau pola kegagalan yang berulang. Dari situ, arah generate task buat batch berikutnya ikut disesuaikan.
Hasil Eksperimen di EnterpriseOps Gym: Hybrid vs ITSM
Tim ServiceNow nguji AutoSynthData di dua domain EnterpriseOps Gym, lingkungan simulasi kerja enterprise yang stateful.
| Domain | Model Target | Teacher | Jumlah Sampel | Waktu Generate | Hasil |
|---|---|---|---|---|---|
| Hybrid | Gemma-4-26B-A4B-it | Qwen3.8-27B | 2.000 | ~18 jam | Pass@1 naik 7,2 poin (35% relatif), verifier success 63,01% → 68,55%, nutup 59% gap ke model referensi |
| ITSM | Gemma-4-26B-A4B-it | DeepSeek-V4.1-Flash | 1.994 | 66 jam | Pass@1 naik dari 18,77% ke 27,18% |
Menarik nih, di eksperimen ITSM, teacher yang dipakai adalah DeepSeek V4.1 Flash — model yang belakangan lagi rame dibahas juga di Indonesia. Waktu generate-nya lebih lama (66 jam) dibanding Hybrid, tapi ServiceNow bilang ini lebih karena teacher-nya lebih gede dan belum ada optimasi pipeline, bukan soal kualitas model.
Dampak buat Developer dan Bisnis AI di Indonesia
Buat tim developer Indonesia yang lagi bangun AI agent buat internal perusahaan — misalnya bot yang terintegrasi ke sistem ERP, helpdesk IT, atau workflow approval — masalah yang diselesain AutoSynthData ini kerasa banget. Model yang jago di benchmark umum sering kebingungan pas ketemu sistem dan aturan bisnis yang khas.
Konsep intinya bisa diadaptasi tanpa harus sekompleks pipeline ServiceNow: pakai model yang kuat buat jadi "teacher" yang ngasih contoh solusi, lalu dipakai buat ngajarin model yang lebih kecil atau buat bikin dataset evaluasi internal. Yang penting, tetep ada proses verifikasi biar data latihannya nggak ngasal.
Cara nyobain konsep serupa buat developer
- Tentuin satu workflow spesifik yang sering gagal dikerjain agen AI kamu.
- Pakai model yang lebih kuat buat jadi teacher — generate contoh solusi yang bener buat workflow itu.
- Verifikasi manual atau otomatis dulu sebelum dipakai buat fine-tune atau few-shot prompting model yang lebih kecil/murah.
- Ulangi proses ini secara berkala sambil ngecek kemampuan model yang masih lemah.
Kalau mau nyobain model teacher kayak DeepSeek V4.1 Flash buat eksperimen semacam ini, kamu bisa akses lewat Classai Router. Harga model deepseek-v4.1-flash di sana Rp160 per 1 juta token input dan Rp800 per 1 juta token output, kompatibel langsung sama SDK OpenAI maupun Anthropic — tinggal arahin base URL, kode lain nggak perlu diubah.
Saya punya agen AI yang sering gagal di task berikut: [jelasin workflow dan contoh kegagalannya].Tolong analisis pola kegagalannya, lalu bikin "capability specification card" yang berisi:- kemampuan yang sedang diuji- tools/workflow yang terlibat- kondisi akhir yang harus benar biar dianggap sukses- dimensi yang bisa divariasikan tanpa mengubah kemampuan intinya
Kalau kamu lagi ngulik soal integrasi API dan AI agent dari dasar, bisa cek dulu apa itu API AI atau belajar dari kasus Holo4 yang bisa gerakin cursor sendiri buat gambaran gimana agen AI makin diandalkan buat tugas yang butuh banyak langkah.
Masih Riset, Tapi Arahnya Jelas
Tim ServiceNow sendiri bilang eksperimen mereka masih fokus di supervised fine-tuning. Mereka nyebut mekanisme yang sama kemungkinan bisa dipakai buat reinforcement learning, tapi itu masih rencana ke depan, belum hasil yang udah diuji.
Sumber & referensi
- 01
Hugging Face · 2 Oktober 2026
AutoSynthData: Generating Training Data for Enterprise Agents
Artikel ini ditulis ulang oleh Tim Classai dengan bantuan AI berdasarkan sumber di atas — bukan terjemahan. Ada yang keliru? Kabari kami di halo@classai.id.
Pertanyaan yang sering ditanyakan
Apa itu AutoSynthData?
AutoSynthData adalah pipeline bikinan ServiceNow CoreAI yang ngubah kegagalan agen AI di lingkungan kerja jadi data latihan sintetis baru. Caranya pakai perbandingan antara model target yang gagal dan model teacher yang lebih kuat buat nunjukin solusi yang benar.
Apa itu EnterpriseOps Gym?
EnterpriseOps Gym adalah lingkungan simulasi stateful buat ngetes agen AI di task enterprise, dipakai ServiceNow sebagai tempat uji coba AutoSynthData. Dataset-nya sendiri dirilis publik dan dipakai di eksperimen domain Hybrid dan ITSM.
Apa bedanya fase Target dan Multiply di AutoSynthData?
Fase Target bikin kumpulan sampel inti langsung dari analisis kelemahan model, sementara fase Multiply mengembangkan sampel yang udah lolos validasi jadi varian baru dengan entitas dan kondisi berbeda. Satu sampel hasil Multiply nggak boleh dipakai lagi buat bikin varian berikutnya.
Apakah AutoSynthData tersedia buat developer umum atau open source?
Dari blog resminya, ServiceNow nggak menyebut AutoSynthData sebagai tool open source yang bisa langsung dipakai umum. Yang disebut dirilis publik adalah dataset EnterpriseOps Gym yang dipakai buat eksperimen, bukan kode pipeline-nya.
Kenapa data sintetis penting buat latih agen AI enterprise?
Karena task nyata di perusahaan sering spesifik banget sampe sulit nemu data latihan yang cocok secara alami. Data sintetis yang divalidasi lewat verifier ketat bisa ngasih variasi task yang pas buat nutup kelemahan model tanpa harus nunggu data asli terkumpul.

Classai Weekly
dari Luthfi · Setiap Senin, 06.30 WIB
Nggak sempat ngikutin berita AI? Biar aku yang rangkumin tiap Senin.
- 5 berita AI paling penting minggu ini — udah disaring, nggak perlu baca puluhan situs
- Kenapa itu penting buat kamu — plus opini jujur Luthfi soal arahnya
- 1 prompt siap pakai yang bisa langsung dicoba
- Pilihan kelas & model AI minggu ini — kadang ada promo khusus pelanggan
Langkah berikutnya
Sudah paham teorinya. Sekarang praktikkan.
Daftar, isi saldo mulai puluhan ribu rupiah, dan panggil model AI pilihanmu dari kode yang sudah ada.
Ditulis oleh
Pengembang Classai Router
Tim Engineering Classai membangun dan menjalankan Classai Router, gateway API AI yang kompatibel dengan format OpenAI dan Anthropic. Kami menulis panduan teknis dari pengalaman mengoperasikan API AI setiap hari.


