Skill aws-ai-ml di Agent Toolkit for AWS mengubah coding agent jadi konsultan optimasi inferensi SageMaker.
Bekerja lewat protokol MCP sehingga kompatibel bareng Claude Code, Kiro, Codex, atau agent pendukung lainnya.
Bisa menjalankan benchmark beban nyata, membandingkan performa antar-run, dan merekomendasikan konfigurasi GPU paling murah.
Menghasilkan kode SageMaker Python SDK v3 transparan yang siap kamu review, ubah, dan jalankan sendiri.
Daftar isi7 bagian
01
02
03
04
05
06
07
AWS resmi ngerilis skill baru buat optimasi inferensi AI generatif di Amazon SageMaker AI yang bisa langsung dipakai lewat coding agent. Lewat pembaruan ini, coding agent macam Claude Code, Kiro, atau Codex bisa langsung bantu kamu benchmark endpoint, milih instans GPU paling murah, sampai nulis kode SageMaker Python SDK v3 otomatis.
Deploy model AI ke server produksi emang sering bikin pusing kepala. Masalahnya bukan cuma urusan coding atau download bobot model, tapi milih GPU mana yang pas di kantong dan sanggup nahan traffic. Seperti dilaporkan pengumuman resmi AWS, AWS ngeluncurin skill bernama aws-ai-ml melalui Agent Toolkit for AWS untuk menjembatani masalah tersebut.
Kalau kamu sebelumnya sempat ngikutin ulasan soal integrasi Claude Platform di AWS atau pemanfaatan Amazon Quick MCP, ekosistem Model Context Protocol (MCP) di AWS emang makin matang. Skill ini hadir khusus buat bikin urusan infrastruktur inferensi jadi semudah ngobrol bareng rekan kerja.
Panduan gratisPanduan Cepat API AI untuk Developer classai
Panduan gratis · gratis
Panduan Cepat API AI untuk Developer
Dari request pertama sampai siap produksi: contoh kode, streaming, kontrol biaya, keamanan API key, dan penanganan error.
Contoh request dengan cURL, Python, dan JavaScript
Streaming dan format OpenAI vs Anthropic
Cara mengontrol biaya token
Checklist keamanan dan siap produksi
Kenapa Kita Butuh SageMaker AI Inference Agent?
Amazon SageMaker AI punya fitur hosting yang luar biasa komplit. Mulai dari hosting serverful real-time, batch, asynchronous, sampai pengaturan auto scaling dan isolasi VPC. Tapi saking luasnya, engineer sering bingung harus mulai dari mana. Biasanya tim developer datang bukan dengan hafalan spesifikasi GPU, melainkan target performa tertentu atau anggaran cloud bulanan yang terbatas.
Di sinilah sagemaker ai inference agent lewat skill aws-ai-ml masuk sebagai solusi. Kamu cukup ngasih tahu apa yang mau kamu capai dengan bahasa santai sehari-hari. Agent bakal nanya detail kebutuhanmu kayak arsitek solusi, menganalisis data performa terukur, lalu ngasih script Python yang bisa langsung kamu pakai.
Menariknya, semuanya transparan dan kamu tetap pegang kendali penuh. Agent nggak ngambil tindakan sembunyi-sembunyi di belakang UI yang kaku. Semua output disajikan dalam bentuk kode SageMaker Python SDK v3 yang bisa kamu baca, ulik, dan eksekusi sendiri di mesinmu.
4 Kemampuan Utama Skill aws-ai-ml Buat Developer
Begitu skill ini aktif di coding agent pilihanmu, ada empat tugas berat seputar optimasi inferensi AI yang bisa diberesin dengan cepat:
Benchmark endpoint aktif: Kalau kamu udah punya model yang dideploy di SageMaker, kamu bisa minta agent buat nguji performanya. Agent bakal nyiapin script load test pakai API Workload.synthetic() dan start_benchmark() dari SDK SageMaker untuk ngukur throughput, latensi, dan konkurensi dari beban traffic nyata.
Nemu tipe instans GPU paling hemat: Bingung mau deploy model di server mana? Cukup kasih lokasinya ke agent. Sumber modelnya bebas: bisa file fine-tuned di Amazon S3, foundation model dari katalog Amazon SageMaker JumpStart, atau model dari Hugging Face Hub. Untuk model yang butuh izin lisensi seperti varian Llama, agent bakal nampilin syarat lisensi dan minta token Hugging Face kamu.
Bandingkan performa antar-run benchmark: Kamu habis ganti konfigurasi server atau tukar tipe GPU? Kasih dua nama job benchmark ke agent, nanti agent bakal bikin tabel perbandingan lengkap beserta persentase selisihnya biar ketahuan mana yang beneran lebih ngebut.
Rekomendasi optimasi serving: Selain nyari mesin, agent juga bisa ngasih masukan teknik pengoptimalan tambahan, misalnya fitur prefill decoding buat ningkatin responsivitas model.
Hasil Benchmark Nyata: Uji Qwen3-8B vs Qwen3-1.7B
Untuk membuktikan kalau sarannya berdasarkan data terukur dan bukan tebak-tebakan, AWS ngasih contoh pengujian sintetis (512 token input, 256 token output, konkurensi 4) antara dua model:
Metrik Evaluasi
Qwen3-1.7B (Model A)
Qwen3-8B (Model B)
Selisih (Δ%)
Output token throughput
188.2 tokens/s
271.2 tokens/s
+44.1%
Per-user throughput
47.5 tokens/s
69.4 tokens/s
+45.9%
Request throughput
0.736 req/s
1.08 req/s
+46.7%
Inter-token latency
20.9 ms
14 ms
+33.0%
Request latency
5.382 ms
3.658 ms
+32.0%
Time to first token (TTFT)
67.5 ms
166.3 ms
−146.5%
Sebagai catatan teknis, Qwen3-8B berjalan di mesin 4-GPU ml.g5.12xlarge (4x A10G), sementara Qwen3-1.7B dipasang di single GPU L4 pada instans ml.g6.4xlarge. Keunggulan throughput 44–47 persen pada Qwen3-8B hadir berkat kapasitas komputasi GPU yang sekitar 4 kali lebih besar. Qwen3-1.7B cuma menang di metrik time to first token karena ukuran modelnya memang jauh lebih enteng.
Cara Pasang Skill di Coding Agent Lokal (Claude Code, Kiro, Codex)
Kamu bisa nyiapin coding agent sagemaker ini di laptop atau PC lokal dalam waktu sekitar 10 menit. Syarat awalnya, pastiin kamu udah install AWS CLI versi 2.35+ dan package manager uv.
Berikut langkah-langkah praktisnya:
Atur Agent Toolkit for AWS lewat terminal:
bash
aws configure agent-toolkit
Perintah ini bakal otomatis ngedeteksi coding agent di komputermu dan nyiapin AWS MCP Server.
Buka panel chat coding agent kamu, lalu ketik: "What skills are available?". Pastikan aws-ai-ml muncul di daftar.
Mulai ajak ngobrol pakai prompt biasa. Pastikan kredensial AWS lokalmu punya izin akses ke API SageMaker AI.
Khusus buat pemakai Kiro atau Claude Code, agent bisa nemuin skill ini secara fleksibel saat runtime lewat AWS MCP Server tanpa perlu instalasi lokal manual.
Opsi Alternatif: Pakai Amazon SageMaker Studio
Kalau kamu nggak mau ribet install dependensi lokal di laptop, kamu bisa jalanin skill ini langsung di cloud lewat SageMaker Studio JupyterLab:
Masuk ke Amazon SageMaker Studio di Region AWS yang kamu tuju, buka domain, lalu jalankan Studio IDE.
Bikin JupyterLab space baru, beri nama (misalnya my-inference-opt), dan pastikan setelan sharing disetel ke Private (skill cuma bisa tersinkron di private space).
Pada menu Image, pilih image bawaan yang udah dilengkapi skill optimasi inferensi SageMaker AI.
Jalankan space tersebut (tunggu boot sekitar 5–10 menit pas pertama kali), lalu buka Terminal.
Lakukan autentikasi coding agent milikmu di terminal, misalnya login Kiro via kiro-cli.
Buka panel chat agent kamu, cek ketersediaan skill, dan langsung mulai interaksi.
Contoh Prompt Siap Pakai Buat Coding Agent
Kamu nggak perlu pusing ngapalin parameter rumit. Begitu skill terpasang, cukup kasih prompt kayak gini ke coding agent kamu:
Prompt siap pakai
Saya punya model open source di Hugging Face Hub (misalnya Qwen atau Llama). Saya ingin mencari konfigurasi instans SageMaker yang paling murah tapi tetap sanggup melayani throughput stabil. Tolong siapkan script benchmark dan rekomendasi instansnya.
Agent bakal langsung ngecek kebutuhan model, ngurus verifikasi lisensi jika diperlukan, lalu nyediain kode SageMaker Python SDK v3 yang rapi dan siap kamu jalankan.
Efek Buat Developer dan Tim Tech di Indonesia
Buat developer dan startup di Indonesia, biaya komputasi GPU cloud itu isu yang sensitif banget. Salah pilih tipe instans di awal bisa bikin biaya operasional bulanan meledak tanpa performa yang sebanding. Hadirnya skill MCP ini bikin keputusan arsitektur jadi berbasis angka benchmark riil, bukan sekadar nebak-nebak.
Namun, kalau tim kamu mau langsung bikin fitur aplikasi berbasis AI tanpa ribet ngurusin manajemen cluster GPU dan instalasi server cloud sendiri, kamu bisa coba pakai Classai Router. Lewat satu API key, kamu bisa akses beragam model kelas dunia dengan biaya sangat terjangkau:
Claude Sonnet 5 di harga Rp160 / Rp800 per 1 juta token buat task coding kompleks.
GPT-4o dengan tarif Rp500 / Rp2.500 per 1 juta token.
Top up di Classai Router gampang banget karena bisa mulai dari Rp10.000 pakai QRIS atau transfer virtual account bank lokal tanpa kartu kredit luar negeri. Praktis banget buat prototyping cepat sebelum memutuskan apakah tim kamu beneran butuh server GPU dedicated di AWS.
Kalau kamu pengin memperdalam skill membangun aplikasi cerdas pakai model bahasa dan coding agent, kamu juga bisa gabung di kelas AI untuk Developer.
Artikel ini ditulis ulang oleh Tim Classai dengan bantuan AI berdasarkan sumber di atas — bukan terjemahan. Ada yang keliru? Kabari kami di [email protected].
Pertanyaan yang sering ditanyakan
Apa itu skill aws-ai-ml di Amazon SageMaker?
Skill aws-ai-ml adalah toolkit resmi AWS berbasis Model Context Protocol (MCP) buat coding agent. Skill ini membantu developer mengoptimalkan konfigurasi hosting, melakukan load test riil, dan memilih GPU paling hemat di SageMaker AI.
Coding agent apa saja yang bisa pakai skill ini?
Skill ini kompatibel dengan semua coding agent pendukung protokol MCP, seperti Claude Code, Kiro, dan Codex. Kamu bisa menjalankannya di laptop lokal atau lewat SageMaker Studio JupyterLab.
Apakah coding agent bisa mendeploy endpoint secara mandiri?
Nggak. Agent cuma menghasilkan kode SageMaker Python SDK v3 yang transparan dan siap kamu eksekusi sendiri. Agent selalu minta persetujuan kamu sebelum menjalankan perintah yang berdampak pada infrastruktur aktif.
Gimana cara mencegah tagihan membengkak sehabis uji coba?
Pastikan kamu menghapus endpoint SageMaker AI yang dibuat saat benchmark, menghentikan JupyterLab space di SageMaker Studio, dan menghapus file hasil kerja di bucket S3 setelah pengujian selesai.
Classai Weekly
dari Luthfi · Setiap Senin, 06.30 WIB
Nggak sempat ngikutin berita AI? Biar aku yang rangkumin tiap Senin.
5 berita AI paling penting minggu ini — udah disaring, nggak perlu baca puluhan situs
Kenapa itu penting buat kamu — plus opini jujur Luthfi soal arahnya
1 prompt siap pakai yang bisa langsung dicoba
Pilihan kelas & model AI minggu ini — kadang ada promo khusus pelanggan
Tim Engineering Classai membangun dan menjalankan Classai Router, gateway API AI yang kompatibel dengan format OpenAI dan Anthropic. Kami menulis panduan teknis dari pengalaman mengoperasikan API AI setiap hari.
AWS ngasih contoh gimana Amazon Quick bisa dipakai buat audit ribuan dokumen sewa secara menyeluruh, tapi keputusan pass/fail tetap dipegang rules engine, bukan model AI.