Lewati ke konten utama
SlashJournalSlashJournal
Beranda
SeriGlosariumTentangKontak
SlashJournalSlashJournal

Catatan produksi tentang sistem terdistribusi, rekayasa antarmuka, dan keputusan teknis yang layak dipahami.

Baca

TulisanSeriGlosariumTentang

Dukungan & legal

KontakDaftar menjadi penulisPrivasiKetentuanCookie
© 2026 SlashJournalRSS feed
Beranda/Kecerdasan Buatan & Riset/Inovasi Tools Developer/JIT-Agent Rilis! DeepSeek-V4-Flash Langsung Bantai GPT-5.6 Lewat "Evolusi Instan"
Kecerdasan Buatan & RisetSeri: Inovasi Tools Developer · Bagian 50

JIT-Agent Rilis! DeepSeek-V4-Flash Langsung Bantai GPT-5.6 Lewat "Evolusi Instan"

Peneliti LV-NUS baru aja ngerilis makalah JIT-Agent. Alih-alih pakai kerangka kerja (harness) yang kaku, AI sekarang bisa meracik strategi dan alatnya sendiri secara instan (Just-in-Time) sesuai tugas. Hasilnya? Model ringan kyk DeepSeek-V4-Flash sukses membantai skor GPT-5.6, sekaligus menekan biaya dan latensi!

C

Choirul Humam

Penulis & Arsitek

30 Agustus 20263 mnt baca
JIT-Agent Rilis! DeepSeek-V4-Flash Langsung Bantai GPT-5.6 Lewat "Evolusi Instan"

Sumber visual:

Ilustrasi AI Berlabel

Kita sering mendengar bahwa agar AI menjadi lebih cerdas, ukuran model (jumlah parameter) harus sangat besar. Itulah sebabnya masuk akal jika DeepSeek berupaya keras menggalang modal sebesar $7,4 miliar untuk membeli server demi menyaingi OpenAI

Namun, tim peneliti dari LV-NUS (National University of Singapore) baru saja membuktikan bahwa anggapan tersebut keliru. Makalah terbaru mereka, JIT-Agent (Just-in-Time Harness Evolution), mengungkap rahasia baru: kecerdasan AI tidak hanya ditentukan oleh Foundation Model (model dasar), tetapi juga oleh Harness-nya (kerangka kerja pendukung).

Rekomendasi "Harness" Cepat: Ubah Aturannya

Pada era agen AI terdahulu (seperti Claude Code atau OpenCode), pengembang manusia harus menulis harness secara manual dan kaku (hardcoded). Harness ini menentukan bagaimana AI menggunakan informasi (memory), mengatur tugas (planning), melakukan tindakan, dan memanfaatkan tools (peralatan).

Apa masalahnya? Satu harness dirancang untuk menangani segala jenis pekerjaan.

JIT-Agent membalikkan logika ini. Model tersebut tidak dibekali dengan harness yang kaku, melainkan bertindak sebagai "Asisten Perakit" (Assembly Assistant). Saat ada tugas masuk, JIT-Agent membuat harness baru—yang dirancang khusus untuk momen tersebut (Just-in-Time)—dengan empat modul utama: Memory, Planning, Action, dan Capability.

Untuk gambaran lebih jelas, lihat alur kerja mereka yang luar biasa:

Ruang Kemitraan SlashJournal
Diagram Arsitektur (Mermaid)
Merender diagram arsitektur...

Sistem perakitan harness ini memungkinkan peningkatan efisiensi model secara signifikan. Tidak ada lagi prompt raksasa yang membebani latensi dan biaya API. Model utama hanya berfokus pada "proses berpikir", sementara JIT-Agent menangani "pembentukan kebiasaan teknis". Hasilnya sungguh mengesankan. Model "kelas ringan" seperti DeepSeek-V4-Flash, saat dipadukan dengan JIT-Agent, mampu menantang dominasi model-model raksasa.

Perbandingan performa JIT-Agent pada benchmark DeepSearchQA, Daily Work, Planning, dan Workspace
JIT-Agent meningkatkan performa berbagai model AI pada benchmark DeepSearchQA, Daily Work, Planning, dan Workspace.

Sumber: X @NFT_Chen

Paper JIT-Agent tentang evolusi harness AI secara just-in-time dan peningkatan performa agent
JIT-Agent memperkenalkan evolusi harness AI secara langsung untuk meningkatkan kemampuan model pada berbagai tugas agen.

Sumber: X @NFT_Chen

Kombinasi ModelDeepSearchQAOdysseyBench
GPT-5.6 Sol (Tanpa JIT)BaselineBaseline
DeepSeek-V4-Flash + JIT-Agent+9,1 poin — Kemenangan telak+4,3 poin — Menang

Bukan hanya DeepSeek yang mengalami peningkatan; model-model lain dalam ekosistem sumber terbuka (open-source) seperti Qwen3.6 dan Mimo-V2.5 juga mencatatkan lonjakan performa yang signifikan. Selain itu, jika Anda mengikuti langkah Zhipu baru-baru ini dalam memperkuat GLM-5.3 menggunakan reinforcement learning, versi sebelumnya (GLM-5.2) pun turut mengalami peningkatan pesat, dengan tambahan +20,2 poin saat dikombinasikan dengan JIT-Agent! Dari sisi pemrograman, abstraksi ini menghilangkan praktik prompt engineering manual yang melelahkan:

Catatan Arsitektur

Gerbang menuju RSI:

Arsitektur JIT-Agent merupakan contoh Recursive Self-Improvement (RSI) yang aman; sistem ini mampu menangani kegagalan, melakukan koreksi mandiri minimal pada kerangka kerjanya, serta menyimpan hasilnya dalam bank memori. Pendekatan ini jauh lebih praktis dan masuk akal untuk diterapkan di dunia nyata dibandingkan narasi bernada alarmis seputar RSI—seperti insiden OpenAI Astra, di mana sebuah agen "lolos" dari sandbox-nya.

Mulai sekarang, perang AI tidak lagi sekadar soal siapa yang memiliki sumber daya komputasi paling masif. Tantangan sesungguhnya terletak pada model mana yang mampu segera menggerakkan ekosistem untuk bekerja secara mandiri (Just-in-Time) saat menghadapi tugas-tugas yang belum pernah ditemui sebelumnya.

Menurut Anda, apakah model GPT generasi berikutnya akan dibuat oleh OpenAI yang sedang panik dengan menggunakan metode JIT-Agent ini?

Kata Kunci:#deepseek v4 flash#gpt 5.6 sol#jit-agent nus#glm-5.2#agent harness intelligence#recursive self improvement#qwen 3.6

Sumber

  1. [1]X @NFT_Chen
  2. [2]arxiv.org
  3. [3]Github
Ruang Kemitraan SlashJournal

Apresiasi & Reaksi Pembaca

Klik untuk memberikan apresiasi
Bab SebelumnyaBukan Cuma Ngetik Kode, Claude Sekarang Bisa Kontrol Robot Fisik Pakai MHS!

Catatan Mingguan

Bawa naskah baru ke inbox Anda.

Satu email berkala saat naskah baru terbit. Tanpa spam, tanpa promosi kosong.

Fokus minat:

Diskusi & Catatan Teknis (0)

Login diperlukan
Masuk untuk mengirim catatan arsitektur
Markdown format didukung
Kasir AI. Tanpa Langganan.

Daftar Isi

Rekomendasi "Harness" Cepat: Ubah Aturannya
C

Choirul Humam

Penulis & Arsitek

Menulis panduan arsitektur perangkat lunak dengan fokus pada keandalan sistem dan kesederhanaan desain.

Profil Lengkap →

Indeks bacaan

Eksplorasi berikutnya

Lanjutkan dari konteks tulisan ini, pembahasan terbaru, atau naskah yang paling banyak dibaca.

Rekomendasi

  1. Kecerdasan Buatan & Perangkat KerasBukan Cuma Ngetik Kode, Claude Sekarang Bisa Kontrol Robot Fisik Pakai MHS!28 Agustus 2026
  2. Kecerdasan Buatan & ProduktivitasGemini 3.5 Transcribe Rilis: AI Penyelamat Buat Lu yang Suka Ngomong Belibet!27 Agustus 2026
  3. Kecerdasan Buatan & ProduktivitasKabar Gembira! Fitur Auto-Jadwal ChatGPT Kini Gratis (Plus Trik Webhook buat Akun Pro)26 Agustus 2026

Sedang trending

  1. Kecerdasan Buatan & KeamananMembongkar Rahasia Watermark Claude: Bagaimana Anthropic Menyisipkan Jejak Gaib di Teks AI?25 Agustus 2026
  2. Keamanan Siber & Industri GamePetaka Data Rockstar: Hacker Bobol GTA VI Demi Protes "Kiamat Kaset Fisik"24 Agustus 2026
  3. Hardware & AI InfrastructureApple Menggila! Mac Studio M5 Ultra Tembus 512GB RAM, Solusi "Ternak" LLM Lokal25 Agustus 2026

Terpopuler

  1. 01Strategi Bisnis & AISejarah Baru: Model AI Terkuat Anthropic (Fable 5) Mulai Ditinggalkan Perusahaan. Kenapa?24 Agustus 2026
  2. 02Strategi Bisnis & AIElon Musk Ngaku Kalah dari Anthropic, Langsung "Bakar" $60 Miliar Buat Beli Cursor!25 Agustus 2026
  3. 03Karir & Industri TechAndrew Ng Peringatkan Developer: Ngoding Pakai AI Tanpa Paham "Fundamental" Itu Bahaya!30 Agustus 2026
#
ai automation bench