Komunitas pengembang AI baru saja dikejutkan oleh pergerakan agresif DeepSeek. Tepat pada 21 Agustus 2026, tak lama setelah beberapa developer bermata elang mengorek bocoran model misterius di DeepSeek Harness, pihak DeepSeek langsung merespons dengan mempublikasikan dokumentasi resmi API "Pemahaman Gambar" mereka.
Perkenalkan: DeepSeek-V4-Flash-Vision-Exp, iterasi terbaru yang menandai kepingan puzzle terakhir DeepSeek dalam menguasai ranah Multimodal AI.
📸 Bekerja Hanya dengan Melihat Gambar
Sebelumnya, fitur pengenalan visual DeepSeek hanya bisa dinikmati melalui antarmuka web. Kini, kemampuan tersebut dilebur langsung ke dalam toolchain pengembangan.
Melalui pembaruan DeepSeek Harness (versi 0.1.1-rc.1), agen AI (AI Agent) kini memiliki kemampuan "melihat". Pengembang dapat mencampur input teks dan gambar pada perintah krusial seperti /goal dan /plan. Artinya, Anda cukup melempar screenshot aplikasi dan menuliskan, "Tolong buatkan kode frontend yang mirip desain ini", lalu biarkan AI mengeksekusinya secara otomatis.
"A glowing robotic hand placing a glowing puzzle piece labeled 'VISION' into a large high-tech holographic puzzle board. Neon blue aesthetics, cinematic lighting, 8k, Unreal Engine render."📊 Spesifikasi "Monster" di Kelas Flash
Meski mengusung embel-embel Flash yang identik dengan model ringan, spesifikasi yang ditawarkan versi Vision ini sangat beringas. Berikut adalah detail kapasitas teknisnya:
| Spesifikasi / Fitur | Detail Kapasitas | Keterangan Tambahan |
|---|---|---|
| Konteks Input | 1 Juta (1M) Token | Mampu menelan banyak gambar sekaligus |
| Kapasitas Output | 384K Token | Sangat panjang untuk generate kode utuh |
| Integrasi API | Tool Calls, JSON, Anthropic | Kompatibilitas tinggi dengan sistem lama |
| Batas Konkurensi | 2.500 Request | Tangguh untuk aplikasi skala produksi |
Sama seperti model vision pada umumnya, setiap gambar yang Anda unggah ke API akan dikonversi menjadi Token berdasarkan ukuran resolusinya, dan akan ditagihkan bersamaan dengan kalkulasi Token teks.
💸 Merusak Harga Pasar: 3x Lebih Murah dari Pro!
Hal paling mencengangkan dari peluncuran ini bukanlah teknologinya, melainkan harganya. DeepSeek mematok harga V4-Flash-Vision-Exp sama persis dengan versi V4 Flash standar teks. Ini berarti, harganya hanya sekitar sepertiga (1/3) dari biaya model V4 Pro!
Berikut adalah rincian tarif per juta token (dalam mata uang Yuan/RMB):
| Tipe Konsumsi Token | Jam Sibuk (Peak) | Luar Jam Sibuk (Off-peak) |
|---|---|---|
| Input (Cache Hit) | ¥0.10 | ¥0.05 |
| Input (Cache Miss) | ¥3.0 | ¥1.5 |
| Output | ¥9.0 | ¥4.5 |
Maksimalkan fitur penghematan dengan mengirimkan gambar referensi yang sama secara berulang untuk memicu Cache Hit. Biaya input Anda bisa turun drastis hingga ¥0.05 per juta token di jam sepi!
⚙️ Integrasi API Multimodal
Bagaimana alur kerja pengiriman gambar ke endpoint API DeepSeek terbaru ini?
Bagi Anda yang sudah gatal ingin mencobanya, Anda tidak perlu menunggu. Endpoint model ini sudah terbuka. Berikut adalah kerangka kode implementasinya:
import OpenAI from "openai"; const openai = new OpenAI({ baseURL: '[https://api.deepseek.com](https://api.deepseek.com)', apiKey: process.env.DEEPSEEK_API_KEY}); async function analyzeImage() { const response = await openai.chat.completions.create({ model: "deepseek-v4-flash-vision-exp", messages: [ { role: "user", content: [ { type: "text", text: "Jelaskan apa yang salah pada desain UI di gambar ini?" }, { type: "image_url", image_url: { url: "[https://url-gambar-anda.com/ui-error.jpg](https://url-gambar-anda.com/ui-error.jpg)" } } ] } ] }); console.log(response.choices[0].message.content);}Peluncuran model vision berbiaya rendah ini jelas menjadi pukulan telak bagi kompetitor. Dengan mengintegrasikannya ke dalam toolchain pengembang, DeepSeek tidak hanya menjual API, tetapi juga menawarkan alur kerja (workflow) yang benar-benar baru.
Pelajari lebih lanjut cara mengoptimalkan prompt gambar pada Seri Panduan Backend AI atau telusuri dokumentasi resminya di Situs API DeepSeek.