FLUX 3 dari Black Forest Labs adalah model multimodal terbaru yang bisa prediksi gambar, video, dan audio. Yuk, simak kehebatannya!
Jadi, Black Forest Labs (BFL) baru aja ngeluncurin FLUX 3, model canggih yang bisa belajar dari gambar, video, dan audio dalam satu arsitektur. Ini tuh model pertama yang bisa ngelakuin prediksi video, audio, dan aksi dari satu set bobot. Tim riset BFL bilang, nggak ada satu modalitas pun yang bisa ngejelasin dunia secara lengkap. Gambar cuma nangkep struktur spasial di satu momen, sedangkan video bisa nampilin dinamika fisik dan audio nunjukin hubungan sebab akibat antara kejadian mekanis dan suara.
FLUX 3 dibangun berdasarkan prinsip bahwa semua modalitas ini saling mengikat satu sama lain. Misalnya, suara harus sesuai dengan dampak yang terjadi, dan gerakan harus mematuhi massa. Ini bikin FLUX 3 jadi model pertama yang dibangun sepenuhnya dengan prinsip itu. Gimana cara kerjanya? Dengan metode Self-Flow, yang menggabungkan tujuan pencocokan aliran dengan tujuan rekonstruksi fitur yang diawasi sendiri.
FLUX 3 bisa menghasilkan klip video selama 20 detik dalam satu generasi, lengkap dengan audio asli. Ada berbagai mode yang didukung, seperti text-to-video, image-to-video, dan video-to-video dari klip referensi. BFL juga bilang, mereka punya kemampuan dialog multibahasa dan bisa bikin transisi yang terkontrol. Keren banget, kan?
Advertisement
Slot in-article yang tampil setelah paragraf ketiga.
Tim BFL juga melaporkan bahwa FLUX 3 punya kekuatan khusus dalam mengekspresikan wajah manusia dan mengaitkan suara dengan kejadian fisik. Dalam pengujian preferensi manusia, FLUX 3 lebih disukai dibandingkan Luma Ray 3.2 dalam 93% perbandingan dan lebih unggul dari Runway Gen-4.5 dalam 77% perbandingan. Ini menunjukkan bahwa FLUX 3 bener-bener bisa diandalkan untuk menghasilkan video yang menarik.
Satu hal yang menarik, FLUX 3 juga bisa digunakan di robot. Dengan waktu reaksi di bawah 80 ms di satu RTX 5090, FLUX-mimic bisa menjalankan kebijakan robot yang efisien. Ini artinya, teknologi ini bukan cuma buat video dan audio, tapi juga bisa dipakai di dunia nyata, kayak di pabrik atau dalam aplikasi robotik.
Tapi, akses untuk FLUX 3 ini terbatas. Video dan aksi masih dalam tahap akses awal, sedangkan gambar bakal menyusul. Bobot terbuka bakal dirilis belakangan. Jadi, kalau kamu penasaran sama teknologi ini, siap-siap aja untuk nunggu!
AI Updates lagi bergerak cepat, jadi jangan cuma lihat headline.
MarkTechPost
Catatan redaksi
Kalau lo cuma ambil satu hal dari artikel ini
AI Updates update dari MarkTechPost.
Sumber asli
Artikel ini merupakan rewrite editorial dari laporan MarkTechPost.
Baca artikel asli di MarkTechPost→