TLDR
DeepSeek telah menambahkan kemampuan multimodal ke chatbot mereka, memungkinkan pemrosesan gambar dan video. Model terbaru, V4, diluncurkan bersamaan dengan penawaran harga yang lebih kompetitif. Pengembangan teknologi multimodal penting untuk meningkatkan interaksi AI dengan pengguna. DeepSeek, startup AI asal Tiongkok, meluncurkan mode pengenalan gambar baru di chatbot mereka yang memungkinkan pemrosesan teks, gambar, dan video secara multimodal. Mode ini dirilis dalam versi beta untuk pengguna terpilih melalui situs dan aplikasi mobile DeepSeek. Penambahan ini membuat DeepSeek sejajar dengan kompetitor AI yang sudah mengadopsi teknologi serupa.Fitur multimodal ini diumumkan oleh Chen Xiaokang, pemimpin tim multimodal DeepSeek, serta mendapat sambutan positif dari peneliti senior Chen Deli melalui media sosial X. Mode pengenalan gambar kini bergabung dengan mode chat 'expert' dan 'flash' yang sebelumnya telah ada. Peluncuran fitur ini juga bertepatan dengan peluncuran model V4 dan pemotongan harga produk DeepSeek.Penambahan kemampuan multimodal dipandang esensial untuk memperdalam interaksi pengguna dan memperluas aplikasi AI ke bidang yang lebih kompleks dan bernilai ekonomi tinggi. DeepSeek berupaya menguatkan daya saingnya dengan inovasi ini supaya dapat menjadi pilihan utama bagi pengguna yang membutuhkan solusi chatbot modern dan multifungsi.