TLDR
Pengenalan TPU-8t dan TPU-8i menegaskan pentingnya spesialisasi dalam infrastruktur AI. Latensi menjadi fokus utama dalam desain chip untuk mendukung sistem agentik. Perusahaan harus berpikir secara holistik tentang infrastruktur AI, mencakup accelerator khusus dan komputasi umum. Google meluncurkan dua generasi kedelapan TPU dengan fungsi berbeda, TPU-8t untuk pelatihan dan TPU-8i untuk inferensi real-time dan agentic workloads. Peluncuran ini menandai strategi baru yang mengakui perbedaan beban kerja AI antara throughput dan latensi.TPU-8t meningkatkan performa floating-point hingga tiga kali lipat dengan jaringan yang lebih cepat, sementara TPU-8i memperbesar ukuran pod, menyediakan 10 kali lebih banyak FP8 compute serta kapasitas memori yang jauh lebih besar. Desain topologi jaringan 'boardfly' mengurangi latensi transfer data antar chip secara signifikan.Infrastruktur AI masa depan akan menuntut pendekatan holistik yang menggabungkan chip khusus, CPU sebagai orchestrator, dan topologi jaringan yang dioptimalkan untuk latensi. Perusahaan harus menyesuaikan strategi pengadaan untuk mendukung agentic AI yang membutuhkan performa dan kecepatan di tingkat sistem.