Biaya Inferensi Tidak Berkelanjutan

Ya, sekarang saya menyelesaikan seperempat langganan MAX minggu saya dalam beberapa jam bekerja dengan Claude Code.
Menurutku Anthropic itu pintar, dan menurutku mereka tidak mencoba menipu kita. Saya pikir sejujurnya mereka hanya mencoba menyelaraskan tuduhan inferensi dengan kenyataan.
Dan hal ini harus menjadi peringatan bagi kita semua.
Saya pikir kita akan membutuhkan multi-model harness (atau model bagus yang JAUH lebih murah dalam satu platform), seperti Haiku 20x lebih murah atau apa pun.
Hal ini tidak berkelanjutan.
Semakin baik tali pengaman dan modelnya, semakin banyak orang yang akan membangunnya. Yang akan membutuhkan lebih banyak inferensi.
Saya pikir solusi nyata di sini akan datang dari:
-
Teknologi seperti Cerberus, dkk yang membuat inferensi berkali-kali lebih murah dan cepat
-
Dorongan besar dari laboratorium besar untuk menghasilkan kualitas yang lebih tinggi dalam model yang jauh lebih kecil/lebih murah
-
Memanfaatkan peralihan ke model hibrida berbayar/cloud dan lokal/murah.
Jika ini terus berlanjut, saya harus membuat PAI versi kustom saya sendiri menggunakan Pi, yang dapat menggunakan model lokal pada dual 4090 saya, model seperti Gemini-Flash, model seperti Gemma 4, dll.
Dan yang paling penting, infra kait baru yang menilai tugas dan mengarahkan dengan benar ke model yang tepat.
- Maks: Opus / GPT-5.4
- Tinggi: Soneta
- Sedang: Haiku
- Rendah: (Lokal) Apapun model OSS terbaru terbaik yang dapat berjalan di NVIDIA / Mac Silicon saya
Saya pikir kita semua tahu hal ini akan terjadi; Saya hanya berpikir itu akan terjadi pada tahun 2027 nanti. Dan lebih lembut.
Tampaknya hal ini sudah sangat dekat karena subsidi sebesar ini tampaknya tidak berkelanjutan bagi Anthropic, yang berarti mungkin juga tidak berkelanjutan bagi OpenAI.
Rekomendasi saya: Mulailah merencanakan strategi model Multi / Lokal / Lebih Murah untuk harness Anda.
