Startup rintisan Vals resmi menarik perhatian industri teknologi setelah mengamankan pendanaan seri A senilai US$40 juta yang dipimpin oleh firma modal ventura raksasa, Andreessen Horowitz. Berbasis di San Francisco, perusahaan yang didirikan pada 2024 ini mengusung misi ambisius: merombak sistem benchmarking atau tolok ukur kecerdasan buatan (AI) yang selama ini dianggap sudah usang dan tidak lagi relevan dengan perkembangan pesat model bahasa besar.
Rayan Krishnan, pendiri Vals yang berusia 25 tahun, melihat adanya celah lebar antara kemampuan model AI terbaru dengan metode pengujian akademik tradisional. Selama ini, banyak perusahaan teknologi menggunakan tolok ukur publik untuk memamerkan keunggulan model mereka. Masalahnya, data uji yang tersedia secara publik memungkinkan pengembang melakukan manipulasi, atau yang sering disebut sebagai 'bermain curang' dengan melatih model agar lulus ujian spesifik tersebut.
Vals membedakan diri dengan tidak mempublikasikan materi pengujian mereka. Pendekatan ini memastikan bahwa evaluasi dilakukan secara objektif dan mendalam. Fokus mereka bukan sekadar menguji pengetahuan umum model, melainkan mengukur kapabilitas dalam menyelesaikan tugas kompleks di sektor krusial seperti hukum, keuangan, hingga keamanan siber. Mereka bahkan mulai merambah ke ranah yang lebih unik seperti biosekuriti dan hukum konflik bersenjata.
Krishnan, yang memiliki rekam jejak sebagai mantan pemagang di Palantir dan peneliti di lab AI Stanford, meyakini bahwa tolok ukur masa depan harus mampu memetakan dampak nyata model di dunia nyata. Ia mengibaratkan model bisnis Vals seperti College Board yang mengelola ujian SAT. Perusahaan membayar biaya untuk mendapatkan evaluasi objektif, yang kemudian menjadi faktor penentu bagi investor atau klien dalam mengadopsi teknologi AI tertentu.
Pertumbuhan Vals tergolong sangat agresif. Dalam kurun waktu satu tahun, pendapatan mereka melonjak delapan kali lipat. Jumlah staf pun berkembang pesat dari delapan orang menjadi 25 personel, dengan rencana penambahan belasan karyawan lagi dalam waktu dekat. Kantor mereka di Folsom Street, San Francisco, yang dulunya merupakan pabrik bir bersejarah, kini menjadi pusat riset bagi masa depan validasi sistem kecerdasan buatan.
Bagi ekosistem teknologi di Indonesia, keberadaan standar benchmarking seperti Vals menjadi pengingat krusial mengenai pentingnya transparansi dalam adopsi AI. Saat ini, banyak perusahaan lokal di tanah air mulai mengintegrasikan AI ke dalam alur kerja mereka, namun seringkali tanpa memiliki instrumen evaluasi yang mumpuni. Ketergantungan pada klaim pemasaran tanpa pengujian independen berisiko menciptakan bias atau kegagalan sistemik saat model diimplementasikan pada skala besar.
Industri di Indonesia, khususnya sektor perbankan dan layanan publik, dapat belajar dari model bisnis yang ditawarkan Vals. Jika Indonesia ingin memiliki kedaulatan digital yang aman, pengembangan tolok ukur lokal yang mampu menguji 'kesehatan' dan etika model AI menjadi kebutuhan mendesak. Mengandalkan standar internasional saja mungkin tidak cukup, mengingat konteks regulasi dan budaya yang berbeda.
Krishnan menekankan bahwa seiring dengan semakin banyaknya perusahaan AI yang melantai di bursa saham, sistem evaluasi yang ketat akan menjadi bagian tak terpisahkan dari pelaporan publik. Kepercayaan publik dan investor akan sangat bergantung pada seberapa transparan dan akurat klaim kemampuan sebuah model AI. Vals memosisikan diri sebagai pihak ketiga yang menjamin validitas tersebut.
Meski saat ini fokus Vals masih terkonsentrasi di pasar Amerika Serikat, terutama dengan program evaluasi untuk lembaga federal, dampaknya diprediksi akan bersifat global. Standar yang mereka bangun berpotensi menjadi acuan internasional bagi perusahaan AI lainnya. Hal ini menciptakan tantangan sekaligus peluang bagi pengembang AI lokal untuk mulai membangun sistem evaluasi mandiri yang memiliki kredibilitas serupa.
Di sisi lain, tantangan besar yang dihadapi adalah bagaimana memastikan pengujian tidak hanya berhenti pada angka performa, tetapi juga mencakup mitigasi risiko. Krishnan menyatakan bahwa Vals secara aktif mencari dampak negatif yang mungkin timbul jika model-model tersebut dibiarkan beroperasi tanpa pengawasan. Ini adalah langkah maju dalam memastikan AI tidak hanya cerdas, tetapi juga aman bagi masyarakat luas.
Ke depan, Vals berencana untuk memperluas cakupan pengujian mereka ke ranah yang lebih luas lagi. Dengan dukungan modal yang kuat dan visi yang jelas, mereka berada di jalur yang tepat untuk menjadi standar industri global. Bagi pemain di industri teknologi Indonesia, mengamati perkembangan standarisasi ini merupakan langkah strategis untuk tetap relevan dalam kompetisi AI yang semakin ketat.
Integrasi AI dalam kehidupan sehari-hari bukan lagi sekadar tren, melainkan realitas ekonomi. Dengan adanya entitas seperti Vals, fase 'pamer' kemampuan AI perlahan akan digantikan oleh fase pembuktian yang terukur. Bagi pengguna akhir, ini adalah kabar baik karena mereka akan mendapatkan produk AI yang benar-benar telah teruji kualitas dan keamanannya melalui metode yang tidak bisa dimanipulasi.