EVALUASI KUANTITATIF RELIABILITAS DAN KECEPATAN INFERENSI PADA TIGA ARSITEKTUR LARGE LANGUAGE MODEL (ChatGPT, DeepSeek, Gemini) MENGGUNAKAN METRIK NLP BERBASIS PYTHON

  • Abubakar Basri universitas Djuanda

Abstrak

Adopsi Large Language Model (LLM) yang masif dalam berbagai sektor menuntut evaluasi
mendalam terhadap kapabilitas intrinsik sistem, terutama dalam merespons instruksi yang ambigu.
Penelitian ini menyajikan analisis komparatif terstruktur terhadap tiga arsitektur LLM terkemuka,
yaitu ChatGPT, DeepSeek, dan Gemini, dengan fokus mengukur reliabilitas faktual dan efisiensi
komputasional (latensi inferensi) sebagai dampak langsung dari manipulasi ambiguitas prompt.
Metodologi penelitian mengadopsi pendekatan Black Box Testing yang dikombinasikan dengan
analisis kuantitatif, dilakukan secara sistematis terhadap 100 prompt yang telah diklasifikasikan ke
dalam delapan kategori kompleksitas. Reliabilitas faktual diukur menggunakan metrik Cosine
Similarity berbasis TF-IDF terhadap ground truth, sementara latensi direkam melalui pengukuran
end-to-end berbasis stopwatch dan diproses menggunakan skrip Python pada lingkungan Google
Colab. Hasil penelitian menunjukkan bahwa Gemini mencatatkan rata-rata akurasi tertinggi
(66,91%), diikuti DeepSeek (64,89%) dan ChatGPT (62,10%), sementara DeepSeek unggul dalam
kecepatan inferensi rata-rata (2,84 detik) berkat arsitektur Mixture of Experts. Uji korelasi Pearson
pada ketiga model menghasilkan koefisien negatif (ChatGPT -0,200; Gemini -0,194; DeepSeek -
0,030), yang membuktikan bahwa hipotesis speed–accuracy trade-off tradisional tidak terbukti pada
ketiga arsitektur tersebut. Temuan ini diharapkan menjadi kompas empiris bagi pengguna dalam
memilih model secara presisi serta literatur evaluatif bagi pengembang untuk merancang sistem AI
yang lebih tangguh dan efisien.

Diterbitkan
2026-09-12