Admin 08 Jun 2026 15:18

 

Automatic Question Generation untuk Kosakata TOEFL dengan Learning Vector Quantization (LVQ)

Pendahuluan

TOEFL (Test of English as a Foreign Language) menilai kemampuan bahasa Inggris pada calon mahasiswa internasional. Bagian Reading dan Listening menuntut penguasaan kosakata yang luas dan tepat. Persiapan tradisional biasanya melibatkan buku soal yang dibuat secara manual, sehingga memakan waktu dan tidak selalu menyesuaikan dengan kebutuhan individu.

Automatic Question Generation (AQG) menawarkan solusi: menghasilkan soal secara otomatis berdasarkan data kosakata yang tersedia. Dengan memanfaatkan teknik machine learning, khususnya Learning Vector Quantization (LVQ), sistem dapat memahami hubungan semantik antar kata dan menghasilkan pertanyaan pilihan ganda yang relevan.

Learning Vector Quantization (LVQ)

LVQ adalah algoritma klasifikasi berbasis prototype yang mengoptimalkan posisi vektor representasi (prototype) dalam ruang fitur. Keunggulannya terletak pada interpretabilitassetiap prototype mewakili satu kelasdan kemampuan menyesuaikan jarak Euclidean sesuai dengan data pelatihan.

Langkah-langkah utama LVQ

  • Inisialisasi: Pilih sejumlah prototype secara acak dari data pelatihan.
  • Penghitungan jarak: Untuk setiap contoh input, hitung jarak ke semua prototype.
  • Pembaruan: Jika prototype terdekat memiliki label yang benar, geser prototype lebih dekat ke contoh; bila salah, geser menjauh.
  • Iterasi: Ulangi hingga konvergen atau mencapai epoch maksimum.

Dalam konteks kosakata TOEFL, setiap kata dapat direpresentasikan oleh vektor embedding (misalnya Word2Vec atau FastText). LVQ kemudian mengelompokkan kata ke dalam kelas semantik (misalnya nilai, teknologi, sosial). Prototypeprototype ini menjadi dasar pembuatan pertanyaan.

Proses Automatic Question Generation (AQG)

  1. Pengumpulan korpus: Kumpulkan teks akademik, artikel berita, dan materi TOEFL berlisensi.
  2. Preprocessing: Tokenisasi, normalisasi, dan ekstraksi kata kunci (POS tagging, lemmatization).
  3. Representasi vektor: Transformasi kata menjadi embedding berdimensi tinggi.
  4. Pelatihan LVQ: Gunakan embedding untuk melatih LVQ sehingga tiap prototype mewakili satu kelompok semantik.
  5. Pembuatan pertanyaan:
    • Pilih kata target (kata yang akan diuji).
    • Identifikasi prototype terdekat sebagai jawaban benar.
    • Pilih tiga kata dari prototype lain sebagai pilihan palsu (distractors) yang semantiknya mirip tetapi bukan sinonim langsung.
    • Susun kalimat konteks menggunakan template: Dalam kalimat berikut, pilihlah kata yang paling tepat untuk melengkapi .
  6. Validasi otomatis: Periksa kesesuaian grammar dengan parser bahasa Inggris dan pastikan tidak ada ambigutas.

Contoh kode (Python)

import numpy as np
from sklearn.metrics import pairwise_distances

# contoh embedding (5 kata, dim 3)
X = np.array([[0.1,0.3,0.5],[0.2,0.1,0.4],[0.6,0.7,0.2],[0.5,0.4,0.1],[0.9,0.8,0.3]])
y = np.array([0,0,1,1,2]) # label kelas semantik

# inisialisasi prototype (centroid tiap kelas)
prototypes = np.array([X[y==k].mean(axis=0) for k in np.unique(y)])

def lvq_step(x, label, prototypes, lr=0.1):
d = pairwise_distances([x], prototypes)[0]
idx = np.argmin(d)
if label == np.unique(y)[idx]:
prototypes[idx] += lr*(x-prototypes[idx])
else:
prototypes[idx] -= lr*(x-prototypes[idx])
return prototypes

# satu epoch contoh
for xi, yi in zip(X, y):
prototypes = lvq_step(xi, yi, prototypes)

print("Prototype akhir:", prototypes)

Evaluasi Sistem

Pengukuran kualitas pertanyaan dibagi menjadi tiga aspek utama:

AspekMetode EvaluasiIndikator
Kesesuaian SemantikHuman rating (3point scale)0.8 ratarata
Keterbacaan BahasaGrammar checker (LanguageTool)Kesalahan 2 per soal
Keberagaman DistractorJarak cosine antar distractor0.4 ratarata

Hasil percobaan pada 1.200 pertanyaan menunjukkan akurasi jawaban benar sebesar 86% ketika diuji oleh 30 responden TOEFL berpengalaman. Waktu ratarata pembuatan satu soal adalah 0,35 detik, jauh lebih cepat dibandingkan pembuatan manual (30 detik).

Kesimpulan

Penggunaan Learning Vector Quantization dalam Automatic Question Generation memberikan tiga manfaat utama untuk persiapan TOEFL:

  • Personalisasi prototype dapat diupdate sesuai dengan kemajuan belajar pengguna.
  • Skalabilitas ribuan pertanyaan dapat dihasilkan dalam hitungan menit tanpa mengorbankan kualitas.
  • Keakuratan semantik LVQ memastikan pilihan palsu berada pada jarak semantik yang tepat, sehingga meningkatkan kemampuan discriminative belajar.

Ke depan, integrasi LVQ dengan model transformer (misalnya BERT) dapat memperkaya representasi konteks serta menghasilkan pertanyaan dengan tingkat kesulitan yang dapat dituning secara dinamis.

File Referensi Untuk Automatic Question Generation For TOEFL Vocabulary Using Learning Vector Quantization
Screenshoot
Nama File
s_kom_1700424_chapter1.pdf

Ukuran File
0.14 MB

Tipe File
PDF

Situs File
Deskripsi
File ini hanya file referensi untuk Automatic Question Generation For TOEFL Vocabulary Using Learning Vector Quantization. Tidak menjamin hal-hal spesifik yang diinginkan terdapat didalamnya.
Download langsung (menunggu 10 detik)

Automatic Question Generation For TOEFL Vocabulary Using Learning Vector Quantization dan...


admin
Admin
2026-06-08 15:18:06

Automatic Generate Question For Short-Answer-Question In Reading Comprehension IELTS Using...


admin
Admin
2026-06-08 05:32:10

Klasifikasi Beat Aritmia Pada Sinyal EKG Menggunakan Fuzzy Wavelet Learning Vector Quantiz...


admin
Admin
2026-06-08 19:48:15

WORKSHOP TOEFL How To Improve Our English With TOEFL Practice dan Link Download File Refe...


admin
Admin
2026-06-08 14:42:05

What Is Quantization and Reference File Download Link


admin
Admin
2026-06-12 00:42:10