Di banyak perusahaan, masih ada orang yang seharian mengetik ulang data dari PDF dan foto ke sistem lain. Invoice supplier ke sistem akuntansi, struk ke klaim reimbursement, KTP dan formulir pendaftaran pelanggan ke CRM. Pekerjaannya lambat, membosankan, dan salah ketik akhirnya masuk ke laporan dan pembayaran. AI modern bisa mengerjakan sebagian besar pekerjaan ini. Bagian sulitnya adalah membangun proses yang cukup akurat untuk dipercaya mengurus uang dan data pribadi. Berikut pendekatan kami.
Apa yang Sudah Berubah
Sistem OCR lama bisa membaca teks dengan baik, tapi butuh template untuk setiap layout dokumen. Supplier baru dengan desain invoice yang berbeda berarti konfigurasi baru. Large language model yang bisa membaca gambar mampu memahami dokumen yang belum pernah dilihatnya dan menemukan nomor invoice, tanggal, supplier, rincian barang, dan total dari konteks, seperti yang dilakukan manusia. Karena itu otomatisasi jadi masuk akal untuk ratusan variasi layout yang dulu tidak pernah tertangani template.
Cara Kerja Pipeline-nya
- 1Penerimaan: dokumen masuk lewat email, upload, scanner, atau API, lalu setiap dokumen diberi ID dan disimpan apa adanya.
- 2Persiapan: pecah PDF yang berisi banyak halaman, perbaiki rotasi, dan kenali jenis dokumennya, misalnya invoice, struk, atau KTP.
- 3Pembacaan: ambil teks dengan OCR atau kirim gambar halaman ke model yang bisa membaca gambar. Banyak sistem melakukan keduanya dan memberikan teks OCR bersama gambarnya ke model.
- 4Ekstraksi: minta model mengisi field yang dibutuhkan dalam skema JSON yang tetap, memakai fitur structured output di API model supaya jawabannya selalu sesuai skema.
- 5Validasi: periksa hasilnya dengan kode biasa, misalnya apakah jumlah rincian sama dengan total, apakah format NPWP benar, dan apakah supplier-nya ada di data master.
- 6Review: kirim dokumen yang gagal validasi atau tingkat keyakinannya rendah ke petugas, dengan dokumen dan hasil ekstraksi ditampilkan berdampingan.
- 7Ekspor: kirim data yang sudah disetujui ke sistem akuntansi, ERP, atau CRM lewat API, dan simpan tautan ke file aslinya.
Akurasi Datang dari Validasi
Model yang membaca 97 persen field dengan benar tetap salah di tiga field dari setiap seratus, dan model tidak selalu tahu field mana yang salah. Aturan bisnis bisa menangkap sebagian besar kesalahan itu. Total harus sama dengan jumlah rincian ditambah pajak. Tanggal harus berada dalam rentang yang masuk akal. Nomor purchase order harus ada dan milik supplier yang sama. Rekening bank yang berbeda dari data supplier harus selalu masuk review, karena perubahan rekening adalah tanda klasik penipuan invoice.
Jenis Dokumen yang Umum
| Dokumen | Field yang biasa diambil | Perlu diwaspadai |
|---|---|---|
| Invoice supplier | Supplier, nomor invoice, tanggal, rincian barang, pajak, total, rekening bank | Invoice ganda, rekening yang berubah, total yang tidak cocok |
| Struk untuk reimbursement | Nama toko, tanggal, nominal, kategori | Kertas thermal yang pudar, foto yang kusut, nominal tulisan tangan |
| KTP dan dokumen KYC | Nama, NIK, tanggal lahir, alamat | Aturan data pribadi, kualitas foto, dan pengecekan pemalsuan yang butuh tools khusus |
| Formulir pendaftaran dan pengajuan | Data pemohon, pilihan, tanda tangan | Tulisan tangan, checkbox, dan field yang dibiarkan kosong |
| Surat jalan dan purchase order | Nomor referensi, barang, jumlah | Pencocokan dengan invoice dan pesanan di sistem Anda |
Ukur Dulu Sebelum Otomatis Penuh
- Kumpulkan beberapa ratus dokumen asli yang mewakili supplier dan format Anda, termasuk hasil scan yang jelek.
- Minta petugas mengisi nilai yang benar satu kali untuk dijadikan test set.
- Ukur akurasi per field, karena total yang salah jauh lebih berbahaya daripada baris alamat yang salah.
- Ukur straight-through rate, yaitu persentase dokumen yang lolos validasi tanpa disentuh manusia.
- Jalankan ulang test set setiap kali prompt, model, atau aturan validasi diubah.
Mulailah dengan semua dokumen tetap di-review petugas, sementara AI mengisi field-nya lebih dulu. Ketika akurasi yang terukur untuk satu jenis dokumen terus tinggi, biarkan dokumen yang lolos semua pengecekan langsung diproses, dan tetap ambil sampel sebagian untuk diperiksa.
Data Pribadi dan Keamanan
KTP, slip gaji, dan formulir pendaftaran berisi data pribadi. Di Indonesia, Undang-Undang Pelindungan Data Pribadi (UU PDP) mengatur kewajiban dalam mengumpulkan, memproses, menyimpan, dan membagikan data itu. Periksa di mana penyedia API model memproses dan menyimpan data, apakah data dipakai untuk training, dan berapa lama disimpan. Untuk dokumen yang sensitif, model yang berjalan di server sendiri atau di akun cloud milik perusahaan bisa menjaga data tetap dalam kendali Anda. Enkripsi file yang disimpan, batasi siapa yang bisa membukanya, dan hapus sesuai jadwal kebijakan retensi.
Model yang membaca dokumen. Aturan validasi dan proses review yang menentukan apakah hasilnya bisa dipercaya.
Kami membangun sistem ekstraksi dokumen yang terhubung ke sistem akuntansi, ERP, dan CRM yang sudah ada, diawali pilot dengan dokumen asli Anda supaya akurasi dan penghematannya terukur sebelum dipakai penuh.
Poin penting
- Language model yang bisa membaca gambar mampu memahami layout dokumen baru tanpa template, sehingga otomatisasi input data jadi praktis.
- Pakai structured output dengan skema yang tetap, lalu validasi dengan aturan bisnis di kode biasa.
- Kirim dokumen yang gagal pengecekan atau rekeningnya berubah ke review manusia.
- Ukur akurasi per field dan straight-through rate dengan test set dari dokumen Anda sendiri.
- Perlakukan KTP dan formulir sebagai data pribadi, dan pilih tempat menjalankan model yang memenuhi kewajiban pelindungan data.


