Teks yang ditulis oleh model bahasa menjadi semakin sulit membedakan dari yang ditulis manusia. Untuk menjaga transparansi, pengembang menerapkan penanda tersembunyi. Salah satu projek tersebut berada di Anthropic: versi masa depan dari Claude akan menerima built-in watermark yang akan memungkinkan untuk memverifikasi asal teks.
Mengapa penanda tak terlihat dibutuhkan
Tanda air dari Claude dirancang untuk menyediakan estimasi statistik - bagaimana mungkin bahwa teks yang diberikan diciptakan oleh model tertentu. Impetus adalah peraturan: sejak 2 Agustus, telah ada persyaratan bagi penyedia AI untuk melabeli konten sintetis. A built- di penanda adalah salah satu cara untuk memenuhi kewajiban ini.
Sangat penting, tanda ini tidak terlihat oleh pembaca. Menurut perusahaan, itu tidak mempengaruhi kualitas respon, kreativitas mereka, atau ketersediaan. Teks tidak menerima tambahan yang terlihat, karakter tersembunyi, atau token ekstra - dan karena itu tidak memerlukan biaya komputasi tambahan. Penanda juga tidak berisi data pribadi: tidak dapat digunakan untuk mengasosiasikan teks dengan pengguna, organisasi, atau percakapan individu.

Teknologi: bagaimana cara kerjanya
Prinsip didasarkan pada bagaimana model bahasa beroperasi. Model menghasilkan teks satu kata pada satu waktu, memilih pilihan yang paling mungkin. Dalam beberapa kasus, pilihan hampir tidak memiliki dampak pada makna - misalnya, ketika sinonim atau variasi stylistik minor dapat diterima. Titik "low- taruhannya" adalah apa yang membawa watermark tersebut.
Dalam mode normal, model bergantung pada sumber acak sendiri. Tanda air menggantikannya: pilihan kata berikutnya ditentukan oleh kunci dan beberapa kata sebelumnya. Ini menciptakan pola dalam respon yang tidak terlihat bagi manusia tetapi dapat diverifikasi ketika kunci tersedia - dengan mengukur seberapa konsisten urutan dengan kunci, seseorang dapat memperkirakan kemungkinan bahwa teks dihasilkan oleh model.
Sangat penting, tanda tidak memaksa model untuk memilih kata yang tidak wajar atau sinonim langka seperti "nubilous". Kosakata tetap dalam kisaran biasa; hanya logika pilihan di tempat-tempat sempit yang berubah.

Metode yang digunakan oleh Claude adalah adaptasi dari Google DeepMind 's SynthID-Teks pendekatan, diterbitkan di Alam pada tahun 2024. Ide itu sendiri kembali ke 2022 proposal oleh Scott Aaronson: perubahan hanya sumber acak, tanpa mengganggu sisa perilaku model.
Verifikasi dan batasan
Tanda air bukanlah bukti mutlak dari otoritas. Hal ini hanya dapat memberikan perkiraan probabilitas - bagaimana konsisten teks adalah dengan kunci yang dikenal. Tidak mungkin untuk memastikan secara pasti bahwa teks dihasilkan oleh satu model atau yang lain, dan ini penting untuk diingat dalam praktek.
Apa yang Anda perlu tahu
- Penanda tidak menawarkan jaminan 100%, hanya kepercayaan statistik.
- Ini tidak berisi informasi yang dapat digunakan untuk melacak seseorang atau organisasi.
- Mekanisme adalah tidak unik untuk Claude - Pengembang utama lainnya yang menerapkan watermark mereka sendiri.
Tes internal Anthropic tidak menemukan degradasi dalam kualitas respon substantif. Penelitian Google DeepMinny juga tidak menunjukkan perbedaan statistik yang signifikan dalam rating pengguna: orang tidak melihat perbedaan antara teks dengan dan tanpa penanda. Jadi penanda air tetap menjadi kompromi antara transparansi dan naturalness - mereka memungkinkan verifikasi otomatis dari asal konten tanpa menghalangi operasi model atau mengekspos data pengguna.



