Lenta

60 bahan

Urutkan menurut
Berita11 September 2026

SQL Agen tanpa Ilusi: Skala Otonomi Terpadu dan Perbandingan Tolok Ukur LLM yang Jujur

Para peneliti mengusulkan untuk memandang bidang Text-to-SQL sebagai papan peringkat agregat, di mana hasilnya didistribusikan berdasarkan tingkat otonomi model dalam menghasilkan kueri SQL. Mereka melakukan pengukuran pada Spider dan menunjukkan bahwa keberhasilan tidak selalu terbawa ke tolok ukur lain, dan otonomi memberikan ketahanan, tetapi membutuhkan sumber daya komputasi yang signifikan.

SQL Agen tanpa Ilusi: Skala Otonomi Terpadu dan Perbandingan Tolok Ukur LLM yang Jujur
Baca
Berita8 September 2026

OpenAI memperketat pendekatan terhadap privasi: sistem perlindungan data baru sebagai respons terhadap penyimpanan sesi 30 hari oleh Anthropic

OpenAI memperkenalkan pemantauan penyalahgunaan otomatis yang tidak menyimpan data klien — ini merupakan respons langsung terhadap kebijakan Anthropic baru-baru ini yang menyimpan percakapan selama 30 hari. Dengan cara ini, perusahaan-perusahaan memperkuat persaingan untuk meraih kepercayaan pengguna korporat di tengah persaingan yang semakin ketat.

OpenAI memperketat pendekatan terhadap privasi: sistem perlindungan data baru sebagai respons terhadap penyimpanan sesi 30 hari oleh Anthropic
Baca
Berita8 September 2026

Model AI Cuaca Diuji sebagai Model Iklim: Apa yang Ditunjukkan oleh Simulasi Multi-Tahun ArchesWeather dan ArchesWeatherGen

Para peneliti mengadaptasi dua jaringan saraf untuk eksperimen atmosfer jangka panjang dengan menambahkan kondisi batas eksternal, lalu menjalankannya sesuai protokol AIMIP. Ternyata, model yang awalnya dirancang untuk prakiraan hingga sepuluh hari mampu menghasilkan siklus tahunan yang stabil dan mereproduksi klimatologi serta variabilitas secara masuk akal dalam simulasi multi-dekade.

Model AI Cuaca Diuji sebagai Model Iklim: Apa yang Ditunjukkan oleh Simulasi Multi-Tahun ArchesWeather dan ArchesWeatherGen
Baca
Berita3 September 2026

Jailbreak kotak hitam: mengapa membandingkan serangan dengan jumlah panggilan model yang sama

Para peneliti mengusulkan protokol Fair-ASR yang mengevaluasi serangan terhadap LLM dengan anggaran permintaan yang sama ke model target, sementara biaya penyerang dihitung secara terpisah. Peninjauan ulang terhadap 11 metode yang dikenal menunjukkan bahwa peringkatnya sangat bergantung pada anggaran, dan pola sederhana tidak kalah dengan pendekatan LLM yang kompleks — hal ini mendorong para penulis untuk menciptakan serangan baru bernama ReCode.

Jailbreak kotak hitam: mengapa membandingkan serangan dengan jumlah panggilan model yang sama
Baca