AgentBench

Bebas

Benchmark terbuka untuk mengevaluasi model bahasa sebagai agen otonom dalam berbagai lingkungan.

Tinjau

Agen Bench adalah alat terbuka untuk menguji model bahasa yang besar (LLM) dalam peran agen otonom. Pengembang dari Universitas Tsinghua menciptakannya untuk menilai bagaimana model efektif menangani tugas praktis yang mendekati skenario dunia.

Sejarah dan Asal

Proyek ini diluncurkan oleh sebuah kelompok penelitian di Universitas Tsinghua. Tujuan utama pencipta mengatur untuk diri mereka sendiri adalah untuk pergi melebihi standar tes pembuatan teks dan evaluasi perilaku model dalam lingkungan interaktif. Hal ini penting karena model bahasa modern semakin digunakan tidak hanya sebagai generator jawaban sederhana, tetapi sebagai alat full-fledged untuk melakukan tindakan multi- langkah.

Metode Inti

Agen Bench meminta model untuk menyelesaikan tugas di delapan lingkungan yang berbeda. Ini termasuk manajemen sistem operasi, bekerja dengan basis data, berinteraksi dengan grafik pengetahuan, berpartisipasi dalam permainan kartu digital, dan memecahkan teka-teki yang memerlukan pemikiran yang tidak konvensional. Selain itu, tiga lingkungan beradaptasi dari data yang ada: pekerjaan rumah tangga, belanja web, dan browsing web. Pendekatan ini memungkinkan penilaian komprehensif dari kemampuan model untuk merencanakan, membuat keputusan, dan menggunakan alat.

Pada Oktober 2024, versi terbaru dirilis - AgentBench FC. Ini menampilkan dukungan untuk format pemanggilan fungsi dan penyebaran sepenuhnya dimuat melalui Docker Compose. Hal ini secara signifikan menyederhanakan proses meluncurkan semua lingkungan tes - sekarang hanya satu perintah yang diperlukan untuk memulai.

Features AgentBench

FiturNilai
Jenis AlatBenchmark (test suite dari lingkungan)
PengembangUniversitas Tsinghua
Jumlah Lingkungan8 (5 baru + 3 diadaptasi)
Tipe LingkunganOS, database, grafik pengetahuan, permainan kartu, teka-teki, pekerjaan rumah tangga, web shopping, web browsing
Versi KiniAgen Bench FC (Oktober 2024)
Dukungan Panggilan FungsiYa
PenyebaranDocker Compose (merombak)
Versi MultimodalVisualAgent Bench
DatasetDev dan Uji untuk setiap tugas
PemimpinBuka, publik
Ketersediaan Kode SumberGitHub, buka lisensi
Model DistribusiBebas

Siapa Agen Bench?

AgentBench adalah alat profesional yang akan berguna untuk kategori tertentu pengguna.

Peneliti dan Pengembang Agen AI

Pertama dan terutama, benchmark ditujukan pada spesialis bekerja pada membangun agen AI otonom. Mereka dapat menggunakan Agen Bench untuk menguji model mereka dalam kondisi standardisasi dan hasil perbandingan dengan perkembangan lainnya. Kode open-source di bawah lisensi permissive memungkinkan lingkungan tes untuk disesuaikan untuk tugas-tugas penelitian tertentu.

Spesialis Perakit Kualitas LLM

Bagi mereka yang secara profesional mengevaluasi kualitas model bahasa, Agen Bench menyediakan set skenario yang sudah dibuat. Ketersediaan dua tanggal - Dev dan Test - memungkinkan untuk model tuning terpisah dan validasi akhir. Hal ini terutama penting untuk bangunan adil dan reproduksi pengujian.

Perusahaan Integrating LLM ke Workflow

Organisasi mempertimbangkan model bahasa sebagai dasar untuk otomatisasi proses (bekerja dengan basis data, browser, atau sistem operasi) dapat menggunakan benchmark untuk evaluasi kandidat objektif. Ini membantu memilih model yang paling cocok untuk tugas bisnis tertentu sebelum mengintegrasikannya ke dalam produksi.

Bagaimana menggunakan AgentBench?

Proses bekerja dengan AgentBench tergantung pada versi alat yang akan Anda gunakan.

Versi Klasik

Untuk bekerja dengan versi asli AgentBench, Anda perlu secara manual mengatur masing-masing delapan lingkungan. Pengguna memilih tugas tertentu, memuat data yang sesuai, dan menjalankan evaluasi model. Hasil kemudian dapat dibandingkan dengan data pada leaderboard publik. Proses ini membutuhkan keterampilan teknis tertentu, karena setiap lingkungan memiliki konfigurasi sendiri spesifik.

AgentBench FC and Docker Compose

Versi AgentBench FC terbaru secara signifikan menyederhanakan penyebaran. Terima kasih kepada penyelidikan melalui Docker Compose, semua lingkungan tes dapat diluncurkan dengan satu perintah. Ini menghemat waktu dan menghilangkan sebagian besar kesalahan yang berhubungan dengan pengaturan lingkungan manual. Pengguna hanya perlu menginstal Docker, clone repositori, dan menjalankan perintah peluncuran standar. Setelah itu, model akan otomatis diuji di semua lingkungan.

Selain itu, versi diperpanjang - VisualAgentBench - tersedia untuk model multimodal. Ini dirancang untuk menguji lingkungan visual: dari robot kontrol untuk bekerja dengan antarmuka grafis dan desain web.

Fitur Kunci Bench Agen

Assembly Autonomy Model

Fungsi kunci dari AgentBench adalah mengukur kemampuan model untuk bertindak tanpa campur tangan manusia. Pemeriksaan stanchmark apakah model dapat secara independen menganalisis lingkungannya, membuat keputusan, dan melakukan operasi multi- langkah sampai mencapai tujuan akhir.

Pengujian Lingkungan Multi-

Delapan lingkungan yang berbeda memungkinkan model untuk dievaluasi dari berbagai sudut. Bekerja dengan sistem operasi menguji kemampuan teknis, tes teka-teki kreativitas dan logika, dan tes belanja web perencanaan kemampuan dan interaksi dengan antarmuka. Pendekatan ini memberikan gambaran komprehensif dari kemampuan model.

Dukungan Panggilan Fungsi

Versi AgentBench FC mendukung format pemanggilan fungsi. Ini berarti model dapat menyebut fungsi eksternal dengan cara terstruktur, membawa pengujian lebih dekat ke real-world skenario menggunakan LLM sebagai alat otomatisasi.

Pengujian Multimodal

Untuk model yang proses tidak hanya teks tetapi juga gambar, versi VisualAgentBench dirancang. Ini termasuk lingkungan dengan persepsi visual - dari GUI untuk robotika - memungkinkan penilaian tentang seberapa baik model multimodal mengerti dan bertindak dalam konteks visual.

Keberhasilan Agen Bench

Buka dan Aksesibilitas

Segala sesuatu yang berhubungan dengan AgentBench - kode, dataset, hasil - tersedia secara publik. Transparansi penuh memungkinkan peneliti lain untuk mereproduksi hasil dan kepercayaan yang diterbitkan data. Model distribusi gratis membuat alat dapat diakses kepada siapa saja dengan kemampuan teknis untuk menjalankannya.

Skenario Realistik

Tidak seperti banyak tes abstrak, Agen Bench termasuk lingkungan yang dekat dengan tugas-tugas dunia nyata: manajemen sistem, belanja, browsing. Ini menyediakan gambaran yang lebih objektif tentang bagaimana model akan berperilaku dalam penyebaran sebenarnya, daripada dalam kondisi laboratorium yang ideal.

Fleksibilitas dan Kemudahan Pemindahan

Rilis AgentBench FC dengan Docker Compose recurerization memecahkan salah satu masalah utama dari benchmarks - setup kompleksitas. Sekarang, sedikit pengetahuan teknis cukup untuk menjalankan pengujian. Ditambah, kemampuan untuk menguji baik berdasarkan teks maupun model multimodal (melalui VisualAgagenBench) membuat alat serbaguna.

Kesedihan dari Agen Bench

Barrier Entry Tinggi untuk pemula

Meskipun penyederhanaan dalam versi FC, menggunakan AgentBench membutuhkan pemahaman teknologi seperti Docker, baris komando, dan prinsip dasar untuk bekerja dengan model bahasa. Bagi orang-orang tanpa latar belakang teknis, alat akan sulit untuk menguasai.

Informasi Terbatas di Sumber Terbuka

Saat ini, ada dokumentasi yang relatif detail dan instruksi yang menggambarkan setiap langkah dari setup dan pengujian. Pengguna sering harus mencari tahu kode sendiri atau mengandalkan prinsip umum bekerja dengan alat yang sama.

Scope Aplikasi Khusus

Karena Agen Bench adalah alat evaluasi, nilainya hanya disadari ketika Anda memiliki model untuk menguji. Untuk pengguna akhir yang hanya menggunakan siap-dibuat LLM melalui API, benchmark tidak menawarkan manfaat praktis.

Masalah apa yang dilakukan Agen Bench?

Pemilihan Model Optimal

Salah satu tugas utama Alamat AgentBench adalah membantu memilih model yang paling cocok untuk kasus penggunaan tertentu. Dengan membandingkan hasil model pada papan peringkat, pengembang dapat memutuskan model mana yang akan tampil lebih baik, misalnya, dengan basis data atau antarmuka web.

Pelacakan Kemajuan Pengembangan

Untuk kelompok penelitian, benchmark berfungsi sebagai sistem koordinat: memungkinkan melacak bagaimana sebuah model meningkatkan setiap iterasi baru dan mengidentifikasi daerah yang masih memiliki kelemahan yang memerlukan perbaikan.

Uji Standardizing

Agen Bench memecahkan masalah "semua orang tes dengan cara mereka sendiri". Satu set lingkungan dan data yang bersatu memungkinkan membandingkan hasil dari tim dan model yang berbeda secara umum. Ketersediaan dari set Dev dan Tes terpisah membantu menghindari "overfitting" model untuk menguji data.

Harga Agen Bench

AgentBench didistribusikan dengan model gratis, yang berarti sepenuhnya gratis. Ini berlaku baik untuk mengakses kode di GitHub dan ke dewan publik dengan hasil. Pengguna tidak perlu membayar untuk menggunakan benchmark.

Namun, potensi biaya tidak langsung harus dipertimbangkan. Menjalankan semua lingkungan dalam format kontainer (Docker Compose) memerlukan server atau perangkat keras lokal dengan sumber daya yang cukup - CPU, memori, dan ruang disk. Selain itu, jika Anda berencana untuk menguji dibayar model komersial, biaya permintaan API mereka tidak ditutupi oleh AgentBench. Tapi alat evaluasi itu sendiri tetap benar-benar bebas.

Akhir dari Penggunaan Untuk Agen Bench

Lisensi Kode

Kode sumber Agen Bench diterbitkan di GitHub dengan lisensi terbuka. Ini berarti pengembang dapat menggunakan secara bebas, mengubah, dan menyesuaikan kode untuk tujuan mereka. Penting untuk mematuhi ketentuan-ketentuan dari lisensi tertentu yang dinyatakan dalam repositori.

Penggunaan Hasil

Hasil evaluasi model diterbitkan pada leaderboard publik. Setiap pengguna dapat meninjau data dan menggunakannya untuk tujuan mereka - dalam penelitian, artikel, atau pemilihan model. Biasanya tidak ada persyaratan wajib, tetapi dianggap praktek yang baik untuk mengutip sumber ketika menggunakan data leaderboard dalam publikasi.

Batas Praktis

Karena Agen Bench adalah alat pengujian, penggunaannya mengasumsikan Anda sudah memiliki model bahasa sendiri atau akses ke model komersial APIs. Benchmark sendiri tidak memberikan akses ke model - hanya mengevaluasi mereka. Selain itu, pengujian berjalan memerlukan lingkungan teknis dengan Docker terpasang dan sumber daya komputasi yang cukup.

AgentBench Affibility

Buka Akses ke Kode

Penyimpanan kode AgentBench tersedia di GitHub. Siapapun dapat mengkloning proyek, mempelajari kode, dan menggunakannya dalam perkembangan mereka sendiri. Alat ini dapat diakses oleh para peneliti di seluruh dunia tanpa memandang lokasi geografis atau kemampuan keuangan mereka.

Pemimpin Publik

Hasil evaluasi model diterbitkan pada leaderboard publik. Pengguna dapat melacak secara real time yang model menunjukkan hasil terbaik dalam berbagai lingkungan. Papan peringkat tersedia untuk dilihat oleh siapa pun tanpa pendaftaran atau pembayaran.

Pemutakhiran dan Pengembangan

Proyek ini secara aktif berkembang: pada bulan Oktober 2024, Versi AgentBench FC dirilis, bersama dengan versi VisualAgagenBench untuk model multimodal. Hal ini menunjukkan bahwa alat tersebut dijaga oleh pengembang dan beradaptasi dengan perubahan kebutuhan masyarakat.

Bagaimana AgentBench Differs dari Alternatif

Lingkungan Komprehensif

Banyak benchmark yang ada untuk mengevaluasi model bahasa fokus pada satu jenis tugas - misalnya, hanya generasi teks atau menjawab pertanyaan. Agen Bench mencakup delapan lingkungan yang beragam, termasuk bekerja dengan sistem operasi, database, dan peramban web. Ini cakupan luas menyediakan gambar yang lebih lengkap dari kemampuan model dibandingkan dengan tes khusus sempit.

Fokus pada Autonomy

Dalam benchmark paling klasik, model menjawab pertanyaan atau melakukan tindakan tunggal-langkah. Agen Bench, bagaimanapun, mengevaluasi model secara khusus sebagai agen otonom: kemampuan untuk merencanakan, membuat keputusan menengah, dan menyesuaikan tindakan berdasarkan umpan balik dari lingkungan. Ini adalah tingkat yang sangat berbeda dari kompleksitas.

Keterbukaan dan Infrastruktur

Sementara benchmarks terbuka lainnya ada, Agen Bench menonjol dengan baik-pikir-keluar infrastruktur. Versi FC dengan Docker Compose advenerisasi dan dukungan pemanggilan fungsi adalah langkah maju dibandingkan dengan banyak alternatif yang memerlukan pengaturan manual kompleks. Versi VisualAgent Bench yang terpisah untuk model multimodal juga membedakan alat ini dari pesaing.

Kesimpulan

Agency Bench adalah seorang yang profesional terbuka sumber benchmark untuk mengevaluasi model bahasa besar dalam peran agen otonom. Terima kasih kepada delapan lingkungan yang beragam, dukungan pemanggilan fungsi dalam versi FC, dan penyebaran terpadu melalui Docker Compose, alat menyediakan peneliti dan pengembang dengan platform pengujian yang nyaman dan standar. Para pemimpin publik, akses bebas ke kode, dan ketersediaan versi terpisah untuk model multimodal membuat AgentBench alat yang signifikan dalam ekosistem pengembangan agen AI modern. Meskipun beberapa kesulitan dalam menguasai untuk pemula, benchmark adalah cara yang dapat diandalkan untuk menilai model praktis kesesuaian untuk memecahkan tugas-tugas realitas dunia.

Menguji model bahasa pada tugas otonom
Perbaikan kinerja LLM dalam skenario dunia nyata
Evaluasi model multimodal bagi lingkungan visual

Pertanyaan yang sering ditanyakan

Lihat juga

AgentBench - benchmark ulasan untuk mengevaluasi agen LLM