Orkas Orkas
Beranda Blog Arsitektur
Arsitektur

Dideklarasikan Selesai Tidak Terverifikasi Selesai: Desain Tonggak untuk Agen Horizon Panjang

Orkas mencatat tonggak rencana yang tahan lama, dan secara terpisah mencatat fakta sisi host tentang apa yang sebenarnya diubah oleh setiap panggilan alat. Tidak ada yang menghubungkan keduanya, jadi satu langkah dihitung sebagai selesai saat model mengatakan demikian. Inilah bagaimana BEACON memposisikan detektor tonggaknya, tiga lapisan yang akan kami bangun, dan satu kriteria yang tidak dimiliki makalah tersebut.

Ini adalah catatan kedua dalam seri tentang desain agen cakrawala panjang, didorong oleh pembacaan yang cermat dari SUAR (Universitas Zhejiang, arXiv:2605.06078).

Yang Catatan pertama Berpendapat bahwa deteksi loop tidak dapat menangkap agen yang terhenti, karena pengulangan adalah sinyal sisi input sementara kemajuan adalah sinyal sisi output. Argumen itu hanya berfungsi jika ada sesuatu untuk mengukur kemajuan. Catatan ini adalah tentang sesuatu itu.

Versi pendek Selesai adalah apa yang dikatakan cek, bukan apa yang dikatakan agen Orkas memverifikasi tonggak sejarah sebelum menyebutnya selesai, dan menyebutkan apa yang tetap tidak terselesaikan alih-alih diam-diam melanjutkan.
Unduh Orkas — gratis

Ajukan pertanyaan dengan cara yang benar

Pertanyaannya bukan "bagaimana agen tahu bahwa ia telah menyelesaikan satu langkah." Itu adalah "bagaimana Sistem Tahu itu benar-benar selesai, daripada mengumumkan bahwa itu sudah selesai."

Satu lapisan perbedaan, dan kredibilitasnya tidak sebanding.

Kami sudah memiliki dua bagian dan tidak pernah menghubungkannya

Membaca implementasi kami sendiri, ini adalah bagian yang mengejutkan.

Paruh pertama. Tonggak sejarah sudah ada dalam produk. Sebuah alat mempertahankan rencana tugas yang tahan lama: bagaimana tugas yang panjang terurai, dan keadaan apa setiap langkahnya — tertunda, sedang berlangsung, selesai, diblokir. Tujuan yang dinyatakannya adalah untuk memberikan tugas yang panjang jangkar kemajuan yang stabil. Tetapi bagaimana sebuah langkah menjadi "selesai"? Model menyatakannya.

Paruh kedua. Setelah setiap panggilan alat, host mencatat serangkaian fakta deterministik: apakah hash konten file benar-benar berubah, apa kode keluar perintah itu, apakah waktunya habis. Ini adalah sisi host yang direkam dan tidak pernah memasuki konteks model, itulah mengapa mereka tidak dapat dibuat.

Di situlah letak celahnya. Satu baris mengatakan Aku sudah selesai. Yang lain berkata Hash file berubah dari A ke B. Tidak ada yang pernah menempatkan mereka berdampingan.

Yang hilang bukanlah struktur data, dan bukan pengamatan. Ini adalah jembatan di antara keduanya.

Hal yang paling berguna dalam makalah ini bukanlah rumusnya

BEACON terkenal karena keunggulan skala gandanya, tetapi bagian yang layak dicuri adalah bagaimana ia memposisikan detektor Φ.

Φ tidak membutuhkan model terlatih dan tidak ada anotasi manusia. Itu hanya membaca perubahan keadaan yang dapat diamati dalam umpan balik lingkungan: transisi keadaan objek di ALFWorld (berhasil diambil, pemanasan selesai), transisi halaman di WebShop, dan di ScienceWorld itu hanya mengkonsumsi sinyal subgoal yang sudah dipancarkan lingkungan.

Nol model tambahan, nol biaya pengambilan sampel tambahan. Bandingkan alternatifnya: model hadiah proses membutuhkan anotasi yang mahal dan dapat dipermainkan, dan estimasi nilai Monte-Carlo membutuhkan peluncuran ekstra di setiap titik keputusan. Biaya itulah yang dihindari oleh Φ.

Siapa pun yang membangun produk agen memiliki keuntungan yang tidak dimiliki oleh pengaturan kertas: panggilan alat disusun untuk memulai, dengan keberhasilan dan kegagalan yang eksplisit. Surat kabar itu harus menambang sinyal dari lingkungan. Milik kita sudah ada di sana.

Tiga lapisan, jika kamu akan membangunnya

Lapisan satu: kumpulkan bukti deterministik ke dalam satu aliran. Tidak ada penilaian semantik sama sekali, hanya catatan mekanis dari perubahan yang dapat diverifikasi yang tidak dapat diubah. Hash konten file berubah. Sebuah perintah keluar dari nol. Panggilan API eksternal kembali berhasil. Sebuah barisan telah dilakukan. Semua ini ada hari ini. Itu hanya tersebar, tidak pernah dikumpulkan menjadi satu catatan fakta yang ditetapkan sejauh ini.

Lapisan dua: hubungkan dua bagian. Langkah dengan nilai tertinggi. Ketika model menyatakan sebuah langkah selesai, berhentilah mempercayainya dan cari bukti lapisan-satu di jendela itu. Bukti hadir, tandai itu Diverifikasi selesai. Tidak ada bukti, tandai itu Dinyatakan selesai. Ini tidak menghentikan model untuk mendeklarasikan apa pun; itu hanya memisahkan yang didukung dari yang tidak didukung.

Lapisan tiga: tentukan Φ per tipe kemampuan. Para penulis mengakui bahwa Φ membutuhkan pengetahuan domain dan menggeneralisasi dengan buruk, jadi jangan berharap satu detektor universal. Tugas pengkodean menonton kode keluar tes. Tugas analisis data mengawasi apakah file keluaran terwujud. Tugas perpesanan memperhatikan respons API. Lapisan ini dibangun secara perlahan, satu kemampuan pada satu waktu.

Satu kriteria yang kami tambahkan: ireversibilitas, bukan kepentingan

Yang ini tidak ada di koran.

Tonggak sejarah BEACON berfungsi karena mereka menandai transisi keadaan yang tidak dapat Anda kembalikan. Setelah Anda memiliki kuncinya, dunia akan berbeda. Jadi kriterianya seharusnya Apakah tindakan ini menghasilkan efek samping eksternal yang tidak dapat diubah, daripada Apakah langkah ini penting.

Tidak dapat diubah: menulis file, melakukan kode, mengirim pesan, memanggil API berbayar, melakukan ke basis data. Dapat dibalik: membaca file, mencari, mengambil halaman, berpikir.

Dua hal mengikuti. Itu dapat diputuskan secara mekanis, karena jenis tindakan menyelesaikannya - tidak diperlukan pemahaman semantik, dan tidak ada kebocoran subjektivitas "model berpikir langkah ini penting". Dan itu bertepatan dengan titik pemulihan: melanjutkan dari batas yang tidak dapat diubah adalah satu-satunya jenis melanjutkan yang berarti apa pun, karena tindakan yang dapat dibalik dapat dengan mudah dilakukan kembali.

Dua angka: satu untuk keberanian, satu untuk kehati-hatian

Yang menstabilkan saraf adalah eksperimen degradasi. Secara acak menjatuhkan setengah dari tonggak sejarah dan skornya masih 82,8, melawan garis dasar 72,8 — sepuluh poin di depan. Degradasi itu mulus, bukan tebing. Bagi siapa pun yang mengirimkan ini, itu adalah bagian yang penting: Anda tidak harus mendapatkan Φ sempurna sebelum Anda berani menyalakannya. Menutupi setengahnya sudah membayar.

Yang peringatan adalah perbandingan partisi.

MempartisiSkorVs. garis dasar (72.8)
Perpecahan 5 arah acak74.2+1.4
Tonggak sejarah yang nyata91.4+17.2

Catatan pertama juga mengutip angka-angka ini, tetapi di sini implikasinya lebih langsung. Jika tonggak sejarah Anda ditetapkan oleh intuisi, itu kira-kira merupakan pembagian acak, dan pekerjaan itu sia-sia. Tonggak sejarah berharga tepat ketika mereka sejajar dengan struktur tugas yang sebenarnya.

Di mana ini harus didiskon

Lampiran makalah itu sendiri mencantumkan penemuan tonggak otomatis sebagai masalah terbuka. Ketiga tolok ukur memperoleh tonggak sejarah mereka dari aturan: respons lingkungan yang cocok dengan pola, transisi halaman, atau sinyal yang diserahkan lingkungan secara langsung. Pengaturan yang benar-benar terbuka — operasi peramban, refaktor basis kode, penelitian mendalam — tidak memiliki transisi yang dapat diverifikasi yang sudah jadi.

Jadi ini adalah paradigma yang divalidasi di dalam lingkungan terstruktur, bukan solusi yang dapat Anda angkat secara grosir. Apa yang membuatnya mendarat di produk agen adalah batas terstruktur dari panggilan alat, bukan jawaban kertas yang sudah disediakan.

Jebakan lainnya adalah granularitas. Terlalu jarang dan Anda tidak melakukan apa-apa; terlalu padat dan sinyal tingkat segmen menjadi kebisingan. Dalam istilah produk yaitu granularitas dekomposisi tugas, dan di sini ada kenyamanan yang tidak dimiliki oleh pengaturan kertas. Langkah-langkah rencana menghadap pengguna dengan desain, sehingga granularitas dapat berlabuh pada apakah seseorang dapat memahami langkah tersebut, alih-alih murni disetel oleh algoritma.

Jika kamu hanya melakukan satu hal

Lakukan lapisan dua.

Itu murah, karena data lapisan satu sudah ada dan lapisan dua hanya menghubungkannya dengan deklarasi model. Itu dapat diverifikasi secara independen, karena rasio yang diverifikasi terhadap yang dinyatakan itu sendiri merupakan metrik yang layak untuk ditonton. Dan itu adalah prasyarat untuk yang lainnya: tanpa gagasan tentang tonggak yang diverifikasi, deteksi kios dari nada pertama dan batas pemadatan di nada berikutnya keduanya tidak memiliki apa-apa untuk berdiri.

Itu juga memiliki properti yang nyaman. Pengiriman itu tidak mengubah perilaku - model menyatakan langkah-langkah persis seperti sebelumnya, hanya ada tanda tambahan. Setelah data terakumulasi, Anda dapat memutuskan apakah akan melakukan intervensi pada deklarasi yang tiba tanpa bukti.

Catatan berikutnya mencakup pemadatan konteks: mengapa memotong pada ambang batas token tidak ada hubungannya dengan apa yang aman untuk dilupakan, dan koreksi ke cara paling alami untuk memperluas catatan ini, yaitu dengan mengasumsikan bahwa begitu tonggak sejarah diverifikasi, semuanya sebelum itu dapat dilipat.