Agen Anda mencapai 80% dari jendela konteksnya. Pemadatan menembak dan menjatuhkan belokan tertua. Sepuluh menit kemudian ia membaca ulang file yang sudah dibacanya, dan mengajukan kembali pertanyaan yang sudah dijawabnya.
Ambang batas tahu kamu keluar dari ruangan. Itu tidak tahu apa-apa tentang apa yang aman untuk hilang.
Ini adalah catatan ketiga dalam seri tentang desain agen cakrawala panjang, didorong oleh pembacaan yang cermat dari SUAR (Universitas Zhejiang, arXiv:2605.06078). Yang Pertama Deteksi kios tertutup, Kedua Desain tonggak yang tercakup.
Dimulai dengan implementasi kita sendiri
Orkas adalah klien desktop multi-agen. Tugas yang panjang adalah kasus normal di sini, jadi pemadatan muncul setiap hari. Implementasi kami dipicu pada ambang batas token, memadatkan setelah konteks mencapai sekitar 80% dari jendela. Sampai kami menulis ini, tidak ada dari kami yang berpikir ada yang salah dengan itu.
Ada sekitar tiga batasan umum di alam liar: persentase jendela, jumlah belokan, atau membiarkan model menulis ringkasan yang mencakup konten lama. Milik kita adalah yang pertama.
Dua yang pertama tidak pernah melihat konten sama sekali. Yang ketiga terlihat, tetapi menyerahkan seluruh pertanyaan tentang apa yang penting bagi model.
Ketiga jawaban Kapan aku harus membuang sesuatu. Pertanyaan yang sebenarnya Anda miliki adalah Apa yang aman untuk dibuang. Memotong di ambang batas menjatuhkan konten tertua, bukan konten yang paling tidak penting.
Batas tonggak sejarah, dan asumsi di bawahnya
Tonggak sejarah dari catatan sebelumnya dapat memberikan batas yang lebih baik daripada ketiganya. Tapi ada jebakan di sini, dan catatan sebelumnya membuatnya sedikit terlalu halus.
BEACON berisi asumsi yang disebut properti Markov tonggak sejarah. Secara sederhana: setelah Anda mencapai tonggak sejarah, apa yang terjadi selanjutnya hanya bergantung pada subtujuan yang tersisa, bukan pada bagaimana Anda sampai di sana. Setelah Anda memiliki kuncinya, yang penting adalah pintu mana yang Anda buka, bukan bagaimana Anda menemukannya.
Itu terdengar seperti lisensi untuk dipadatkan: melewati tonggak sejarah, peregangan sebelumnya dapat dilipat.
Tapi itu adalah asumsi, bukan fakta. Makalah tersebut menulis ≈, bukan =, dan penulis mendiskusikan di mana ia gagal.
Cukup untuk pelatihan, tidak cukup untuk pemadatan
Asumsi yang sama, dua penggunaan, urutan besarnya terpisah dalam ketelitian.
Dalam pelatihan itu hanya harus menahan Secara statistik. Jika beberapa lusin dari beberapa ribu peluncuran melanggarnya, bias rata-rata keluar. Pelatihan juga menjalankan sinyal tingkat lintasan di bawahnya sebagai backstop; ablasi lapisan itu dan ALFWorld turun dari 91,4 menjadi 23,4, jauh di bawah tidak melakukan apa-apa sama sekali.
Dalam pemadatan itu harus menahan Secara pointwise, untuk lari tunggal di depanmu. Jatuhkan hal yang salah sekali dan tugas itu mati. Tidak ada yang bisa dirata-ratakan.
Jadi kertas yang bersandar pada asumsi ini tidak berarti Anda dapat membawanya ke dalam pemadatan. Kedua penggunaan tidak menanyakan hal yang sama.
Empat kasus di mana itu rusak
Kami menjalankan ini sebagai daftar periksa ketika beralasan tentang kebijakan pemadatan.
1. Pengetahuan implisit terakumulasi di sepanjang jalan. Di suatu tempat di awal, sebuah langkah menetapkan bahwa API yang diberikan mengembalikan stempel waktu di UTC. Itu bukan milik tonggak sejarah, dan setiap langkah setelahnya membutuhkannya.
2. Sumber daya sudah terbakar. Anggaran token, kuota panggilan, waktu yang tersisa. Sebuah tonggak sejarah tidak mencatat Saya telah menghabiskan 60% dari anggaran, tetapi angka itu menentukan apakah percobaan ulang masih terjangkau.
3. Efek samping yang bergantung pada jalur. Tonggak sejarah mengatakan Refactor selesai. Saat debugging dimulai, Anda perlu tahu lima file mana yang benar-benar disentuh.
4. Tonggak itu sendiri kurang ditentukan. Ini adalah yang terburuk dari keempatnya. Dalam makalah, tonggak sejarah adalah keadaan lingkungan yang lengkap - Anda memiliki kunci atau tidak, tanpa ambiguitas. Langkah rencana adalah satu kalimat bahasa alami. "Selesaikan pembersihan data" tidak mendekati apa yang terjadi di bentangan itu.
Apa yang harus dibawa sebagai gantinya
Jangan hanya menyimpan ringkasan. Ringkasan ditulis oleh model, yang memutuskan dengan merasakan apa yang penting.
Pertahankan satu set bidang tetap, yang dipilih oleh manusia. Minimal empat:
- Seperti apa ruang kerja sekarang — file mana yang disentuh, dan ke dalam keadaan apa.
- Anggaran apa yang tersisa — token, kuota panggilan, waktu.
- Apa yang telah ditetapkan — fakta UTC, dan segala sesuatu seperti itu yang akan membentuk keputusan selanjutnya.
- Apa yang masih terbuka — hal yang pernah diblokir, diperbaiki, dan mungkin akan kembali.
Atur itu terhadap empat kasus kegagalan di atas dan mereka berbaris satu per satu. Korespondensi itu adalah cara paling sederhana untuk menilai apakah kebijakan pemadatan sudah cukup.
Setengah dari ini hampir gratis. Seperti yang dijelaskan catatan sebelumnya, host sudah mencatat fakta deterministik setelah setiap panggilan alat: apakah sebuah file benar-benar ditulis ulang, apakah sebuah perintah benar-benar berjalan. Data itu dikumpulkan untuk memverifikasi tonggak sejarah, tetapi itu Adalah Snapshot ruang kerja, sehingga pemadatan dapat membawanya secara langsung tanpa meminta model untuk meringkasnya lagi.
Bagian yang keras adalah dua lainnya. Apa yang telah ditetapkan dan apa yang masih terbuka saat ini hanya ada jika model menuliskannya, itulah mengapa mereka adalah korban pertama dari pemadatan.
Ini dapat diukur, tidak dapat diperdebatkan
Setelah pemadatan, jika agen membaca ulang file yang dipadatkan, atau mengajukan kembali pertanyaan yang sudah dijawab, asumsi tersebut gagal pada tugas itu dan buktinya ada di sana.
Instrumentasinya sederhana: berpotongan jalur file yang dibaca setelah titik pemadatan dengan apa yang direkam sebelumnya.
Dengan nomor itu, Jenis tugas mana yang dapat dipadatkan secara agresif dan mana yang tidak bisa Menjadi sebuah pertanyaan daripada sebuah argumen desain. Ini adalah pendekatan yang sama dengan catatan pertama dalam seri ini: ukur dulu, lalu ubah sesuatu.
Di mana ini harus didiskon
Tak satu pun dari ini yang dikirim. Kami sedang dalam desain dan instrumentasi.
Bidang mana yang harus disimpan dan pada granularitas apa yang harus berasal dari data tentang apa yang sebenarnya diambil kembali. Memutuskan sekarang adalah cara yang baik untuk membuat keputusan yang salah.
Dan ini adalah salah satu pendekatan di antara beberapa. Ke mana batas pergi dan bagaimana bidang didefinisikan dapat terlihat sangat berbeda dalam bentuk produk lain. Daftar periksa empat kasus berjalan; jawaban spesifik tidak.
Catatan berikutnya dan terakhir dalam seri ini mencakup refleksi diri: mengapa pelajaran suling agen terus keluar sebagai generik seperti "lebih berhati-hati," dan satu hal yang benar-benar mengejutkan tentang apa yang dilakukan dan tidak terkandung dalam inputnya.