Desain Layanan Memori Agent
Rancang layanan memori yang membuat agent ingat lintas sesi tanpa meledakkan biaya token: pemadatan riwayat, fakta jangka panjang, dan retrieval yang sadar anggaran.
Prompt latihan
Ruang Lingkup, Kebutuhan Fungsional, dan Asumsi Skala
Tentukan apa arti ingat untuk layanan ini: riwayat percakapan satu sesi, fakta jangka panjang tentang pengguna, atau pengetahuan dokumen organisasi. Perjelas siapa yang menulis memori (agent, pengguna, atau keduanya), siapa yang boleh membacanya, dan bagaimana pengguna menghapus ingatan tentang dirinya. Nyatakan non-goal dan asumsi skala: jumlah pengguna aktif, sesi per pengguna, dan panjang rata-rata sesi.
Kebutuhan Non-Fungsional
Tetapkan NFR: latency pengambilan memori yang masih muat di dalam anggaran satu iterasi agent, ketersediaan, konsistensi setelah menulis fakta baru, isolasi data antar pengguna dan antar penyewa, serta kebijakan retensi dan penghapusan. Tentukan juga perilaku ketika layanan memori tidak tersedia: agent tetap jalan tanpa ingatan atau berhenti.
Analisis Kuantitatif
Bagi anggaran jendela konteks menjadi porsi konkret untuk instruksi, ringkasan, hasil retrieval, dan riwayat terbaru, lalu tunjukkan berapa token yang tersisa untuk keluaran. Hitung juga pertumbuhan penyimpanan: jumlah pesan per hari, ukuran embedding per potongan, total ukuran indeks vektor, dan biaya token untuk pemadatan berkala.
Desain API Memori
Rancang API layanan memori: menambahkan giliran percakapan, mengambil konteks untuk satu iterasi dengan anggaran token sebagai parameter, menulis fakta jangka panjang beserta sumber dan waktu, mencari fakta, serta menghapus memori milik seorang pengguna. Tentukan bentuk respons yang menyertakan asal setiap potongan supaya agent bisa mengutip sumber.
Desain Tingkat Tinggi
Gambar komponennya: penyimpanan giliran percakapan, pekerja pemadatan, penyimpanan fakta jangka panjang, indeks kata kunci dan indeks vektor, peringkat ulang, serta perakit konteks yang menegakkan anggaran token. Tunjukkan jalur baca saat agent menyusun konteks dan jalur tulis saat sesi menghasilkan fakta baru.
Pertanyaan Lanjutan Desain Tingkat Tinggi
Jawab tiga hal. Pertama, apa yang wajib bertahan dalam ringkasan setelah pemadatan dan apa yang boleh dibuang. Kedua, bagaimana Anda menangani fakta yang saling bertentangan, misalnya preferensi lama versus koreksi terbaru dari pengguna. Ketiga, bagaimana permintaan penghapusan data pengguna dijalankan sampai ke indeks vektor dan ringkasan yang sudah terlanjur menyerap informasi itu.
Deep Dive Retrieval dan Pemadatan
Masuk ke detail. Bandingkan pencarian vektor murni dengan pencarian hibrida ditambah peringkat ulang dari sisi kualitas, latency, dan biaya. Tentukan ukuran potongan dan tumpang tindih beserta alasannya. Rancang pemadatan yang tidak menghilangkan keputusan dan kegagalan penting, lalu jelaskan bagaimana Anda mengukur kualitas memori, misalnya proporsi potongan yang benar-benar dikutip di jawaban akhir.
Kesiapan Serah Terima Final Review
Tutup desain: sebutkan pembagian anggaran konteks, strategi pemadatan, pilihan retrieval, kontrol privasi termasuk penghapusan, angka biaya per sesi, dua risiko terbuka, dan rencana peluncuran dari memori sesi saja menuju fakta lintas sesi.
Preview solusi
Jalur referensi Solusi Layanan Memori Agent adalah materi baca read-only. Pakai untuk membandingkan desain Anda sebelum latihan atau sesudahnya. Perlakukan jendela konteks sebagai anggaran dengan porsi tetap per bagian, dan tunjuk satu komponen yang menegakkannya. Pisahkan jalur baca yang cepat dari jalur tulis yang asinkron; pemadatan dan pengindeksan tidakā¦