Інженерія структурованого контексту для файлових агентських систем
Інженерія структурованого контексту для файлових агентських систем (через) Нова стаття Деймона МакМіллана, присвячена дослідженню складних контекстних завдань LLM, що включають великі схеми SQL (до 10 000 таблиць) у різних моделях і форматах файлів:
Використовуючи генерацію SQL як проксі для операцій програмного агента, ми представляємо систематичне дослідження контекстної інженерії для структурованих даних, що включає 9649 експериментів у 11 моделях, 4 форматах (YAML, Markdown, JSON, Token-Oriented Object Notation (TOON)) і схемах від 10 до 10 000 таблиць.
Не дивно, що найбільший вплив мали самі моделі — передові моделі (Opus 4.5, GPT-5.2, Gemini 2.5 Pro) випередили провідні моделі з відкритим кодом (DeepSeek V3.2, Kimi K2, Llama 4).
Ці граничні моделі виграли від пошуку контексту на основі файлової системи, але моделі з відкритим кодом мали набагато менш переконливі результати, що підкріплює моє відчуття, що цикли агента кодування файлової системи ще не обробляються моделями відкритої ваги. У таблиці лідерів Terminal Bench 2.0 досі домінують Anthropic, OpenAI та Gemini.
Результат «grep tax» проти TOON був цікавою деталлю. TOON призначений для представлення структурованих даних у якомога меншій кількості токенів, але виявилося, що незнайомість моделі з цим форматом призвела до того, що вони витратили значно більше токенів протягом кількох ітерацій, намагаючись це зрозуміти:

