Практические приёмы и сдвиги для Go-backend инженера с фокусом на агентов: было так — стало так — попробуй так.
🗓 окно 19–26 августа 2026⚡ приёмов: 10👀 на заметку: 2📡 постов отсканировано: 2 226
🔥 О чём говорят на этой неделе
Неделя прошла под знаком прополки. Anthropic рассказала, что выкинула больше 80% системного промпта Claude Code для новых моделей и не увидела просадки на своих coding-евалах, а самым обсуждаемым скиллом стал eli5 — 321 байт и три строки текста, которые за четыре дня пересказали на английском, японском и китайском. Вторая линия недели: агента прикручивают не к очередной обёртке над моделью, а к настоящему инструменту — отладчику x64dbg, локальному движку вывода, аудиту собственного сайта. Третья про скорость и железо: вызовы инструментов пробуют запускать прямо из недописанного кода, пока модель ещё печатает, а модель на 27 миллиардов параметров дообучают на одной 24-гиговой карте. Из 2 226 постов недели до карточек дошли десять, и почти у каждого рецепт лежит не в самом твите, а в репозитории или гайде, куда он ведёт.
⚡
Главные приёмы недели
Десять приёмов, у каждого из которых нашлась улика в посте или в источнике по ссылке. Порядок тематический: сверху то, что меняет инструкции агенту, дальше — инструменты, которые ему отдают, и железо, на котором он живёт. Где проверка нашла дыру, дыра названа прямо в карточке.
01
Скилл на три строки: /eli5 вместо простыни инструкций
Чтобы объяснить новичку кусок архитектуры, рисуешь схему руками или пишешь длинный документ, а свои скиллы обрастают правилами на всякий случай.
→
Стало
Скилл на три строки делает HTML-объяснялку одной командой: «объясни так, будто я ничего об этом не знаю, HTML-артефактом с крупными картинками и минимумом слов».
Почему лучше: файл eli5/skills/eli5/SKILL.md весит 321 байт — вся работа держится на формулировке, а не на объёме инструкции. Это удобная линейка для собственных скиллов: если ваш SKILL.md в сто раз длиннее, разница должна чем-то оправдываться. Автор сам уточнил в треде, что имя eli5 кликбейтное, промпт не просит объяснять «как пятилетнему», а работает в нём часть про крупные картинки и мало слов. Оговорка: плагин лежит в community-маркетплейсе (Apache-2.0), в anthropics/claude-plugins-official его нет, так что «внутренний скилл Anthropic» — формулировка авторов постов; внутренний там только review-пайплайн, из которого маркетплейс синхронизируется по ночам.
⚡ Попробовать за вечер
Две команды: claude plugin marketplace add anthropics/claude-plugins-community, затем claude plugin install eli5@claude-community.
Прогнать /eli5 на самом мутном куске своей архитектуры и отдать получившийся артефакт новичку в команде — без устных пояснений. Автор так же разбирает и свою работу: /eli5 how does this module work, /eli5 why did we make this tradeoff, /eli5 what caused this incident.
Открыть SKILL.md скилла и сравнить со своим самым длинным: тело там — одна фраза плюс строка Topic: $ARGUMENTS.
Новичок пересказывает механизм своими словами и не задаёт базовых вопросов. Свой раздутый SKILL.md ужимаешь до сопоставимого размера и проверяешь, что качество вызовов не упало.
Прополоть CLAUDE.md и скиллы, а результат проверить командой /doctor
кто:@trq21216 164 лайка · 1 895 репостов · 25 августа
Было
CLAUDE.md растёт правилами на всякий случай, в нём мирно соседствуют «leave documentation as appropriate» и «DO NOT add comments», а SKILL.md превращается в простыню.
→
Стало
Правило пишут одной строкой про результат: вместо «default to writing no comments. Never write multi-paragraph docstrings…» — «Write code that reads like the surrounding code: match its comment density, naming, and idiom».
Почему лучше: Anthropic говорит, что выкинула больше 80% системного промпта Claude Code для новых моделей и не увидела просадки на своих coding-евалах. Цифру проверить нечем — ни бенчмарков, ни опубликованного промпта, — и половина совета читателю недоступна: системный промпт Claude Code менять нельзя, автор признаёт это в том же треде. Зато /doctor реально есть в установленной сборке и делает именно то, что обещано: подрезает CLAUDE.md и ищет неиспользуемые скиллы. Ссылка из поста ведёт в статью за логином X; те же формулировки автор повторил в публичном посте про контекст-инжиниринг на блоге Anthropic. В те же дни @tobi собрал 15 752 лайка обещанием запретить Claude Code в Shopify, пока тот не начнёт читать AGENTS.md и .agents/skills: спор идёт не только про размер файла инструкций, но и про то, какой файл агент вообще открывает.
⚡ Попробовать за вечер
Прогнать /doctor на рабочем репозитории и посмотреть, что он предложит вырезать.
Вычистить из CLAUDE.md то, что и так видно по файловой системе, и снять взаимоисключающие запреты — они дороже пустой строки.
Длинный SKILL.md разрезать на дерево файлов с постепенным раскрытием, а из описаний инструментов убрать примеры вызовов, заменив их выразительными параметрами: status: pending / in_progress / completed объясняет себя лучше любого примера.
Размер CLAUDE.md и скиллов в токенах до и после — цель кратная, не косметическая. Плюс прогон своих 10–20 типовых задач: не выросла ли доля прогонов, где агент переспрашивает или делает лишние шаги.
Ставить готовые агентные скиллы поштучно, а не пачкой в 160 штук
кто:@tom_doerr805 лайков · 127 репостов · 21 августа
Было
Увидел большой набор готовых скиллов и поставил всё разом — а дальше агент идёт в вашу инфраструктуру с чужими конфигами.
→
Стало
Ставишь два-три навыка под конкретную боль и вычитываешь их SKILL.md глазами до того, как агент с ними куда-то полезет.
Почему лучше: набор разложен по доменам, и по этой разбивке видно, что вам вообще нужно. Внутри каждого навыка — SKILL.md на 250–400+ строк плюс папки scripts/, references/, assets/. Содержимое добротное, но типовое: это boilerplate из документации, а репозиторий не обновлялся с мая 2026 — расхождение с вашими версиями K8s и Terraform скорее правило, чем исключение. Неделя на такие сборники выдалась урожайной: @jaimintf в те же дни собрал пятёрку скилл-репозиториев под iOS, и правило чтения перед установкой к ним относится ровно так же.
⚡ Попробовать за вечер
Сначала список: npx skills add bagelhole/DevOps-Security-Agent-Skills --list — CLI находит 163 навыка.
Поставить точечно: npx skills add bagelhole/DevOps-Security-Agent-Skills --skill kubernetes-ops --skill github-actions -a claude-code -y. Ключ агента для Claude Code пишется как claude-code: короткое claude CLI отвергает с ошибкой «Invalid agents: claude».
Прочитать оба SKILL.md целиком до первого запуска.
Три-пять типовых задач до и после: разбор упавшего пода, ревью Helm-чарта, аудит GitHub Actions. Если конфиги из SKILL.md расходятся с вашими версиями — навык удалять, а не чинить агентом.
из твита @tom_doerr
На картинке: шапка README с таблицей доменов — DevOps 40+, безопасность 35+, инфраструктура 65+, AI-инженерия 20+, комплаенс 20+ — и коротким описанием, чему каждый домен учит агента. По этой таблице и выбирают, какие два-три навыка ставить.
Проверить сайт на читаемость агентами одной командой npx
кто:@vercel_dev2 414 лайка · 211 репостов · 21 августа
Было
Как агент видит ваш сайт или документацию, узнаёшь по жалобам пользователей, а чинишь наугад.
→
Стало
Одна команда выдаёт балл до 100 с разбивкой на Essential и Recommended и список конкретных провалов: серверный рендеринг, честные HTTP-коды, структура документа, восстановимые ошибки, работающие контролы.
Почему лучше: шкала устроена честно — Essential делят пул в 80 баллов, Recommended забирают 20, экспериментальные сигналы дают максимум 5 сверху и никогда не снижают балл, а неприменимые проверки просто исключаются вместо того, чтобы считаться провалом. Пакет и API открыты без ключа: проверено, что is-agentic@1.0.1 ставится через npx, а GET /api/v1/report отвечает 200 по произвольному домену.
⚡ Попробовать за вечер
Прогнать свой домен: npx is-agentic <domain> --json и разобрать провалившиеся Essential-проверки.
Повесить в CI дёрганье публичного отчёта: curl "https://is-agentic.com/api/v1/report?url=<encoded>" — read-only, без ключа, лимит 120 запросов на IP за 60 секунд, ошибки приходят в формате RFC 9457.
Агенту дать MCP-эндпоинт https://is-agentic.com/mcp с тремя инструментами: is_agentic_get_report, is_agentic_get_methodology, is_agentic_get_developer_docs.
Essential-провалы уходят в ноль, балл растёт между прогонами. Закладывайте паузу: готовый отчёт отдаётся из кэша шесть часов, поэтому пересканировать сразу после правки не выйдет. И помните, что сам скоринг закрытый: страница методологии перечень Essential-проверок не раскрывает, а отсылает к исследованию Ora.
кто:@duty_1g3 437 лайков · 484 репоста · 22 августа
Было
Разбор бинаря идёт руками: точки останова, регистры, дамп памяти, шаг за шагом — и всё это переписываешь агенту текстом.
→
Стало
Нативный плагин на Zig поднимает MCP-сервер прямо внутри x64dbg, и агент сам ставит точки останова, читает память и регистры через HTTP или SSE.
Почему лучше: плагин без зависимостей, релиз v1.1 отдаёт готовый zip с .dp32 и .dp64, собирать Zig не нужно. В комплекте лежит SKILL.md с готовым рабочим процессом для агента. Две честные оговорки: рецепт годится только тем, у кого Windows с x64dbg, и это открытый HTTP с полным доступом к памяти отлаживаемого процесса — Bearer-токен появился в репозитории отдельным коммитом именно как защита от RCE.
⚡ Попробовать за вечер
Скопировать содержимое dist/ в корень x64dbg — разворачивает сразу x32 и x64 — и запустить отладчик: сервер поднимется сам.
В Plugins → x64dbg-MCP Server → Configure MCP Server взять автосгенерированный 32-символьный hex-токен и добавить в .mcp.json блок {"type":"http","url":"http://localhost:9094/","headers":{"Authorization":"Bearer <token>"}}. Порты по умолчанию: 9094 для x64, 9095 для x32.
Для WSL или удалённой машины README советует bind на 0.0.0.0 и IP хоста — тогда закрывайте порт сетью, а не только токеном.
Агент сам ставит точку останова и читает регистры без вашего копипаста. В v1.1 доступно 84 инструмента: в посте заявлен 71, на старте 22 августа было 51 — считайте цифру в посте моментальным снимком, а не константой.
Запускать вызовы инструментов из недописанного кода, пока модель ещё печатает
кто:@a1zhang1 700 лайков · 197 репостов · 24 августа
Было
Харнесс ждёт, пока модель допишет блок кода, потом выполняет его в REPL, и только тогда уходят вызовы подмоделей и поиска — генерация и выполнение стоят в очереди друг за другом.
→
Стало
Спекулятор читает дельты стрима, угадывает вызовы, помеченные как чистые, и ставит их в очередь заранее; к моменту выполнения часть результатов уже готова.
Почему лучше: на реальных траекториях выигрыш 1–1,2× (OOLONG и OOLONG-Pairs на Qwen3-30B-A3B, узел 8×H100, vLLM, среднее по пяти прогонам). Эффектные 2,4× из демо получены на фиксированной программе, и автор сам не стал выносить их в бенчмарк. Смысл появляется там, где в одном блоке REPL стоят несколько независимых вызовов подагентов, которые модель написала последовательно. Репозиторию три дня, версия 0.1.1 — это заготовка, а не зрелая библиотека.
⚡ Попробовать за вечер
pip install spec-ptc (версия 0.1.1, нужен Python 3.12+), затем взять из репозитория клиент plugins/client.py — 41 строка на стандартной библиотеке — как образец обвязки.
Пометить вызовы подмоделей и поиска как спекулируемые: @spec.tool(speculatable=True, pure=True), плюс ns.update(spec.hooks()) и with spec.turn(repl_locals=ns). Демон живёт на сокете /tmp/spec-ptc.sock и говорит сообщениями turn_begin / feed / resolve / turn_end.
Начать с распараллеливания независимых вызовов подагентов — на медленных tool-API и локальном vLLM эффект виднее всего.
Пять прогонов своего сценария до и после по wall-clock плюс счётчик hit / miss из turn_end. Ждать порядка 1–1,2×, больше — только там, где вызовы действительно независимы.
из твита @a1zhang
На картинке: слева блок REPL, где модель раскладывает контекст по кускам, размечает их подмоделью и зовёт judge. Справа две шкалы времени: со спекуляцией шесть вызовов подмодели и judge успевают отработать внутри декодирования, без неё те же вызовы выстраиваются в очередь после него. Подпись у нижней шкалы: «execute collapses — 2.4×, no async».
Локальная модель под агента упирается в prefill: агент постоянно переписывает историю, и каждая правка гонит тысячи токенов заново.
→
Стало
Движок сохраняет чекпоинты ровно на тех границах, по которым агентные фреймворки режут историю, поэтому переобрабатывается только новый кусок, а промахи роутера MoE делятся между PCIe и CPU по измеренной на вашей машине полосе.
Почему лучше: худшее время до первого токена в агентном цикле авторы называют меньше 44 с против 232 с у llama.cpp и 946 с у KTransformers. Сервер отдаёт и OpenAI-, и Anthropic-совместимый API под Apache 2.0, поэтому Claude Code и Codex можно направить в него напрямую. За неделю набежали и посторонние замеры: @Tono_Ken3 поднял Ornith-1.5-35B-A3B-NVFP4 на 23,5 ГБ на ноутбучной RTX 4060 с 8 ГБ VRAM и 64 ГБ RAM и получил 22 tok/s при -c64K и 7,5 ГБ реально занятой видеопамяти, @analogalok на RTX 4090 снял 167 tok/s декода на Qwen3.6-35B-A3B в NVFP4 без спекулятивного декодирования и черновой модели. Главная дыра: колёса на PyPI собраны только под manylinux_2_27_x86_64, а установка требует Linux x86_64 плюс NVIDIA с драйвером r580+ и CUDA 13 с nvcc в PATH. На macOS, Windows или AMD упадёт первая же команда — в пересказе поста об этом ни слова.
⚡ Попробовать за вечер
Сначала сверить машину со списком выше, потом ставить: uv pip install "freetoken[accel]". И заложить время на скачивание многогигабайтного чекпоинта.
Поднять сервер: ft serve --model ~/models/Qwen3.6-35B-A3B. Готовность видно по строке «API server is ready to serve on 127.0.0.1:1919», проверка — curl http://127.0.0.1:1919/v1/models.
Посмотреть конфиг провайдера через ft launch claude --dry-run, и если устраивает — ft launch claude. Claude Code пойдёт в локальную модель через /v1/messages.
Токены в секунду на своей карте против Ollama на той же модели и время до первого токена после правки истории. Ориентиры авторов: Qwen3.6-35B — 39,3 tok/s на 8-гиговой карте, DeepSeek-V4-Flash 284B — 22 tok/s на 32-гиговой.
Дообучить Qwen3.8-27B на одной 24-гиговой карте через QLoRA
кто:@UnslothAI1 589 лайков · 191 репост · 25 августа
Было
Дообучение модели такого размера означает аренду пары больших карт и день возни с окружением.
→
Стало
Гайд даёт готовый SFT-рецепт под QLoRA, который влезает в 24 ГБ VRAM, плюс бесплатные Kaggle-ноутбуки с 30 часами на двух Tesla T4.
Почему лучше: пороги памяти названы прямо, без «зависит от задачи»: QLoRA — 24 ГБ, LoRA — больше 36 ГБ, полное дообучение — вчетверо больше. При нехватке памяти гайд велит резать max_seq_length, а не батч. По замерам самой Unsloth обучение идёт в 1,5 раза быстрее при вдвое меньшем расходе памяти; это цифры вендора, не независимая проверка.
⚡ Попробовать за вечер
Взять рецепт из гайда целиком: модель unsloth/Qwen3.8-27B-unsloth-bnb-4bit, r=16, lora_alpha=16, batch=1, grad_accum=4, lr=2e-4, optim="adamw_8bit", use_gradient_checkpointing="unsloth", offload_embedding=True. Нужен Transformers v5; первый запуск дольше из-за компиляции кернелов Gated DeltaNet.
Подсунуть свой train.jsonl с колонкой text, уже отрендеренной чат-шаблоном Qwen, и прогнать сотню шагов.
Не путать два пути. Бесплатный Kaggle-ноутбук рассчитан на две T4 и ставит r=8 и max_seq_length=1024, а экспорт в GGUF там прямо объявлен невозможным: слитая модель весит около 52 ГБ, больше квоты на выход ядра. Значит, сценарий «дообучил и забрал квант» бесплатно не закрывается — за экспортом идти на свою карту.
Train loss падает по шагам, прогон укладывается в 24 ГБ без OOM, а на отложенной выборке дообученная модель обгоняет базовую и не теряет рассуждение: гайд требует держать в миксе не меньше 75% reasoning-примеров.
PDF режут на текстовые чанки, и таблицы, графики и сканы теряют раскладку ещё до индексации.
→
Стало
Модель на 4,5 млрд параметров индексирует страницу как изображение и ищет по ней целиком: 65,36 nDCG@10 на публичном ViDoRe V3 против 65,32 у webAI-ColVec1.1-8b и 57,54 у jina-embeddings-v4.
Почему лучше: около 8,5 ГБ в BF16, лицензия Apache 2.0, веса открыты без анкеты — поиск по внутренним документам остаётся у вас на машине. Цена входа честная: нужна карта NVIDIA, отдельная установка flash-attn и растеризация PDF в PNG, которой в карточке модели нет вовсе. llama.cpp, Ollama и LM Studio модель пока не поддерживают.
⚡ Попробовать за вечер
pip install "colpali-engine>=0.3.15" accelerate и прогон Quick Start (ColQwen3_5 плюс ColQwen3_5Processor, bf16, flash_attention_2) на 50–100 своих страницах. Через CLI это python infer.py --query "Quarterly revenue report" --image page_1.png.
Не пропустить сноску из карточки модели, которой нет в посте: один раз вызвать enable_bidirectional_attention(model) и сбрасывать model.rope_deltas = None перед каждым прогоном запросов. До версии 0.3.17 ColQwen3.5 собирается с каузальными масками, и это стоит около 1,1 MaxSim на топ-хите.
hit@5 и nDCG@10 на своих вопросах к PDF против текущего текстового чанк-RAG плюс реальный размер индекса. Ориентир из карточки: 179,2 ГиБ на миллион страниц при 768 визуальных токенах и 420,5 ГиБ при 1792.
Про LoRA и внутренности трансформера читаешь по обрывкам постов и чужих ноутбуков, а требования к памяти прикидываешь на глаз.
→
Стало
Две главы «Deep Learning with Python» открыты целиком: mini-GPT с нуля, стратегии сэмплинга, instruction fine-tuning и LoRA одной строкой gemma_lm.backbone.enable_lora(rank=8) — всё с рабочим Colab-ноутбуком.
Почему лучше: арифметика памяти в главе конкретная, и после неё понятно, почему LoRA вообще работает: модель на миллиард параметров весит около 3,7 ГБ, Adam добавляет три float на параметр, отсюда ~15 ГБ весов и состояний и OOM на 16-гиговом Colab GPU; при ядре 2048×2048 и rank=8 обучаемых параметров становится 32 768 вместо 4 194 304. Три оговорки: для Gemma нужен ключ Kaggle с принятием условий, обучение mini-GPT книга сама называет самым дорогим прогоном во всём тексте (на бесплатном Colab целиком не пройдёт), а раздела «на своих данных» в главе нет — там готовый Dolly.
⚡ Попробовать за вечер
Открыть chapter16_text-generation.ipynb из репозитория fchollet/deep-learning-with-python-notebooks и прогнать раздел про LoRA-дообучение Gemma. Ключ Kaggle получить заранее, иначе ячейка с загрузкой весов встанет.
Начинать не с mini-GPT: обучение с нуля книга называет самым дорогим прогоном, и бесплатный Colab его не вытянет. Сначала LoRA на готовой Gemma, а мини-модель — потом и на своей карте.
Дальше подменить Dolly своим набором инструкций в том же формате и повторить прогон.
Дообучение Gemma проходит на 16-гиговой карте без OOM, сгенерированный текст связный. Проверка на понимание: сможете объяснить коллеге, откуда берутся те самые ~15 ГБ и почему rank=8 хватает.
Обе темы проверку прошли, но в приём за вечер не складываются: в одной цифры самоотчётные, в другой рецепт требует стоек с GB200. Держать в голове — да, бросаться делать — нет.
🐣 Открытая линейка Ornith-1.5 под MIT, включая GGUF и MLX
9B, 35B-A3B и 397B выложены с квантами, младшую можно поднять одной командой в ollama. Заявка на 86,1 в Terminal-Bench 2.1 против 85,0 у Claude Opus 4.8 — самоотчётная и снята на BF16 в тяжёлых харнессах, на Q4-кванте так не будет. По собственной таблице блога 9B проигрывает Qwen3.6-35B почти по всем агентным метрикам, так что выигрыш здесь только в размере.
Marin перед стартом 535B-A23B обучил четыре ступени от 1,6B до 27,7B ценой 1% всего компьюта и построил по ним прогноз лосса. Лестница поймала рост grad norm выше 4 при удлинении окна и дроп токенов с ~7% до ~40% при переходе с 4k на 65k. Пороги привязаны к конфигу Marin, а повторить прогон может лишь тот, у кого есть стойки GB200 — переносится сама идея, не числа.
Из десяти приёмов выше — три, которые реально внедрю. Не «прочитать», а внедрить.
Прополоть: прогнать /doctor на рабочем репозитории и ужать CLAUDE.md, записав размер в токенах до и после
до пятницы
Поставить: eli5 двумя командами и сделать объяснялку по самому мутному сервису — для следующего новичка
за вечер
Прогнать:npx is-agentic по своей документации и закрыть провалившиеся Essential-проверки
до среды
#
Метаданные
сгенерировано 2026-08-26T07:09:33Z
окно 2026-08-19 – 2026-08-26 (7 дней)
отсканировано / в дайджест 2 226 постов от 1 475 авторов / 13 подтверждённых постов: 11 в десяти карточках (два поста про /eli5 сведены в одну) и 2 на заметку
отбор сначала тема, потом польза: пост обязан быть про AI-инженерию, и только после этого оценивается применимость. Дальше вычитка источников по ссылкам с уликой и отдельный проход на опровержение. В карточки шли 4 и 5 баллов, в «на заметку» — 3.
источник Nitter RSS (сбор постов) + api.fxtwitter.com (метрики и медиа отобранных карточек); источники по ссылкам вычитаны на ступени вычитки
медиа в assets/ лежит 5 картинок из твитов, вставлено 2. Остальные — логотип репозитория, рекламный баннер карточки модели и скриншот страницы гайда, где порог памяти указан как 22 ГБ вместо 24 ГБ в тексте.
пропущенные handles не зафиксированы: fetch_report.json в рабочей папке отсутствует, покрытие окна по хэндлам проверить нечем