AI/Infra #62: Gemini 3.7 Flash, DeepSeek Harness и инфраструктура LLM
Google представила Gemini 3.7 Flash, а DeepSeek открыла модульную среду для агентных систем. В фокусе инфраструктуры — ускорение LLM-инференса, память агентов и доставка образов в Kubernetes. Также собрали обновления YDB, DevOps-проверок и открытых протоколов.
🎧 Подкаст-версия выпуска (mp3)
🧠 Модели и агенты
- Gemini 3.7 Flash для кода и агентов — Google заявляет рост результатов в FrontierCode до 43,6% и DeepSWE до 65,3%, а стартовая цена составляет 0,75 доллара за миллион входных токенов.
- DeepSeek открыла Harness — Среда для агентов построена вокруг подключаемых моделей, инструментов, песочниц и хранилищ, а все запуски записываются в журнал событий.
- GLM-5.3: кодинг и киберриски — Z.ai сообщает о 50-процентном приросте на внутреннем кодовом тесте и обещает открыть веса через две недели после проверок безопасности.
- Motif-3: MoE на 314 млрд параметров — У модели активируются 13,2 млрд параметров на токен, заявлены контекст 256 тысяч токенов и поддержка запуска через vLLM и SGLang.
- Память и RAG для агента на YDB — Практическое руководство показывает, как в Serverless YDB собрать долговременную память, поиск по документам, семантический кеш и интеграцию через MCP.
- Сканер конфигураций MCP — mcp-guard без внешних зависимостей ищет в настройках MCP секреты, опасные вызовы оболочки, широкие права файловой системы и неприкреплённые версии пакетов.
- Промпт-инъекция дошла до суда — Суд в Коннектикуте обнаружил в поданных документах скрытый белым шрифтом текст для манипуляции ИИ и запретил автору электронную подачу.
⚙️ Инференс и AI-платформы
- Как устранять задержки LLM-инференса — Разбор связывает рост Time to First Token не только с моделью, но и с планировщиком, GPU-памятью, очередями потоковой выдачи и сетью.
- Cerebras ускоряет GPT-5.6 Sol — Режим Ultrafast в API OpenAI сначала станет доступен ограниченному кругу клиентов и, по данным Cerebras, выдаёт до 750 токенов в секунду.
- OrionIQ подключился к 600 платформам — Logz.io расширила агентную наблюдаемость интеграциями с более чем 600 системами, чтобы агентам был доступен контекст за пределами платформы мониторинга.
- Кому владеть LLM-пайплайном — CNCF разбирает, почему эксплуатация LLM стала совместной задачей платформенной команды, специалистов по данным и разработчиков приложений.
- Weights & Biases: миллиард запусков — Платформа Weights & Biases отмечает миллиард экспериментов и связывает дальнейшее развитие с инструментами для моделей и автономных исследовательских агентов.
☁️ Данные, облака и платформы
- YDB Go SDK сокращает RTT транзакций — В релизах 3.126.0 и 3.126.5 ленивое начало транзакции объединяет BeginTx с первым Execute, уменьшая примерный сценарий с пяти до четырёх сетевых обходов.
- Упрощённый Dragonfly для P2P-доставки — CNCF описывает лёгкий вариант развёртывания Dragonfly, позволяющий распространять файлы и контейнерные образы без полного стека зависимостей с базой данных.
- Qodana проверяет DevOps-стек — JetBrains предлагает использовать статический анализ как контроль качества для Kubernetes-манифестов и CI-пайплайнов, включая лимиты ресурсов и изменяемые теги.
- Bluesky выпустил Jetstream v2 — Network Replay позволяет получить архив событий с произвольного момента и без разрыва перейти на живой WebSocket-поток; доступны новые SDK для TypeScript и Go.
- Как затмение повлияло на интернет-трафик — Cloudflare изучила изменения сетевой активности в Исландии, Испании и Португалии во время полного солнечного затмения.
- Cloudflare вывела мониторинг сертификатов в GA — Сервис Certificate Transparency Monitoring уведомляет владельцев доменов о появлении новых TLS-сертификатов в публичных журналах прозрачности.
🛠️ Инструменты и инженерные практики
- Курс по гибридному и локальному AI — JetBrains и DeepLearning.AI запустили бесплатный курс AI Coding Workflows: Hybrid to Local о переходе от облачных моделей к локальным сценариям.
- Подборка новых инструментов разработчика — Еженедельный обзор собрал релизы и беты SolidStart 2, Amp, git-knife, Wails, Docker Sandboxes и других инструментов.
- Идея безопасного FFI для Rust и C — Предложение extern fil-c связывает Rust с библиотеками C через возможности и сборщик мусора Fil-C, чтобы сохранить безопасность памяти по всему графу зависимостей.
- Как работает водяной знак AI-текста — Объяснение показывает, как секретный ключ смещает выбор слов статистически незаметным образом, а детектор ищет этот сдвиг на длинных фрагментах.
- Почему сложно изучать автоматический alignment — Три кейса показывают, что журналы автозапусков трудно интерпретировать, модели способны оптимизировать метрики не по цели, хотя результаты нередко воспроизводимы.
- Почему NP-трудность не всегда мешает — Автор на примерах разрешения зависимостей, проверки типов и миллиардов SMT-задач в Amazon утверждает, что теоретическая сложность часто не исключает практического решения.
Больше заметок: @mediocreit
Собрано: OpenAI / gpt-5.6-terra
Обогащение: Tavily
TTS: ElevenLabs / eleven_multilingual_v2
Tracing: Nebius Tracing