У ИИ-агентов, вызывающих функции (function calling, tool use), есть ошибка, которую не видит ни одна из обычных защит. Агент вызывает функцию при невыполненном условии ее применения, когда оно прямо ему не названо, и сообщает об успехе, не называя препятствия. Такую ошибку не замечают проверка схемы, система, отчет самого агента, подтверждение оператора и существующие наборы проверок.
В статье описана методология, которая находит такие ошибки и для каждой указывает место: какое условие нарушено, в каком формате дано поручение и что агент при этом сказал.
Создавая методологию, мы опирались на две общие идеи – о том, что в основе каждого действия лежит некоторое основание, включающее побудительный шаг и условия, при которых произвести действие допустимо, и что правило не содержит правила своего применения, а потому все условия в промпт и схему функции не допишешь, и проверять приходится поведение агента.
Методологию проверяли на трех учебных примерах и пяти конфигурациях моделей, всего более 4200 испытаний, по 10 попыток на ситуацию. К научной чистоте эксперимента мы пока не стремились, делали проверку методологического подхода, поэтому числа в статье имеют характер наблюдения и иллюстрации, это не оценки частот и не строгая доказательная статистика. Основные результаты приводим по Gemini 3.6 Flash через RouterAI (интерфейс, совместимый с OpenAI API) с температурой 1.0 – эта конфигурация записана полностью: модель, канал доступа, температура и дата прогона, 27.09.2026. Тот же стенд прогоняли на Claude в веб-интерфейсе. Там нельзя задать версию модели и температуру, а поверх нашего промпта действует системный промпт интерфейса. Поэтому числа для модели Claude приводим только для сравнения – там, где они показывают другой механизм той же ошибки.
Читать далееОт режиссёра КИНО до режиссёра КОДА: как я создал автономную ИИ-среду разработки EVA Engineer (от промпта до .EXE и .APK)
Читать, скачать, создавать!Это заглавная статья моего дневника разработчика «Вайбкожу Статейник». Я по частям собираю штуку, которая называется Статейник, и параллельно рассказываю, как именно собираю. Части выходят по мере того, как что‑то доделывается или, наоборот, ломается. Эта статья — обновляемый навигатор по всему дневнику.
Читать далееПривет, Хабр! Меня зовут Вика, я HR-менеджер компании «Синимекс». Вместе с командой мы развиваем ИТ-бренд: помогаем инженерам выступать на конференциях, писать статьи и делиться кейсами.
Я хочу рассказать историю о том, как мы в «Синимекс» попытались «автоматизировать хаос» в DevRel-процессах и что из этого получилось. Возможно, наш опыт поможет кому-то сэкономить время и ресурсы.
Мы в «Синимекс» три года развивали техбренд. Инженеры выступали на конференциях, писали статьи. Всю информацию мы оформляли в обычных таблицах (рис. 1).
Читать далееКоманда знает, как выполнять работу, но без руководителя даже типовые задачи начинают зависать: некому подтвердить приоритет или разрешить следующий шаг. На примере трёх заявок разберём, какие ошибки в управлении создают такую зависимость и что изменить в процессе, чтобы решения не сходились к одному человеку.
Проверить процессыИИ уже пишет код быстро и неплохо. Я всё ещё боюсь работать с ним: задач становится больше, день уходит на ревью, а чтобы понять собственный проект, приходится звать ещё одного агента.
Читать далееВсем привет!
В статье «Асимметричная криптография в JavaCard» приводится пример создания канала защищенного обмена сообщениями на сессионных симметричных ключах, вырабатываемых по протоколу ECDH. У этого решения есть два спорных момента: во-первых, сама реализация потребует дополнительных ресурсов на тщательное тестирование, а во-вторых ECDH не обеспечивает аутентификацию сторон. Этот пункт более актуален, т.к. без поддержки апплетом инфраструктуры открытых ключей (PKI) и цифровых сертификатов, он выдаст секреты любому, кто знает параметры эллиптической кривой. Т.е. нужна еще куча времени на разработку и отладку. Преодолеть эти сложности можно одним элегантным решением: использовать механизмы безопасности, предоставляемые «главным по карте» - Issuer Security Domain.
Читать далееБольшинство курсов по FPGA начинаются со слов «установите Vivado». Мы пошли с другого конца: в каждом из 27 уроков есть рабочий виджет, собранный из реальных запусков на нашем стенде. Сначала разбираем, что такое FPGA и как числа становятся битами. Потом пишем спеку на t27, компилируем её t27c и превращаем в битстрим на плате. В конце — лаборатория из трёх уроков о наших собственных исследованиях, включая результаты, которые нам не понравились. Каждая картинка ниже — снимок живого виджета; нажмите, чтобы открыть его.
Читать далееУважаемые читатели, этой статьёй я завершаю свой цикл о взаимодействии бизнеса и ИТ. В ней рассказываю о внедрении, которое признали успешным, хотя людям после перехода стало тяжелее работать.
В этой серии я постарался честно поделиться своими успехами и рассказать о неудачах. Негативный опыт тоже имеет ценность, а иногда учит большему, чем удачный проект. Мне хотелось передать и выводы, и личные переживания, которые за ними стоят.
Понимаю, что вечером в понедельник читать о рабочих проблемах может быть тяжело. Поэтому прошу не судить строго. Это мой личный опыт, и я очень старался рассказать о нём так, чтобы он оказался полезен другим.
Я помню, как сотрудники, работавшие с первичными документами, говорили об этом чуть ли не со слезами. Они ожидали, что новая система сократит ручную работу и поможет быстрее выполнять привычные операции. После перехода им пришлось вводить больше данных, и освоение системы эту нагрузку не сняло. При этом проект признали успешным: компания получила возможности развития, которых не хватало раньше. Заказчик сознательно принял дополнительную нагрузку как цену перехода, но сотрудникам, вводившим первичку, легче работать не стало.
Это последняя статья серии, которая началась с права ИТ приостановить преждевременную реализацию. В предыдущей статье мы разбирали, когда сведений о проекте достаточно для принятия обязательств. Теперь посмотрим, как оценивать результат после запуска и что делать с ожиданиями, которые не оправдались.
Читать далееВ апреле 2026 года я решил ради эксперимента установить на старый смартфон OnePlus 6 Linux (Mobian) и использовать его в качестве сервера. Через некоторое время пришлось немного повозиться, чтобы правильно настроить режим зарядки, чтобы аккумулятор жил в наиболее безопасном и комфортном режиме.
Полгода спустя на нём работают 26 Docker-контейнеров. Рассказываю, что там крутится, как устроены мониторинг, CI/CD, Caddy и Nginx.
Читать далееПять с половиной лет я изучал все, что связано с жанром киберпанка. Мы уже узнали, как совместный труд американских маргиналов, французских художников и японских мангак вылился в целую плеяду потрясающих депрессивных книг, фильмов и аниме о далеком технологичном будущем. Мы узнали что такое киберпанк на самом деле и почему это не «хайтек лоулайф» и теперь нам осталось лишь выяснить, что с ним стало, где он сейчас и — почему все именно так. Заварите чайку, отложите в сторону освежитель воздуха или приятно обопритесь на бабку в автобусе — с вами @Mor-Gott и сегодня мы поставим окончательную точку в истории киберпанка.
Читать целикомЕсть вопрос, который тридцать лет считается риторическим: можно ли вообще построить RAD-парадигму на C++? Ответ очевиден - да, иначе не было бы RAD Studio
А есть второй вопрос, который риторическим совершенно не является: можно ли повторить эту парадигму на классическом C++ без проприетарных расширений, без закрытых библиотек, на голом C++17? Вот на него ответ не очевиден. И именно его мы разбираем в статье.
Читать далееВ салонах красоты администраторы вручную обрабатывают записи клиентов к специалистам. Если сотрудник занят или отлучился, пропущенный звонок превращается в упущенную выручку.
В статье соберём решение, которое автоматически записывает клиентов к мастерам по телефону без участия персонала.
Читать далееБольше 10 лет назад в сети разошёлся короткий скетч «Эксперт» по рассказу Алексея Березина про 7 красных линий. Тот самый, где инженеру Андерсену ставят задачу нарисовать 7 строго перпендикулярных линий, часть из которых — зелёные, часть — прозрачные, а одна — в форме котёнка.
Недавно в Telegram‑канале Романа Тышковского (The Edgers) вышел пост на эту тему. Роман заметил, что современный бизнес регулярно получает точно такие же брифы: расти при дорогих деньгах, удерживать команду в кадровый дефицит и строить стратегию на 3 года при горизонте видимости в 3 месяца. Каждое требование собственника по отдельности разумно и выстрадано его личными рисками, но их сумма превращается в «прозрачного котёнка». Роман делает вывод: в комнате нужны и визионеры, готовые поверить в котика, и реалисты со знанием геометрии.
Этот текст заставил меня вспомнить собственную юность. В момент выхода ролика я автоматизировал процессы движения в крупной железнодорожной транспортной компании. Мы прошли путь от стартапа до выхода на LSE с оборотом $1+ млрд. И я сидел в той самой комнате совещаний в роли Андерсена.
Несмотря на то, что мы к тому моменту выжали максимум эффективности и вышли на 74% гружёного пробега вагона, большую часть международных требований на IPO я видел именно так: 7 красных линий, строго перпендикулярных друг другу. Тогда это казалось чистым абсурдом, гиперболизацией подхода, где ИБД и отчёты важнее реальных результатов «на земле». Прямо как в скетче.
Прошли годы. Я продолжил путь в ИТ‑отрасли и переквалифицировался в то, что получалось лучше всего — в антикризисный менеджмент. Оглядываясь назад, я готов признать: часть тех жестких стандартов была обоснованной. Они структурировали, систематизировали подход и давали рамку.
Читать далееВ этом году платить за зарубежные облака из России стало почти невозможно. С апреля закрыта оплата сервисов Apple, Google Play не принимает платежи с 2022 года, а Notion отключил российских пользователей ещё в сентябре 2024 года. В комментариях к таким новостям всегда советуют одно и то же: поднимите свой сервер и забудьте о подписках. Я решил проверить этот совет на цифрах. Поднял на своём компьютере Immich, Nextcloud, Vaultwarden и AFFiNE, замерил, сколько им нужно памяти, и сравнил стоимость за пять лет с Яндекс 360 и Облаком Mail. Цены собраны 28 сентября 2026 года. Облако выиграло не на любом объёме: есть граница, после которой свой сервер экономит до 175 тысяч рублей за пять лет. Где она проходит и почему её почти не сдвигает даже б/у железо, разберу по порядку.
СчитаемЕсли полистать вакансии на хедхантере или в линкедине, рано или поздно натыкаешься на объявления, где ищут человека с опытом от пяти лет, который умеет читать чужой код без комментариев, разбирается в многопоточке и готов работать с большим объемом кода, написанного без участия людей, причем иногда такие объявления вывешивают те же компании, которые год-два назад рассказывали в пресс-релизах, как заменили агентами и пайплайнами генерации половину джунов и почти весь ручной QA. Над последней строчкой в требованиях зависаешь примерно с тем же выражением лица, с каким читают инструкцию к лекарству, где в побочных эффектах указана сама болезнь.
Год назад над таким объявлением посмеялись бы в курилке, а сейчас похожие вакансии висят в каждой второй ленте, называются по-разному, от вежливого «AI code reviewer» до честного «разгребатель вайб-кода», и за ними почти всегда стоит одна и та же история, когда компания сначала заплатила за то, чтобы убрать людей из процесса, а потом заплатила еще раз и уже дороже, чтобы вернуть их обратно, только теперь на роль уборщиков после банкета, на который их самих не позвали.
Волн технологий, которые должны были отменить программистов, за последние десятилетия было несколько, от визуальных редакторов скриптов до no-code конструкторов, и каждая из них откатывалась примерно по одной траектории, разве что нынешняя делает это заметно быстрее, потому что денег в нее влили столько, что считать убытки начали раньше обычного.
Читать далееЯ не программист. По крайней мере, несмотря на то, что в 2010 году я закончил «Прикладную информатику в менеджменте» (ДГТУ) и учился писать на C++, таковым в настоящее время себя не считаю.
При этом с июля 2026 года я управляю большим продуктом (собственная фабрика аналитики, своего рода ERP внутри компании), код которого пишут ИИ‑агенты. Я даю задачи голосом (не помню, когда в последний раз формировал текст задач на клавиатуре), агенты пишут код, проверяют его и выкладывают новую версию на сайт. Продукт собран на Next.js 16, TypeScript и PostgreSQL. На 1 октября в истории проекта уже более 6500 коммитов и 1.800.000 строк кода.
Код я не читаю. Поэтому между словом агента «готово» и появлением новой версии на сайте стоят автоматические проверки. Их называют «сторожами», сейчас их около двухсот. Если хотя бы один сторож покраснел, новая версия не попадает на сайт, а я получаю в Telegram сообщение «выкат остановлен» со списком красных.
Так я узнаю, готов ли продукт. И несколько раз эти проверки говорили неправду. Ниже пять примеров: что случилось, как мы это заметили и что изменили.
Читать далееНейросеть пишет грамотно, и именно поэтому её текст узнаётся с первой строки: длинные тире, конструкции «дело не в X, а в Y», «важно понимать», «давайте разберёмся». Я столкнулся с этим на Телеграм‑боте, который превращает голосовые сообщения в сценарии для соцсетей, и чинил проблему в три слоя за один день. В статье разберу, как устроен пайплайн бота, почему просьбы в промпте не хватило, почему второй проход нейросети тоже не спас и что в итоге закрыло задачу. Весь код ниже взят из рабочего репозитория, имена переменных я чуть упростил.
Читать далееGitHub переписал движок Copilot: 832 378 строк нового кода, большинство из которых написали ИИ-агенты. По дороге они перегрузили ноутбук, забрали чужие незаконченные изменения и сами разрешили себе пройти проваленную проверку. Инженер Microsoft Стивен Тауб рассказал, как шел перенос и за что все это время отвечал человек.
Читать далееЯ делаю мобильное образовательное приложение. В какой‑то момент понадобилось объяснять пользователям сложные сценарии, где объекты двигаются по строгим формальным правилам, и объяснять не текстом, а видео. Любая неточная траектория или неверно анимированное действие на видео закладывает неверный паттерн. Я собрал для этого конвейер на Remotion и React Three Fiber.
Читать далее