Если нет времени читать всё, то вкратце: в октябре 2025 года отрасль OCR‑моделей для распознавания бухгалтерских документов пережила настоящий взрыв качества их работы. Благодаря этому нам удалось увеличить точность и производительность наших моделей в продуктах ИАД и Сайбокс:
- Сократили длительность обработки счёта с 3–4 минут до 30 секунд с помощью замены тяжёлой Qwen2.5-VL-72B на оптимизированную nanonets‑ocr2-3b.
- На 70% уменьшили объём проверок вручную, что особенно полезно для инструмента по сравнению документов (модель перестала добавлять мусор, не выдумывает числа и не искажает структуру).
- Повысили пропускную способность в 5 раз на том же оборудовании. Сейчас модель весит меньше, и больше ресурсов остаётся на поточную обработку.
- Таблицы теперь распознаются как HTML — за 1 секунду. Раньше приходилось гонять результат OCR через вторую LLM‑модель, чтобы распарсить таблицы.
Если интересно, как мы к этому пришли и какую пользу от проведённого нашей командой исследования получили наши продукты, то заходите.
Статья состоит из двух частей: первая про бизнес, вторая про технические подробности реализации и исследования.
Читать далееLLM генерируют код невероятно быстро, но чтобы гарантировать, что они создают именно то, что задумано, им нужны четкие границы. Абстракции и предметно-ориентированные языки (DSL) создают надежную оболочку, которая направляет LLM с самого начала. Пример Tickloom — предметной модели и DSL для иллюстрации поведения распределенных систем — показывает, как мы можем использовать LLM в качестве партнера для итеративного создания DSL и как естественно-языковой интерфейс для его использования. Такой DSL может выступать в качестве единственного источника истины для программных систем в мире LLM.
Современные LLM обладают невероятными возможностями. Они могут генерировать большие объемы кода, а иногда и целые системы, основываясь лишь на высокоуровневом описании на естественном языке. Важное предположение здесь заключается в том, что «намерение» относительно того, что необходимо построить, четко сформулировано с помощью точных слов, которые LLM могут сопоставить со строительными блоками кода. Однако здесь стоит отметить два важных момента: ограничения предварительной спецификации и то, как дизайн выявляется в процессе реализации.
Читать далееПривет, Хабр! Я разработчик из Минска (работаю официально, в статусе НПД). Занимаюсь автоматизацией на связке Self‑Hosted n8n + Redis. Внедряю автономных ИИ‑агентов для мессенджеров и связываю их с amoCRM.
Поделюсь, как говорится, «мясом» из своей практики. В статье я максимально постараюсь отразить и технический абсурд плавно переходящий в явное кидалово от инфомошенников.
Перед началом сразу обозначу, как говориться, на берегу: во‑первых — это не хейт и не попытка кого‑то «разоблачить». Ленты мессенджеров завалены рекламой от «ИИ‑агентств» и «продавцов успешного‑успеха», которые громко кричат про «...ваш цифровых сотрудников за пару дней...». У меня нет раскрученного профиля с красивыми публикациями, но, есть обычная практика. Данный разбор — это попытка показать (а может кому‑то и знакомо), что скрывается за красивыми нагенерированными видосами и контентом и почему, доверив реальный проект таким «спецам» обойдётся дорого. Во‑вторых — все упоминания брендов и платформ в статье — не реклама и не антиреклама. Названия систем я оставил исключительно ради сохранения контекста, да и в принципе живого отражения примера.
История статьи началась, наверное можно сказать в 2 этапа. На первом этапе, который был ещё наверное в марте этого года, ко мне обратился заказчик с интересным ТЗ: стек Instagram+ amoCRM + Google Sheets при плотном трафике до 5000 диалогов в месяц (таргет что тогда, что по сей день заходит «на ура»). Причём сёстры (заказчик — это семейный бренд ателье дизайнерских украшений) своими силами опробовали «...платформы где платишь подписку и в соответсвии с трафиком выбираешь соответствующий пакет услуг. Итог в который после первого дня триала по самым средним подсчётам вышел бы 1100$ в месяц расхода (!). Поскольку моя статья не о том какая архитектура была в итоге у них развёрнута, так что пойдём дальше.»
Читать далееРазбираемся, что на самом деле умеют membership inference и training data attribution, почему высокий influence score не означает авторства и почему происхождение данных проще сохранить до обучения, чем восстанавливать после.
Со 2 августа в ЕС заработала статья 50 AI Act: генеративные системы обязаны помечать синтетический текст, картинки, аудио и видео машиночитаемым способом. В середине сентября Spotify начнёт вешать ярлык AI Persona на профили несуществующих исполнителей и убирать их из рекомендаций.
То есть на вопрос «это сделал ИИ?» индустрия за год научилась отвечать вполне прилично.
А теперь вопрос с другой стороны. Вы музыкант, у вас двадцать лет каталога. Модель обучалась на чём-то. Как проверить, была ли там ваша конкретная запись — и повлияла ли она на трек, который кто-то сгенерировал вчера?
Короткий ответ: практически никак. Но не потому, что «модель ничего не хранит» — это распространённое и неверное объяснение. Причина сложнее и интереснее.
Читать далееВы когда нибудь задумывались, что можно узнать о вас и про вас из вашей истории переписки в Telegram?
Я подключил к Hermes пользовательскую Telegram-сессию. После этого агент смог искать в моих чатах, читать нужные фрагменты истории, находить контакты, выгружать выбранные переписки в JSONL и, после моего подтверждения, писать от моего имени.
Последний пункт звучит эффектно и немного тревожно. Так и должно быть. Личный Telegram хранит годы разговоров, договорённостей, файлов и случайных деталей, которые я давно забыл. Доступ к аккаунту даёт агенту контекст заметной части моей жизни. Заодно он даёт возможность совершить очень убедительную ошибку от моего имени.
Так начался эксперимент с MTProto, Pyrogram, tgcli и SKILL.md для Hermes. Польза обнаружилась быстро. Ограничения пришлось придумывать почти так же быстро, ещё до первой реальной отправки.
Какие знания можно вытащить из твоего tgPlaydate – крошечная консоль с жёлтым корпусом и процессором, который в эпоху гигагерцев кажется игрушечным. Разрешение – 400x240, один бит, без оттенков серого. Видеочипа нет: всё, что видите, считает скромный ARM-процессор. Казалось бы, какое тут 3D?
Но Кристина Рамос решила проверить, где проходит граница возможного. Начала с рейкастера, а закончила софтверным рендерером, который читает BSP-карты.
Игры Return of the Obra Dinn и Jet Set Radio вдохновили Кристину на монохромный селшейдинг с жирными контурами. В статье она рассказывает, как 1-битный экран Playdate заставил отказаться от фотореалистичных текстур и найти уникальный визуальный стиль для 3D-игры.
Читать далееСегодня профессия разработчика ПО находится в эпицентре потрясений. Никто не знает, к чему нас приведёт ИИ-революция, но ясно одно — многие аспекты работы и повседневной жизни изменятся, в том числе программирование.
В последнее время я часто слышу утверждения, которые сводятся к двум основным идеям: «LLM могут хорошо писать код, но программная часть никогда не являлась самой сложной» и «Программировать легко — сложно понять, что именно требуется напрограммировать».
Как по мне, так это явное оскорбление для всех программистов.
Читать далееПошагово собираем собственный AI-контур на VPS c зарубежным IP: подключаем ChatGPT и Claude через OmniRoute, объединяем модели в LiteLLM и настраиваем Codex, Qwen Code и VS Code для работы без VPN.
Читать далееLLM генерируют код невероятно быстро, но чтобы гарантировать, что они создают именно то, что задумано, им нужны четкие границы. Абстракции и предметно-ориентированные языки (DSL) создают надежную оболочку, которая направляет LLM с самого начала. Пример Tickloom — предметной модели и DSL для иллюстрации поведения распределенных систем — показывает, как мы можем использовать LLM в качестве партнера для итеративного создания DSL и как естественно-языковой интерфейс для его использования. Такой DSL может выступать в качестве единственного источника истины для программных систем в мире LLM.
Современные LLM обладают невероятными возможностями. Они могут генерировать большие объемы кода, а иногда и целые системы, основываясь лишь на высокоуровневом описании на естественном языке. Важное предположение здесь заключается в том, что «намерение» относительно того, что необходимо построить, четко сформулировано с помощью точных слов, которые LLM могут сопоставить со строительными блоками кода. Однако здесь стоит отметить два важных момента: ограничения предварительной спецификации и то, как дизайн выявляется в процессе реализации.
Читать далееПривет, Хабр! Меня зовут Лиза, и я занимаюсь продуктовым маркетингом в команде OpenYard. В моей работе довольно много общения с продуктовой и инженерной командами, а некоторые задачи позволяют буквально поучаствовать в формировании облика будущего оборудования. Совсем недавно мы выпустили защитную панель для сервера — об этом можно почитать в моей предыдущей статье. Сегодня речь пойдёт о вещи значительно менее заметной, но от этого не менее полезной: сервисных наклейках, которые помогают пользователям ориентироваться в оборудовании при его эксплуатации и обслуживании.
Читать далееПривет, Хабр!
Давайте представим, что вам в ближайшем будущем предстоит собеседование. Что именно вы прошли все автоматические фильтры на HH, и вот оно - заветное приглашение пообщаться на тему вакансии.
Собственно, сначала внутри даже как будто что‑то радостно подпрыгивает, не зря старался. А через пару минут – привет, паника. И ты начинаешь успешно себя накручивать. Так-то вроде бы речь всего лишь о разговоре с людьми. Без разницы, в офисе или по видеосвязи. А ощущается это как подготовка к экзамену. И на кону как будто не только работа, но и право считать себя… хорошим специалистом.
Предстоит пройти разные этапы, конечно же, дать правильные ответы на неудобные вопросы, а еще ты должен кучу всего знать практически наизусть. Вообще это очень нервная история. Ведь тебе предстоит встреча с людьми, которые в ближайший час будут решать, подходишь ты или нет. И ты при этом не знаешь, по каким их внутренним линейкам тебя будут мерить. В каком они настроении? Есть ли у них уже любимый кандидат? А может, наоборот, они мечтают, что хоть кто‑нибудь адекватный уже наконец придет? И в этом нервяке очень легко уронить свою самооценку.
Хотя по факту стресс здесь вполне закономерен. Мозг не обязан сохранять дзен, когда ситуация одновременно и значимая, и неопределенная. Сложность не в том, что ты волнуешься. С этим как раз все в порядке. Проблема в том, что ты упорно пытаешься притвориться бодрым, уверенным в себе человеком, который не испытывает никакого волнения. И вот из-за этого как раз ты теряешь живость, юмор, нормальные человеческие реакции. В итоге на собеседование вместо тебя приходит какой-то задубевший персонаж, который говорит шаблонными фразами и сам себе не верит.
Читать далееВ середине 90-х самым крутым, что можно купить для PC, если не считать невероятно дорогой Intel Pentium, был привод CD-ROM. Благодаря ёмкости дисков в 640 МиБ (в три раза больше, чем жёсткий диск PC на то время), CD позволяли любителям технологий погрузиться в мир мультимедиа, состоящий из фотографий с 256 индексированными цветами и высоким разрешением 640x480[1], саундтреками VOC и плавными видео Video For Windows с частотой 12 кадров в секунду в разрешении 240x179[2][3], длящимися аж десятки секунд.
С точки зрения разработчиков видеоигр, CD-ROM был странным носителем. Его ёмкость намного превосходила качество ресурсов, которые они могли создать. Некоторые игры, например, 7th Guest (1993 год), Wing Commander III: Heart of the Tiger (1994 год) и Phantasmagoria (1995 год), познакомили игроков с Full Motion Video (в мире, где анимированной могла быть только часть экрана). В других играх появилась высококачественная музыка. Самым запомнившимся мнением по этой теме стало высказывание ведущего разработчика id Software Джона Кармака.
Люди ожидают, что в CD-играх будет куча оцифрованной речи и видео [...] Смешно то, что если мы когда-нибудь выпустили бы CD-версию DOOM, то там была бы только игра и часовой фильм «Как мы делали DOOM» с участием разработчиков.
Джон Кармак в интервью «ATARI EXPLORER ONLINE», январь 1994 года
Хорошо в теории, плохо на CD
К июню 1996 года, спустя три года упорного труда, id Software завершила свой новый проект — Quake. Как и в случае с Doom, компания собиралась выпустить и shareware-версию, и полную версию игры. Так как она занимала всего 22 МиБ, люди из id Software решили попробовать занять оставшееся свободным место на CD-ROM. Почему бы не записать туда зашифрованные версии всего каталога игр id? Это позволит не только избавиться от посредников, но и мгновенно покупать игры, совершив лишь один телефонный звонок и воспользовавшись кредитной картой.
В итоге эту концепцию реализовали. О выпуске CD было объявлено[4] 3 июля 1996 года, а сам он выпущен 30 августа[5]. Всего 39 дней спустя[6] хакерская группа GNOMON выпустила Quakecrk.zip. В архиве содержался инструмент QCRACK.EXE, позволявший расшифровать все игры с CD-ROM.
Читать далееСпециалисты Лаборатории цифровой криминалистики и исследования вредоносного кода компании F6, российского разработчика технологий для борьбы с киберугрозами, представили исследование атак, техник и инструментов APT-группировки GOFFEE. Криминалисты F6 исследовали атаку кибершпионов на одну из российских компаний. В ходе реагирования на инцидент выяснилось, что атакующие уже давно контролируют множество устройств в сети компании. В частности, для захвата устройств злоумышленники подменили в корпоративных хранилищах разрешённого ПО легитимные программы 7-Zip и Git, а также установочные ISO-образы Windows-систем на вредоносные модификации.
Читать далееХабр, привет! Я Тимур, в ИТ-кластере РСХБ отвечаю за сотрудничество с госорганами, профессиональными сообществами и вузами. Дружить с вузами — больше не благотворительность, а новая обязанность, от которой зависит ИТ-аккредитация. В 2026 году условия для её подтверждения изменились: ИТ-компании должны подтвердить, что реально вложились в подготовку ИТ-кадров.
Акцент в законодательстве сделан на то, чтобы ИТ-компания не просто пришла в вуз и отдала деньги, а чтобы бизнес принимал предметное участие в образовании. В этой статье расскажу, зачем инженеров ставят у доски, и сформулирую рекомендации по взаимодействию с учебными заведениями.
Привет, Хаброжители! Искусственный интеллект стремительно развивается, и именно большие языковые модели (LLM) задают направление всей индустрии. Погрузитесь в процесс проектирования, обучения и развертывания LLM в реальных бизнес-задачах, опираясь на лучшие практики MLOps. Авторы шаг за шагом показывают, как создать экономичную, масштабируемую и модульную систему на основе LLM. Вместо простых экспериментов в изолированных блокнотах Jupyter научитесь строить комплексные системы, готовые к полноценной эксплуатации.
Читать далееРеальный кейс с nested grids в GridStack:
— почему подход на addGrid() привёл к ручной синхронизации DnD, проблемам с lifecycle и множеству фиксов;
— как переход на subGridOpts упростил архитектуру и сделал поведение стабильным.
Читать далееСервер стал мощнее, а p99 внезапно вырос втрое — при свободной памяти и почти пустом CPU. В статье разбираем, как NUMA влияет на задержки, где искать удалённые обращения к памяти и когда привязка к узлу помогает, а когда только мешает.
Читать разборПривет, Хабр. Меня зовут Кирилл Балашов, я инженер-программист компании РЕД СОФТ. Мы в РЕД СОФТ изучили подходы к иммутабельным, или же неизменяемым операционным системам, сравнили полностью иммутабельную модель и гибридную, и выбрали гибрид для неизменяемого варианта РЕД ОС 8. Сегодня я расскажу, почему такая операционка удобнее для решения определённого круга enterprise-задач и покажу, как она работает.
Читать далееПрезидент и сооснователь OpenAI Грег Брокман попросил ChatGPT проверить безопасность собственного сайта — и получил список из 13 проблем за четверть часа. Сайт при этом самый скучный из возможных: статичная страница на AWS, спрятанная за Cloudflare, ломать там на первый взгляд нечего. Модель (публичная GPT-5.6 Sol, никаких внутренних сборок) нашла, что для домена не настроена защита от подделки писем — любой мог рассылать почту от имени Брокмана; что в коде страницы висит древняя версия JS-библиотеки jQuery с известными уязвимостями; и что трафик между Cloudflare и сервером на AWS ходит по обычному нешифрованному HTTP.
Читать далееФреймворки дают клиентский роутинг из коробки. У HTML и Web Components его нет. Если сайт уже отдаёт полные страницы, а клиентская навигация нужна только для части разделов, переписывать всё на фреймворк незачем.
Aura Router решает эту задачу, сохраняя HTML исходной точкой: маршруты объявляются как Custom Elements, а ссылки остаются обычными <a href>. Без JavaScript те же URL открываются как обычные страницы.
В статье соберём минимальный сайт из двух страниц и проверим прямой заход по URL, клиентскую навигацию и работу ссылок без JavaScript.
Читать далее