На днях SemiAnalysis опубликовали исследование с довольно убийственным для OpenAI выводом: подписка Claude якобы дает более чем в пять раз больше ценности, чем сопоставимая подписка ChatGPT.
Но как обычно бывает, всё не так однозначно....
Читать далееКогда LLM помещается на одной GPU и получает несколько запросов в минуту, настройка движка инференса обычно заканчивается на выборе модели и типа данных. Проблемы начинаются дальше: модель перестает помещаться в память, растет очередь запросов, длинные промпты съедают KV-кэш, а GPU простаивают в ожидании обмена данными друг с другом.
В этой статье я помогу тем, кто только погружается в мир LLM-инференса, разобраться во всем многообразии настроек одного из самых популярных фреймворков инференса - SGLang.
Разберем пять групп настроек: параллелизм: TP, DP, CP, PP и EP, KV-кэш: Radix Cache и HiCache, вычисления и коммуникации в MoE, attention-бекенд, спекулятивное декодирование. Задача — не перечислить все CLI-флаги SGLang, а понять, что именно в пайплайне инференса меняет каждая настройка и в какой ситуации ее имеет смысл трогать. Поехали!
Читать далееПрограммирование само по себе очень сложная штука, и поэтому программировать надо как можно проще. Именно поиску простых способов программирования и посвящена эта статья.
Давайте я возьму какую‑то простую практическую задачу и решу ее, но не просто так, а как можно проще. Итак...
Читать далееЦены пошли на спад. 22 сентября Anthropic и OpenAI с разницей примерно в полтора часа выпустили модели дешевле своих предшественников, а DeepSeek отдала кэшированный вход по 0,003$ за миллион токенов.
И это не «щедрость». Розничная DDR5 за шесть недель прибавила еще около 9%, аренда H100 за год подорожала на 15%. Изменилось другое — кто и как эту себестоимость оплачивает. Часть удешевления инженерная: это использование кэша, сжатие KV-кэша и появление моделей, которые тратят меньше токенов на ту же задачу.
Другая часть — финансовая, и в сентябре ее масштаб впервые стало видно в цифрах. Давайте разбираться, кто и на чем снизил цены, какие модели теперь выдают только по допуску и что происходит с открытыми весами и железом. Подробности внутри.
Читать далееСейчас почти всё переехало в Telegram: блогеры, авторитетные ресурсы, СМИ — у каждого свой канал.
Утро. Открываю Telegram — счётчик непрочитанного как телефонный номер. Пролистываю: репост, реклама, «доброе утро, друзья», тот же самый инфоповод пятью каналами подряд. Где-то между этим — две вещи, которые мне правда нужны. Выцепляю их за полчаса залипания. Или пропускаю и узнаю последним.
Я перепробовал всё, что обычно пробуют. Папки — аккуратно разложенный завал. «Сохранёнки» — кладбище, куда всё уходит умирать. Отписаться жалко: а вдруг именно тут выйдет то самое.
Подписан на всё, чтобы ничего не пропустить, — и в итоге не читаю ничего. На «быть в курсе» уходит больше часа в день, а в курсе я себя не чувствую.Тут может кто то сказать - "брат тайменеджмент на новости" , но я подумал о том, что в наше время можно как то упростить поток информации.
Читать далееХочу вернуться к теме о возможностях ИИ, поскольку вижу, что некоторые, на мой взгляд, довольно важные и существенные вещи ускользают от внимания — причем не только обычных людей, но и специалистов. Сразу оговорюсь:, я в области ИИ не специалист, опыта у меня здесь «примерно ноль» — но когда я обсуждаю то, что я сделал с его помощью, с куда более опытными коллегами, нередко им приходится объяснять, что такое, вообще‑то, ИИ тоже может делать. Поначалу многие не сильно верят, приходится показывать распечатки...
Ниже — пара примеров того, как это происходило и что вышло. А выводы каждый пускай делает сам.
Читать далее“Оркестр” AI‑сервисов в клинике: почему внедрить ИИ ещё не значит получить пользу
Всем привет! Меня зовут Владлен Бабкин и я — практикующий управленец в медицине. В этой статье мой личный взгляд изнутри операционной реальности медицинской организации, а не обзор технологий. Под БФМ (большими фундаментальными моделями) я понимаю класс моделей, к которому относятся и большие языковые модели вроде тех, что лежат в основе ChatGPT.
Читать далееНаш проект называется ExVRAM Lab. Это открытая исследовательская лаборатория, в которой мы проверяем, насколько большие локальные LLM можно запускать на обычных видеокартах с ограниченным объёмом VRAM, если использовать ultra‑low‑bit quantization, полное размещение весов на GPU и существующие open‑source inference‑технологии.
ExVRAM расшифровывается как Exchange Compute for VRAM. Основная идея проекта — в ряде сценариев выгоднее потратить часть свободной вычислительной мощности GPU на работу с более компактным представлением весов, чем хранить часть модели в оперативной памяти и постоянно передавать данные через PCIe.
Когда мы начинали проект, исходный вопрос был достаточно простой: можно ли запустить dense‑модель примерно на 27 миллиардов параметров на видеокарте всего с 8 ГБ VRAM так, чтобы она не просто «запустилась», а работала полностью на GPU, поддерживала длинный контекст и обеспечивала нормальную интерактивную скорость генерации.
В качестве основной тестовой системы мы используем NVIDIA GeForce RTX 5060 8 GB на архитектуре Blackwell. Основная модель в текущих экспериментах — Qwen3.8–27B.
Сначала результат выглядел не слишком впечатляюще. Модель запускалась, но значительная часть весов оставалась в системной памяти. Около 5,7 GiB весов находилось на GPU, ещё примерно 2,5 GiB — на CPU. Скорость генерации составляла порядка 3,8–5,5 токена в секунду.
При этом сама видеокарта была загружена далеко не полностью.
Это стало одним из первых важных наблюдений проекта. Проблема заключалась не столько в нехватке вычислительной мощности RTX 5060, сколько в том, что часть decoder weights находилась в RAM. Во время autoregressive generation данные приходилось постоянно передавать между CPU и GPU через PCIe.
Читать далееСтавка ЦБ изменилась. Конкурент выкатил акцию. Регулятор ввел новое требование. Вопрос один: сколько времени займет обновление вашей продуктовой линейки? Если от недели до полугода – эта статья для вас.
Читать далееЗадача звучала просто: руководство хотело знать, сколько станки реально работают. Не по словам мастеров и не по журналу, который заполняют в конце смены, а по факту. Счётчик выпущенных деталей вторым приоритетом. Обязательное условие: полностью автоматически, без участия человека.
Станков девять, производители разные, возраст тоже. Я был уверен, что главная сложность будет в Odoo. Оказалось наоборот: Odoo здесь самая спокойная часть, а вся работа ушла на то, чтобы вытащить данные из самих станков.
Читать далееКорпоративный сайт на пяти языках: около сотни страниц, блог, новости и 100–150 тысяч пользователей в месяц. Два года он жил на Webflow. Переезд на Next.js 15 и Payload CMS сейчас на финишной прямой, и шёл он без дня Х: страница за страницей, на одном домене со старым сайтом.
Разбираю, как это устроено. Счёт Webflow по строкам, Next.js под /app на Webflow Cloud и 301-редиректы с пятью локалями, перенос CMS-коллекций в Lexical, next-intl и проверки в CI, которые ловят то, что раньше находил только дизайнер через месяц.
Как это устроеноПривет, Хабр. Я — Влад Куренков, руковожу научной группой «Адаптивные агенты» Института AIRI и сегодня я хочу позвать вас поделать немного распределённой науки. Вот, в чём суть.
Есть такая компьютерная игра NetHack — пошаговый рогалик 1987 года, который до сих пор не может пройти искусственный интеллект. Жизнь у героя одна, сохранений нет, подземелье каждый раз новое, а игра по дороге ничего не подсказывает. Если вы сыграли плохо, то выясняется это тогда, когда ничего исправить уже нельзя. На таких же ошибках спотыкаются ИИ‑агенты, когда пишут код: отдельный шаг они выполняют прекрасно, а на длинной дистанции держать планку им уже сложнее. И NetHack в этом плане становится весьма полезной для проверки агентов.
По этой причине я запустил открытое сообщество людей, которые создают системы планирования ИИ, чтобы вместе решить NetHack. Понятно, что игра — это не ценность сама по себе. Гораздо важнее способ, которым возьмут игру, а также тот факт, что этот способ станет общественным достоянием. Если вы разрабатываете ИИ‑агентов, занимаетесь планированием или пишете игровых ботов, давайте идти к этой цели вместе.
Далее расскажу подробнее про проект NetHackers и наше сообщество.
Читать далееУязвимости, угрозы и инциденты – привычный язык специалистов по информационной безопасности. Совет директоров и инвесторы говорят на другом: потенциальные убытки, длительность простоя, влияние на прибыль. Оцифровка киберрисков переводит одно в другое: технические понятия становятся бизнес-метриками, а киберриски выражаются в тех же единицах, что и другие риски организации. Мы в «Соларе» решили рассказать о методологии, руководствуясь которой в свои проектах, переводим киберриски в вероятности и деньги: что такое оцифровка киберрисков, почему она стала необходимой, из каких этапов состоит и что дает бизнесу.
Оценить риски10 октября стартует новый сезон Школы синтеза цифровых схем. Её проведение рассредоточено по множеству независимых кластеров, в каждом из которых есть свой преподаватель, свои отладочные платы и САПР, и необходимо обеспечить выполнение всех примеров школы на этом зоопарке различных устройств таким образом, чтобы преподавателю не нужно было думать о проблеме вроде: “Этот код точно собирался у меня в BRAM, почему здесь он синтезируется в миллион регистров, сжирающих все ресурсы платы”.
Чтобы избежать подобных проблем был создан репозиторий basics-graphics-music (BGM), добавляющий примерам несколько слоёв абстракции, которые позволяют избежать подобных проблем.
Упор этого года будет сделан на архитектуру RISC-V. Для этого в репозиторий был добавлен пример многопоточной программы, а также несколько RISC-V ядер, включая ядро НИУ МИЭТ, проектируемое на курсе “Архитектуры процессорных систем”. Это стало отдельным испытанием существующих абстракций на прочность: данное ядро проектировалось независимо от репозитория BGM и его абстракций, поэтому его интеграция стала интересным опытом. Подробнее об этом под катом.
Читать далееЧтобы React летал как Vue 3, достаточно забрать у него тяжелые вычисления и переложить их на плоский реактивный граф зависимостей с умным планировщиком транзакций на уровне микрозадач.
Больше реактивностиИтан Сигел (американский астрофизик‑теоретик и научный журналист, автор рубрики «Спросите Итана», один из пропагандистов современных научных знаний), пытается разобрать в одной из ключевых проблем современной физики: Что не так с бозоном Хиггса?
@avshkol сделал перевод статьи, ведь его тоже волнует вот это: Когда в далёком уже 2012 году (24 года прошло!) был обнаружен предсказанный ещё в 1960-х бозон, казалось, что будет решена загадка массы, а значит, и гравитации, а значит, искривления пространства-времени, а там кротовые норы, всякие-разные гипердвигатели... Но воз и ныне там, и как будто мы всё ещё застряли в тех 60-х, когда открыли бозон, и... что дальше?..
Так что не так с бозоном Хиггса?.. или с нашей физикой?.. или с нашими ожиданиями от этого бозона?
Читать далееПривет, Хаброжители! Мы привыкли считать себя хозяевами планеты, но на самом деле люди — лишь 5 процентов всей биомассы, крохотная верхушка в мире растений и микробов. Как мы выживаем в мире, где вирусов в три раза больше, чем людей? Ответ прост: внутри каждого из нас несет службу «килограммовая армия» — около 1,8 триллиона бойцов общей массой 1,2 килограмма.
«Армия иммунитета» — это увлекательный путеводитель по вашему внутреннему министерству обороны. Вы познакомитесь с «мусорными генералами» макрофагами, рядовыми штурмовиками нейтрофилами и элитным подразделением адаптивного иммунитета. Книга объясняет, почему «цветет» синяк, как связаны чистота и аллергия и почему ваша иммунная система — ключ к долголетию. Это честный и ироничный рассказ о том, как клетки умеют воевать без рук, проверять документы без глаз и защищать нас 24/7.
Читать далееОбновили Go до 1.25 и оставили привычный automaxprocs? Пустой импорт теперь может отключить встроенное управление GOMAXPROCS и изменить поведение сервиса под CPU‑квотой. Разбираемся, как новый рантайм работает с cgroup, откуда берётся разница на дробных лимитах и что проверить перед удалением старой зависимости.
Проверить GOMAXPROCSВ Стокгольме огласили имена двух лауреатов Нобелевской премии по химии. Ими стали французский исследователь Анри Борис Каган и японский ученый Соаи Кэндзо (у японцев правильно сперва фамилию, потом имя, и да, звука «е» у них нет). Высокую награду им вручили «за открытие нелинейных эффектов и автокатализа в асимметричном органическом синтезе». На сайте Нобелевского комитета поясняется, что ученые смогли ответить на вопрос, как возникла химическая асимметрия живого. Это явление, при котором молекулы (например, аминокислоты) бывают двух зеркальных видов, но при этом организмы содержат лишь один.
Благодаря Анри Борису Кагану и Соаи Кэндзо ученое сообщество теперь понимает, как может возникать гомохиральность. Их открытия «сыграли решающую роль» для химиков, разрабатывающих реакции для производства фармацевтических препаратов, отмечается в сообщении Нобелевского комитета.
Уверен, что подробные разборы открытий ученых появятся в ближайшие дни. А мы пока разбираемся, что с патентами у данных нобелиатов по химии.
Читать далееВайбкодинг подают как способ собрать миллион за две недели: миллион за 17 дней, миллион к октябрю, миллион с одного промпта. Я проверил, какие проекты реально прошли порог в $100 000 выручки в месяц или миллион заработанных, и сколько из них основаны именно на вайбкодинге, а не просто держат AI внутри продукта.
Разбираю девять кейсов. Medvi: $401 млн за первый год при двух людях в штате. Base44: продан Wix за $80 млн через полгода после запуска. Cal AI: $2 млн в месяц и ярлык, который TechCrunch опроверг. Peec AI и Wave AI: $4 млн и $7 млн ARR при команде в один-два человека. Отдельно четыре проекта, которые кочуют по подборкам, а порог не проходят: fly.pieter.com с пиком $87 000 в месяц, Stanley, Lumoo, Plinq.
Читать далее