Все новости
Ежедневный обзор

Главные новости ИИ и GPU за день

3 практических материалов об ИИ и GPU, опубликованных в нашем Telegram-канале 2026-10-09.

10 октября 2026

Главные новости ИИ и GPU за день
Искусственный интеллект1/3

Qwen3.5-27B: модель видит не каждый кадр

Qwen3.5-27B: модель видит не каждый кадр

Вы дали модели видео, а короткое появление предмета она пропустила. Прежде чем менять prompt или GPU, проверьте, какие кадры до неё дошли. У Qwen3.5-27B от команды Qwen поддержка видео не означает просмотр каждого кадра исходного файла.

В официальном примере обработки видео указаны fps=2 и do_sample_frames=True: кадры выбираются с заданной частотой. Это частота отбора для модели, не частота съёмки. Поэтому запись с плавным движением может поступить на анализ как редкая последовательность снимков.

Возьмите короткий ролик с событием, время которого вы знаете. Сохраните кадры после предобработки и проверьте, попал ли туда нужный момент. Затем в поддерживаемой конфигурации vLLM сравните отбор при fps=2 и fps=4, не меняя вопрос и разрешение. Для настройки fps через запрос карточка требует запуска vLLM с параметром --media-io-kwargs '{"video":{"num_frames":-1}}'.

Сравните найденные события, время ответа и пиковую VRAM — память GPU. Так вы проверите цену более частого отбора на своей нагрузке. Даже большее число кадров не гарантирует правильного ответа: модель может неверно понять видимое.

Сначала проверьте, увидела ли модель нужный момент, и только потом оценивайте её ответ.

Искусственный интеллект2/3

Покажите ИИ не только простые примеры

Покажите ИИ не только простые примеры

Вы просите ИИ распределять обращения по темам. На коротких фразах всё получается, а сообщение сразу о двух проблемах уходит не туда. Вместо ещё одного очевидного примера покажите, как поступать в спорном случае.

В руководстве Anthropic по работе с Claude советуют подбирать разнообразные примеры, включая пограничные случаи. Это нужно, чтобы модель не перенимала случайные закономерности. Для вашей задачи полезно показать не только уверенный ответ, но и момент, когда стоит остановиться и уточнить.

Попробуйте такой prompt: Определи тему обращения: оплата, доступ или уточнить. Примеры: «Дважды списали деньги» → оплата; «Забыл пароль» → доступ; «Оплатил, но войти не могу» → уточнить. Если подходят две темы или данных мало, выбери «уточнить». Верни только одну метку. Обращение: [текст]. Здесь третий пример задаёт ваше правило обработки неоднозначности, а не универсально правильный ответ.

Проверьте этот prompt на новых обращениях, которых не было в примерах, и заранее определите ожидаемые метки. Удачный ответ на знакомую фразу ещё не показывает, как помощник справится с реальной очередью.

Показывайте ИИ границу решения, а не только очевидные случаи.

GPU и инфраструктура3/3

Медленный ответ: проверьте очередь перед заменой GPU

Медленный ответ: проверьте очередь перед заменой GPU

Вы отправляете запрос, а первые слова появляются с задержкой. Хочется сразу взять GPU мощнее. Но сначала стоит понять, где проходит ожидание: до начала обработки или уже во время работы модели.

В документации vLLM эти этапы измеряются отдельно. Метрика vllm:request_queue_time_seconds показывает время в очереди, а vllm:request_prefill_time_seconds — время от назначения на выполнение до первых выходных токенов, фрагментов ответа. Это как очередь у кассы и само обслуживание: для посетителя долго и то и другое, но причины разные.

Для проверки возьмите один набор запросов с одинаковыми ограничениями длины ответа. Прогоните его сначала с небольшой, затем с обычной для вашего сервиса одновременной нагрузкой. Сравните время очереди и prefill за каждый прогон. Если растёт прежде всего очередь, следующий шаг — проверить лимиты параллельной обработки и доступную ёмкость сервиса, а не объявлять модель медленной.

Такая проверка помогает выбрать, что исследовать дальше, но не заменяет диагностику. Длинная очередь сама по себе не доказывает нехватку GPU: по одной метрике причину не определить.

Перед заменой GPU отделите ожидание в очереди от обработки запроса.