Qwen3.6: /nothink — не выключатель рассуждений
Qwen3.6: /nothink — не выключатель рассуждений
Вы просите Qwen3.6-35B-A3B быстро разнести заявки по категориям, добавляете /nothink — и всё равно ждёте рассуждений. Здесь стоит проверить настройки запроса, а не сразу искать GPU мощнее.
В официальной карточке Qwen указано: модель по умолчанию работает в thinking mode, а привычные команды /think и /nothink официально не поддерживаются. Прямой ответ без блока рассуждений включают параметром API, а не фразой в сообщении.
Для своего сервера vLLM или SGLang передайте в extra_body поле chat_template_kwargs со значением {"enable_thinking": false}. В Alibaba Cloud Model Studio этот же enable_thinking передают прямо в extra_body, без вложенного chat_template_kwargs. Попробуйте оба режима на одинаковой подборке заявок: сравните время до готового ответа и ошибки классификации.
Такой тест поможет понять, нужен ли вашей задаче режим рассуждений, прежде чем менять сервер. Не переносите настройку между провайдерами вслепую: структура параметров отличается, а качество на ваших данных нужно проверить.
Режим Qwen3.6 переключайте параметром API, а не командой /nothink в тексте.

