Тот самый рецепт из ролика. Мой аватар в HeyGen был статуей: одна поза, мёртвые паузы каждые две секунды. Оживился за один вечер тремя настройками — и стоит столько же, сколько статичный. Ниже точный порядок с промптами и ценами.
Почему аватар — робот
Причина не в тарифе и не в модели. Их три: выразительность по умолчанию стоит на минимуме (параметр expressiveness = low, если его не передавать), эмоции движок берёт из звука — плоская озвучка даёт плоское лицо, и жестам нужно место — в кадре «по грудь» рукам просто негде жить.
Шаг 1 — звук
Озвучка через движок Eleven v3 (в HeyGen он включается прямо в настройках голоса: engine ElevenLabs, модель eleven_v3). В текст ставишь теги в квадратных скобках — в речь они не попадают, а интонацию меняют:
[excited] Смотри что получилось. [curious] Похоже на трёхмерный движок но это не он.
Правила текста: минимум запятых (движок ставит паузу на 60% знаков препинания), точки — осознанно: на каждой точке аватар «перезапускает» позу. Слова капсом не писать — движок спотыкается.
Шаг 2 — кадр
Фото для аватара — не «по грудь», а сидя, средний план, обе руки полностью в кадре. Промпт для генерации лука (image-to-image от своего эталонного фото):
Сидит в кресле за рабочим столом, монитор в расфокусе, средний план от головы до колен, обе руки видны целиком, руки свободно лежат на подлокотниках
Как только рукам есть место — движок сам начинает ими жестикулировать.
Шаг 3 — движок
Движок Avatar V — самый естественный: мимика, наклоны головы, живые руки. В API это одна строка:
engine: { type: "avatar_v" }
В веб-версии HeyGen — выбор движка Avatar V в настройках видео. Важно: с Avatar V параметр expressiveness не нужен (его вообще отклоняет) — живость берётся из звука и референса движения. Если остаёшься на Avatar IV — там наоборот: expressiveness: high + текстовый motionPrompt с жестом по формуле «часть тела + действие + эмоция», например «hands gesture naturally while explaining, calm and confident».
Бонус — кинопереход
Сцена «поворачивается к монитору, камера наезжает» делается режимом Cinematic Avatar (внутри HeyGen, движение и камера задаются текстом, твой лук идёт референсом лица). Дорого — примерно 4 кредита за секунду против 0,3 у говорящей головы, поэтому один такой переход на ролик, не больше.
Что дальше
Этих трёх настроек в курсе нет — они из моей рабочей кухни, доводка поверх базы. А база в курсе есть: за пятый вечер собираешь своего аватара в HeyGen и получаешь ролик с субтитрами без единой съёмки.