Text-to-Speech
Определение
Text-to-Speech (TTS) — технология преобразования текста в естественно звучащую речь с помощью нейронных сетей.
Простое объяснение
TTS — как профессиональный диктор, который может прочитать любой текст естественным голосом. Только этот диктор — искусственный интеллект.
Подробнее
Связанные термины
Multimodal AI
Мультимодальный AI — системы, способные обрабатывать и генерировать данные разных типов: текст, изображения, аудио, видео — одновременно.
Image-to-Image
Image-to-Image (img2img) — генерация нового изображения на основе входного с учётом текстового промпта и степени изменения.
RAG
RAG (Retrieval-Augmented Generation) — архитектура, дополняющая LLM актуальной информацией из внешних источников через поиск перед генерацией ответа.
Inpainting
Inpainting — техника заполнения выделенных областей изображения новым контентом, сгенерированным AI с учётом контекста.
