Um clone útil para apresentar cursos precisa continuar parecendo e soando como a mesma pessoa depois da primeira frase. Isso envolve mais do que sincronizar uma boca: timbre, sotaque, dentes, olhar, postura, ritmo e gestos precisam funcionar juntos. Esta pesquisa examina como produzir uma representação autorizada de Pablo para cursos, publicidade, vídeos institucionais, redes sociais e, em uma etapa separada, conversas ao vivo.
O recorte é 5 de setembro de 2026. A análise considera ferramentas comerciais, código e pesos disponíveis, implantação em Linux/Docker, uma RTX 5090 de 32 GB e alternativas para GPUs menores. O documento é uma pesquisa e um projeto operacional; nenhum clone foi criado, nenhuma biometria foi enviada e os modelos não foram executados nesta máquina.
Resumo executivo
Minha recomendação inicial é manter duas rotas: HeyGen como referência comercial de qualidade e produtividade; MuseTalk com voz local ou externa como referência de controle e custo. Acrescentaria Hedra para comparar expressividade a partir de foto, LongCat-Video-Avatar 1.5 para avaliar geração local mais ambiciosa e Synthesia quando a edição de cursos e a governança corporativa forem mais importantes que liberdade cinematográfica. São prioridades para teste, não vencedores de um benchmark que não foi realizado.
Para o Portal IDEA, a primeira produção deveria alternar apresentador, slides e demonstrações de tela. Uma aula de 30 minutos não precisa ter 30 minutos de rosto sintético. Manter sua voz consistente durante a aula e usar o avatar em introduções, transições e explicações específicas reduz custo e exposição a artefatos sem sacrificar a autoria.
As descobertas que mais alteram a decisão são:
- Não parar nas versões de 2024/2025. Já existem HeyGen Avatar V, LongCat-Video-Avatar 1.5, SoulX-FlashHead, SoulX-LiveAct, Qwen3-TTS e Chatterbox Multilingual V3. Os modelos mais famosos não são necessariamente os mais atuais.
- Foto animada, clone treinado e vídeo reencenado não são equivalentes. Uma foto não contém seus gestos habituais. Um sistema pode produzir uma pessoa visualmente convincente sem preservar sua maneira de apresentar.
- Vídeo-base real é uma alternativa forte. Conservar postura, roupa e gestos gravados e substituir a fala pode ser mais previsível que regenerar o corpo inteiro. O preço dessa estabilidade é menor liberdade e eventual repetição de movimentos.
- Sua RTX 5090 é muito útil, mas não substitui uma GPU de 80 GB. Há modelos viáveis de sincronização e voz; vários geradores de corpo inteiro exigem quantização, offload ou hardware maior. FPS do arquivo não é velocidade de geração.
- Licença do código não resolve a licença dos pesos. Wav2Lip aberto e os pesos padrão de F5-TTS, por exemplo, não devem entrar automaticamente em produção comercial. LivePortrait requer atenção aos modelos de reconhecimento facial usados no processamento.
- Plano de site e API podem ter preços e recursos diferentes. Também há avatares criáveis pelo editor que não podem ser criados ou utilizados por determinada API.
- OpenAI tem custom voices, com acesso restrito. Já a API Sora está oficialmente programada para desligamento em 24/09/2026; não é uma escolha sensata para iniciar esta infraestrutura.
- Privacidade precisa ser contratual e técnica. “Seu conteúdo é seu” não significa que a empresa não o usará para treinamento. Exclusão do avatar, exclusão dos arquivos e retenção de consentimento podem seguir regras diferentes.
Fontes das mudanças: HeyGen e privacidade, LongCat-Video, SoulX-LiveAct, OpenAI: vozes personalizadas, OpenAI: descontinuações.
Metodologia e critérios
A pesquisa combinou documentação, changelogs, páginas de preços, políticas de privacidade, arquivos de licença, model cards, artigos dos autores, repositórios oficiais e relatos identificados de usuários. O levantamento foi dividido entre avatares comerciais, modelos visuais locais e vozes, com consolidação de arquitetura, custos, segurança e protocolo de avaliação.
As buscas foram ampliadas a partir dos projetos conhecidos até encontrar sucessores e famílias recorrentes. A lista inclui ferramentas relevantes e projetos experimentais; não transforma todo repositório encontrado em recomendação de instalação.
Como interpretar as informações
| Indicação | Significado |
|---|---|
| Confirmado na documentação | O fornecedor ou autor publica o recurso, requisito ou preço; não significa que seu resultado pessoal tenha sido testado |
| Resultado dos autores | Medição apresentada no artigo/repositório, no hardware e configuração indicados |
| Relato independente | Observação de alguém que usou o sistema; pode conter viés de seleção, patrocínio ou configuração diferente |
| Avaliação editorial | Julgamento de adequação baseado nas evidências, explicitamente não uma medição laboratorial |
| Cenário estimado | Cálculo com premissas declaradas, substituíveis por suas medições |
| NC | Não confirmado publicamente nesta pesquisa; não deve ser lido como “não existe” |
| Condicional | Depende de plano, autorização, versão, pesos, integração ou contrato |
Datas de push, commits e releases são sinais distintos. Um push pode ocorrer em outra branch ou apenas alterar documentação; estrelas indicam interesse, não qualidade. A API pública do GitHub atingiu seu limite de consultas durante parte da auditoria, e as lacunas foram mantidas como lacunas, sem contornar a restrição.
Preços estão em dólares, sem impostos, câmbio, IOF ou descontos negociados, salvo indicação diferente. “Minuto” pode significar vídeo gerado, vídeo aproveitado, fala sintetizada ou sessão ao vivo inteira. A pesquisa explicita essas diferenças. Recursos e termos de serviços web podem mudar após esta data.
Não houve teste de clonagem, escuta comparativa controlada das vozes de Pablo, renderização local, medição elétrica nem auditoria jurídica integral. As demonstrações consultadas sustentam descoberta e desenho do teste; não autorizam afirmar que um sistema é indistinguível de uma gravação real.
1. O que exatamente você está tentando clonar
Cinco camadas independentes
| Camada | O que representa | Como costuma ser produzida | Falha frequente |
|---|---|---|---|
| Identidade visual | Rosto, cabelo, barba, proporções e detalhes | Foto de referência, vídeo de treinamento ou modelo 3D | Rosto muda entre tomadas |
| Voz | Timbre, sotaque e características do locutor | TTS condicionado, fine-tuning ou conversão de voz | Parece sua voz, mas com outro sotaque ou ritmo |
| Articulação | Boca e mandíbula acompanhando fonemas | Modelo de lip-sync ou geração audiovisual conjunta | Dentes instáveis, boca atrasada, vogais exageradas |
| Performance | Olhar, expressões, cabeça, mãos e corpo | Áudio, comandos, vídeo-guia ou captura de movimento | Gestos genéricos e repetidos |
| Conteúdo e comportamento | O que o apresentador diz e pode fazer | Roteiro aprovado ou agente com regras e fontes | Afirmação errada dita com sua aparência |
Para vídeos gravados, um roteiro revisado pode resolver a última camada. Para atendimento ao vivo, ela se torna um problema próprio de produto, segurança e responsabilidade. Um rosto convincente aumenta a expectativa de que a pessoa representada endossa cada resposta.
Tipos de sistema
Talking head a partir de foto: recebe uma imagem e áudio. É rápido para experimentar personagens e enquadramentos; não aprende necessariamente sua atuação pessoal. Hedra, Kling Avatar e vários modelos locais pertencem a esta família.
Digital twin pessoal: recebe material de uma pessoa e cria uma identidade reutilizável. A implementação pode combinar vídeo, reconstrução, condicionamento e modelos generativos. “Treinar um avatar” no painel não permite concluir que exista um checkpoint individual exportável.
Vídeo-base com nova fala: preserva grande parte da gravação original e altera a região facial. MuseTalk e LatentSync são exemplos relevantes. É uma boa rota para corrigir, traduzir e reaproveitar takes, mas gestos semanticamente errados continuam errados.
Transferência de performance: um vídeo-guia dirige expressão e, em certas modalidades, corpo de outra representação autorizada. Runway Act-Two e modelos de pose podem dar direção mais precisa que áudio sozinho. A performance de entrada continua sendo um custo de produção.
Avatar 3D: usa malha, rig, materiais e animação, com ferramentas como Audio2Face e engines 3D. Traz controle explícito de câmera e roupa, mas criar um duplo 3D fotorrealista fiel é um projeto artístico maior que instalar um talking-head.
Avatar conversacional: recebe áudio ou texto em fluxo e transmite vídeo de volta. Precisa de gerenciamento de turno, interrupção e transporte, não apenas de um modelo capaz de renderizar rapidamente.
O que é realista esperar em 2026
Um apresentador de meio corpo, câmera fixa, fala clara e roupa simples é um objetivo mais previsível que seu duplo andando, manipulando objetos e falando por meia hora em um único plano. É possível gerar resultados fortes nos dois casos, mas o segundo exige mais seleção, direção e descarte.
Uma saída 4K não comprova poros naturais, anatomia correta ou estabilidade temporal. Pode ser uma ampliação de um rosto pequeno. Da mesma forma, “suporta português” pode significar apenas aceitar áudio externo, sem que o TTS integrado preserve seu sotaque brasileiro.
2. Como comparar as arquiteturas para seu caso
| Estratégia | Identidade | Movimento | Produção em volume | Controle sobre dados | Melhor aplicação |
|---|---|---|---|---|---|
| Gravação real + edição | Referência máxima | Seu movimento verdadeiro | Exige novas gravações | Alto se processamento local | Conteúdo importante, demonstração física e publicidade sensível |
| Vídeo seu + voz nova + lip-sync | Tende a preservar enquadramento e corpo | Limitado ao vídeo-base | Bom com biblioteca de takes | Alto em execução local | Aulas, correções e traduções |
| Foto sua + áudio | Depende do modelo e da imagem | Gerado, não necessariamente seu | Operação simples; descarte variável | Alto local, contratual em SaaS | Clipes, variações de cenário e protótipos |
| Avatar pessoal comercial | Depende da captura e do modelo | Gerado ou condicionado ao material | Editor e API podem facilitar muito | Dependência do fornecedor | Catálogo recorrente de vídeos |
| Performance sua + render generativo | Boa direção, identidade ainda exige revisão | Controlado pelo take-guia | Mais trabalho por cena | Depende do motor | Publicidade e atuação expressiva |
| Duplo 3D com rig | Controlável, porém caro de construir bem | Animação explícita | Reutilizável após produção inicial | Alto se assets e execução próprios | Personagem institucional, experiência interativa e câmera livre |
Esta tabela é uma análise de arquitetura, não uma classificação medida de qualidade. A solução mais adequada pode misturar duas linhas: vídeo real no começo de um módulo, avatar em atualizações e captura de tela no conteúdo técnico.
Para Pablo, eu evitaria começar pelo duplo de corpo inteiro caminhando. Começaria com dois enquadramentos aprovados: busto para explicações e plano médio com mãos para introduções. A identidade visual deve permanecer estável antes de adicionar roupas, cenários e movimentos novos.
3. Plataformas comerciais de avatar
Visão geral
| Serviço | Tipo mais relevante | Material para criar o clone | Vídeo/API | Ponto forte | Limitação decisiva | Situação em 05/09/2026 |
|---|---|---|---|---|---|---|
| HeyGen | Digital Twin, Avatar IV e V | IV recomenda 2–5 min; V anuncia referência curta, conforme fluxo | Editor, API assíncrona e LiveAvatar | Equilíbrio entre fidelidade, produção e ecossistema | Créditos mudaram; criar Twin via API exige Enterprise | Ativo; Avatar V é atual |
| Synthesia | Personal Photo, Studio, treinamento | Foto + consentimento ao vivo, ou sessão de estúdio | Editor; API não atende todos os tipos | Cursos, tradução, SCORM e governança | Personal Photo recomendado não é suportado pela API | Ativo; Personal Video tornou-se legado |
| Tavus | Replica + conversa em tempo real | Cerca de 1 min no fluxo atual, mais consentimento | MP4, API, Daily/WebRTC e LiveKit | Interação e arquitetura de agentes | Página de preços tem tabelas conflitantes | Ativo; Phoenix-4 atual |
| LiveAvatar | Avatar conversacional HeyGen | Clone disponível nos planos adequados | Full e Lite, streaming | Integração em tempo real e modo “avatar only” | Qualidade e cobrança não equivalem ao Avatar V offline | Ativo; docs de créditos conflitam com site |
| Captions/Mirage | AI Twin e Mirage Avatar X | Gravação guiada; Looks e fotos opcionais | Editor e API X | Edição rápida, variações e conteúdo social | API X custa US$9/min e limita 2 RPM | Ativo e em transição de produtos |
| D-ID | V3 Instant/Pro e V4 Expressive | >=1 min Instant; >3 min Pro; consentimento | API assíncrona, WebRTC e LiveKit | Vários níveis, agentes e clonagem de voz | Plano barato tem marca e licença pessoal | Ativo; V4 lançado em 2026 |
| Hedra | Character-3/Avatar | Imagem + áudio, sem treinamento persistente obrigatório | Web e API, até 600 s | Expressividade e bom ponto de comparação | Não aprende automaticamente seus maneirismos | Ativo |
| AKOOL | Custom, Talking e Streaming Avatar | Vídeo, voz e consentimento conforme produto | API e streaming | Catálogo amplo, 1080p/4K em produtos distintos | Preço monetário da API não ficou legível na página dinâmica | Ativo; cotação necessária |
| AI Studios/DeepBrain | Avatar customizado e interativo | Vídeo + consentimento; fornecedor promete criação rápida | Editor e produto interativo | Produção corporativa, editor e 4K em planos | “Ilimitado” não cobre todo recurso premium | Ativo |
| Colossyan | Instant, Studio e NEO 2 | Foto/20 s para Instant; sessão de ~1 h para Studio | Editor e API | L&D, quizzes, interatividade e SCORM | NEO e NEO 2 usam cotas diferentes | Ativo |
| Elai | Selfie e Studio | Add-ons de avatar e voz | Editor e API em planos pagos | Integração com treinamento/Panopto | Assinatura, avatar e voz são cobranças separadas | Ativo, ligado ao Panopto |
| Vidnoz | Avatar Lite e Pro | Foto ou produção Pro | Editor e API | Entrada barata e grande oferta | Promoções, cotas e campos dinâmicos dificultam orçamento | Ativo; bom para amostra, não prova de topo |
| VEED | Avatar no editor e Fabric 1.0 | ~2 min para custom no editor; imagem+áudio no Fabric | Editor; Fabric via API/fal | Acabamento e edição num só lugar | Fabric não é o mesmo clone persistente do editor | Ativo |
| Creatify | Custom persona e UGC | Imagem, vídeo ou prompt; consent video na API | API personas_v2 | Campanhas e variações em lote | Avatar ocupa slot e a tarifa varia por motor | Ativo |
| Argil | Clone pessoal e edição automática | Captura guiada | Editor e API | Conteúdo social e BYOK de voz | Site e documentação exibem preços incompatíveis | Ativo; confirmar no checkout |
| Gan.ai | Instant Avatar/GanOS | Materiais por produto | Studio e API | Personalização de campanhas em escala | Créditos Studio e GanOS não são intercambiáveis | Ativo |
| Hour One, adquirida pela Wix | Plataforma histórica | Historicamente captura customizada | Histórico de editor/API | Referência do mercado anterior | Site indisponível; adquirido pela Wix | Não recomendar nova contratação |
“Ativo” indica serviço ou documentação acessível, não teste de solvência, suporte ou qualidade. Nenhum fornecedor acima ofereceu publicamente a exportação dos pesos do clone para migrá-lo a outro motor. Baixar MP4 não é possuir um modelo portátil.
HeyGen: a referência comercial a ser desafiada
O HeyGen merece entrar no benchmark porque combina clone pessoal, editor, tradução e API. O fluxo do Digital Twin IV orienta gravar alguns minutos e enviar um consentimento separado. O Avatar V, mais novo, enfatiza um Video Look capaz de conservar identidade e movimento de uma referência curta. Isso não significa que os dois fluxos usem o mesmo treinamento nem que o V sempre supere o IV em cada rosto. Criação do Digital Twin IV, Avatar V, relatório e demos do Avatar V.
Os planos web atuais usam créditos. Creator custa US$29/mês e entrega 600 créditos; Pro parte de US$49 por 1.000. As taxas consultadas foram 16 créditos/min para IV Photo, 31 para IV Video Look e 48 para Avatar V. Se todos os 600 créditos fossem consumidos num único motor, seriam aproximadamente 19,4 minutos de IV Video Look ou 12,5 de V, antes de outras funções. O artigo de créditos menciona V Photo, enquanto o guia do V diz que só existe Video Look; a inconsistência deve ser confirmada no painel. Planos, consumo de créditos.
Na API empresarial, a tabela é outra: cada crédito custa nominalmente US$0,50 e os Digital Twins IV e V consomem 0,1 crédito por segundo, equivalentes a US$3 por minuto antes de condições contratuais. Esse valor não deve ser confundido com a cobrança avulsa de aproximadamente US$4/min em 720p/1080p ou US$5/min em 4K usada na comparação adiante. Preços Enterprise da API, preços avulsos da API.
Na API pré-paga, IV/V Digital Twin custa aproximadamente US$4/min em 720p/1080p e US$5/min em 4K. Criar o Twin pela API exige Enterprise, embora gerar com um avatar já disponível seja outra operação. O endpoint de vídeo é assíncrono e há webhooks; a chave deve ficar no servidor. Preço de API, geração V3, webhooks.
Há uma ressalva contratual importante: a política de 11/08/2026 permite usar inputs para melhorar modelos e oferece opt-out por contato; a página de segurança afirma que clientes Enterprise são excluídos por padrão. O aviso biométrico trata separadamente consentimento para criação, verificação e treinamento. Política de privacidade, segurança, aviso biométrico.
Synthesia: a escolha orientada a treinamento
O guia atualizado diferencia produtos que muitas comparações misturam. Personal Avatar from Photo com Express-2 é a recomendação atual para uma pessoa real e admite mais flexibilidade visual e mãos. O antigo Personal Avatar por vídeo aparece como legado. Custom Studio Avatar preserva a aparência capturada e pode ter fundo transparente e acesso por API, porém a própria matriz informa que não oferece gestos de mãos. O Personal Photo recomendado não funciona na API. Comparação oficial, criação por foto, tecnologia de avatares.
Starter custa US$29/mês e Creator US$89/mês; os valores anuais efetivos consultados eram US$264 e US$804. O Studio é um adicional de US$1.000/ano e informa processamento de até dez dias. Creator possuir API não remove a restrição do tipo de avatar. Preços, planos.
Para aulas, a vantagem não é “parecer mais humano em qualquer cena”. É ter um editor previsível, colaboração, tradução e recursos de treinamento. Eu o colocaria no teste de três minutos mesmo assim: se a percepção de Pablo ficar mais rígida que no concorrente, suas funções corporativas não compensam em anúncios centrados na pessoa.
Tavus, LiveAvatar, D-ID, Anam e LemonSlice: tempo real
O Tavus separa Replica (aparência) de Persona (comportamento/conhecimento). Seu CVI integra percepção, STT, LLM, TTS e Phoenix-4 por WebRTC/Daily, além de LiveKit. O changelog de maio de 2026 reduziu o material de treinamento para um minuto e adicionou Image-to-Replica. Português e preservação de sotaque a partir de referência brasileira são declarados, mas o suporte de documentos RAG em português precisa ser confirmado. CVI, changelog, idiomas. A página de preços contém blocos incompatíveis de planos e franquias; o orçamento deve sair do checkout ou de proposta escrita, não de uma linha isolada.
LiveAvatar é a solução conversacional da HeyGen, distinta do render offline. O modo Full inclui ASR, LLM e TTS; Lite permite trazer sua pilha. O site atual informa Free com 10 créditos, Starter US$19/200, Essential US$99/1.100 e Business US$475/6.000; Full consome 2 créditos/min e Lite 1. A documentação de cobrança ainda exibe saldos anteriores. Tempo de sessão inclui escuta e espera, não apenas fala. LiveAvatar, documentação, créditos.
D-ID V4 Expressive conecta avatar e LLM em tempo real; V3 Instant e Pro continuam úteis para mídia gravada. V3 Instant exige ao menos um minuto e anuncia treino em 5–10 minutos; V3 Pro usa mais de três minutos. A clonagem de voz recomenda cinco minutos, embora aceite 30 segundos. A API oferece caminhos assíncronos e SDKs de conversa. V4, V3 Instant, voz, SDK. O plano API Build anual equivale a US$14,40/mês, mas tem marca e licença pessoal; Launch, a US$35/mês efetivos, admite uso comercial com marca. Preços API.
Anam gera um avatar conversacional a partir de uma foto e transmite por WebRTC. A empresa declara 25 fps em 720x480, mediana interna de 180 ms no servidor e latência mediana abaixo de um segundo no pipeline; isso não é a latência Brasil–servidor–LLM–TTS medida. Há API para criação do avatar e SDKs. Avatar customizado, preços. A tabela dinâmica consultada mostrou plano gratuito com 30 min, Starter com 50 e overage de US$0,16/min, Explorer com 250/US$0,14, Growth com 2.000/US$0,12 e Professional com 5.000/US$0,11; o valor fixo dos planos não ficou extraível com segurança. Voz própria aparece só em Professional/Enterprise.
LemonSlice é uma alternativa menos conhecida para imagem convertida em avatar ao vivo. Planos self-service partem de US$8/mês, com 1.000 créditos ou cerca de 41 minutos no modelo Base; o custo incluído indicado é US$0,164/min e o excesso US$0,22/min. A pilha hospedada de STT/LLM/TTS acrescenta US$0,09/min; é possível trazer LLM e voz. Ações de corpo, emoções, ZDR e modelos especializados são Enterprise. A API recebe áudio e transmite vídeo; isso a torna candidata para uma prova de conceito de atendimento, não substituta direta de um render 4K de publicidade.
Hedra, Captions/Mirage e VEED: geração de clipes
Hedra Character-3 aceita imagem e áudio por até 600 segundos. A tarifa documentada é US$0,025/s em 540p, US$0,05/s em 720p e US$0,0625/s em 1080p, ou US$1,50, US$3 e US$3,75 por minuto. É especialmente útil no benchmark porque permite enviar a mesma voz real a todos os motores. Character-3, schema Avatar. Não o chamaria de “clone treinado”: ele anima uma referência e precisa provar estabilidade na prática.
Captions oferece AI Twin no editor e Mirage Avatar X na API. X custa US$0,15/s, com cobrança arredondada em blocos de seis segundos e duas requisições por minuto por organização: US$9 por minuto nominal. É muito mais que o antigo endpoint de US$0,05/s ainda citado em comparações. Guia do AI Twin, preço de API, rate limits. A vantagem é o fluxo de edição social; o custo e a transição de produto pesam contra o uso maciço.
No VEED, o avatar customizado dentro do editor e o Fabric 1.0 não são a mesma oferta. O primeiro é anunciado a partir de aproximadamente dois minutos de gravação. Fabric recebe imagem e áudio por API, até cinco minutos, a US$0,08/s em 480p e US$0,15/s em 720p. Avatar Maker, Fabric 1.0. Fabric a 720p custa os mesmos US$9/min nominais de Mirage X e não deve ser chamado de barato sem comparar resolução e taxa de aprovação.
Ferramentas corporativas e de campanha
AI Studios declara criação de avatar com vídeo e consentimento em menos de cinco minutos; Personal parte de US$24/mês, com três clones, 1080p e 30 minutos por vídeo, e Team de US$55/assento inclui cinco clones, 4K e 60 minutos. Os preços dependem do ciclo anual. O produto interativo é separado. Criação customizada, preços.
Colossyan atende melhor a aprendizagem corporativa: NEO 2, quizzes, interatividade e SCORM. Professional aparece por US$59/mês no anual, com 30 minutos NEO e 10 NEO 2; o avatar Studio acrescenta US$1.000/ano. Instant pode partir de foto ou cerca de 20 segundos; Studio envolve sessão de aproximadamente uma hora e 10–15 dias úteis. Preços, Studio.
Elai combina Creator de US$29/mês com add-ons anuais: Selfie US$199, Studio US$500 e voz US$200. É preciso somar os componentes, não anunciar apenas o plano-base. Preços do Elai. Creatify, Argil e Gan.ai merecem amostras para campanhas personalizadas, mas seus sistemas de slots, créditos e produtos separados tornam uma comparação por “minuto” pouco segura sem conta real. Creatify API, Argil pricing, Gan.ai planos.
AKOOL e Vidnoz oferecem muitos recursos e níveis, mas a coleta não produziu um custo monetário de API estável e comparável. Entram na lista de descoberta, não no primeiro benchmark. Hour One fica fora: a Wix confirmou a aquisição em maio de 2025 e o serviço original não estava operacional durante a consulta. Aquisição da Hour One.
Custo nominal de APIs de clipe
Estes cálculos multiplicam a tarifa publicada pela duração gerada. Não incluem treinamento, voz, edição, retries, clipes rejeitados, arredondamento, impostos nem negociação. Os motores também não têm qualidade equivalente.
| Motor | US$/min gerado | 10 min | 100 min | 500 min | 1.000 min |
|---|---|---|---|---|---|
| Hedra Character-3 540p | 1,50 | 15 | 150 | 750 | 1.500 |
| Hedra Character-3 720p | 3,00 | 30 | 300 | 1.500 | 3.000 |
| Hedra Character-3 1080p | 3,75 | 37,50 | 375 | 1.875 | 3.750 |
| HeyGen IV/V Digital Twin 720/1080p | ~4,00 | ~40 | ~400 | ~2.000 | ~4.000 |
| HeyGen IV/V Digital Twin 4K | ~5,00 | ~50 | ~500 | ~2.500 | ~5.000 |
| VEED Fabric 480p | 4,80 | 48 | 480 | 2.400 | 4.800 |
| Captions Mirage Avatar X | 9,00 | 90 | 900 | 4.500 | 9.000 |
| VEED Fabric 720p | 9,00 | 90 | 900 | 4.500 | 9.000 |
Se apenas 70% da saída passar pelo controle de qualidade, 100 minutos aprovados requerem 142,86 minutos gerados. No Hedra 1080p, por exemplo, seriam cerca de US$535,71, não US$375. A taxa de 70% é uma hipótese para entender a fórmula, não uma observação destes serviços.
4. Runway, Kling, Hailuo, Veo, Adobe e Sora: onde entram
Esses sistemas são frequentemente agrupados com avatares, mas resolvem problemas diferentes. Eles são ótimos para cenas de apoio, transições, performance dirigida e variações visuais. Em geral, não são a primeira escolha para uma aula inteira com identidade e voz constantes.
Runway
Act-Two transfere uma performance gravada para uma imagem ou vídeo de personagem. Aceita até 30 segundos, produz a 24 fps e custa 5 créditos/s; cada crédito de API custa US$0,01, portanto são US$3/min nominal. Com imagem, pode transferir gestos e movimento corporal; com vídeo de personagem, preserva o movimento e a câmera do vídeo e aplica principalmente a atuação facial. Se o vídeo-base for curto, o sistema usa um loop de ida e volta, que pode denunciar repetição. A documentação recomenda uma pessoa, rosto visível, enquadramento até a cintura e mãos dentro do quadro. Guia do Act-Two, endpoint, preços.
Runway também lançou Characters, um avatar conversacional criado a partir de uma única imagem, sem treinamento, com voz, instruções e base de conhecimento. Há SDK React, câmera e compartilhamento de tela; o preço de gwm1_avatars é 2 créditos iniciais e mais 2 por seis segundos. É uma opção nova a testar em aula interativa, não evidência de que um retrato reproduza os maneirismos de Pablo. Criação de Characters, câmera e tela.
Use Act-Two quando houver motivo artístico para dirigir a atuação. Se Pablo já precisa gravar a performance inteira, compare o resultado com manter o vídeo real e apenas editar a fala. A transformação precisa acrescentar algo que justifique novos artefatos.
Kling Avatar 2.0
Kling Avatar 2.0 recebe imagem, áudio e descrição de expressão/ação, com cenas de até cinco minutos. O guia oficial mostra mãos, gestos, canto e personagens variados, todos escolhidos pelo fornecedor ou parceiros. A tabela de idiomas demonstrada lista inglês, japonês, coreano e chinês; isso não impede áudio português, mas não prova PT-BR validado. A versão anterior foi descrita em artigo técnico com até 1080p/48 fps; não transplante esse número para todo modo e plano do 2.0 sem confirmação. Guia Avatar 2.0, artigo técnico do Avatar 2.0.
O recurso é interessante para publicidade com ações que um talking-head convencional não faz. Ele não oferece, nas fontes consultadas, um treino pessoal portátil. O custo em créditos foi divulgado no guia, mas o valor monetário corrente por crédito não foi confirmado com segurança; fica fora da tabela de orçamento.
MiniMax H3/Hailuo
MiniMax H3 é um gerador multimodal geral lançado em 31/07/2026. Recebe texto, imagens, vídeo e áudio, produz até 15 segundos em 2K com som estéreo e oferece transferência de movimento por vídeo. A empresa anunciou que abriria pesos “nos próximos dias”; uma promessa de abertura não equivale a pesos publicados e licenciados, por isso a classificação deve ser revista antes de baixar. Anúncio do H3.
No agregador oficial da API Runway, h3_max custa 5 créditos/s em 480p ou 8 em 768p; hailuo3 custa 10 créditos/s em 768p e 15 em 2K, com cobrança adicional de referências. Isso posiciona H3/Hailuo como geradores de tomadas, não como sistema persistente de clone. Tabela Runway Dev.
Google Veo 3.1
Veo 3.1 aceita até três imagens de referência para guiar personagem, estilo e objetos, gera áudio nativo e oferece 4, 6 ou 8 segundos. Referências, 1080p e 4K exigem oito segundos; a saída é 24 fps. A documentação avisa que inglês foi avaliado plenamente e outros idiomas podem variar. Também informa latência de 11 segundos a seis minutos, retenção do resultado por dois dias e marca SynthID. Veo na Gemini API.
O preço é por segundo: Standard US$0,40 em 720p/1080p e US$0,60 em 4K; Fast US$0,10, US$0,12 e US$0,30; Lite US$0,05 em 720p e US$0,08 em 1080p. São US$3–36 por minuto se fosse possível emendar clipes sem perdas, o que não é uma premissa realista para um apresentador contínuo. No nível pago, a tabela diz que os dados não são usados para melhorar os produtos; o nível gratuito aparece como usado. Preços Gemini.
Veo faz sentido para B-roll, cenários, inserts e uma tomada curta especial. Três imagens de referência ajudam a preservar um sujeito, mas não criam um clone treinado de longa duração nem garantem a voz pessoal de Pablo.
Adobe Firefly
A API de avatar do Firefly trabalha com atores e vozes de catálogo e também aceita áudio próprio e fundo personalizado. O fluxo é assíncrono: cria um job e consulta o resultado. A rota pública consultada não documenta treinamento de um duplo pessoal; não se deve vender essa capacidade com base no termo genérico “avatar”. Firefly Avatar API.
O valor da Adobe está no ecossistema de produção, em lip-sync/tradução, acabamento e credenciais de conteúdo. Para o clone de Pablo, entra como ferramenta complementar até que uma oferta oficial de avatar pessoal seja confirmada.
OpenAI Sora
Sora 2 e Sora 2 Pro possuem API de vídeo, porém a documentação atual marca o recurso como descontinuado e programa o desligamento permanente para 24 de setembro de 2026. A página de depreciações não apresenta substituto. Com menos de três semanas entre esta pesquisa e o encerramento, não há justificativa para construir uma nova automação em cima dela. Isso diz respeito à API documentada, não permite afirmar que todo produto Sora para consumidores será desligado. Referência de criação de vídeo, depreciações.
Decisão prática sobre geradores gerais
| Necessidade | Melhor candidato inicial | Por quê | O que não prometer |
|---|---|---|---|
| Transferir atuação expressiva | Runway Act-Two | Performance explícita, mãos com imagem e API clara | Que elimina a necessidade do take-guia |
| Personagem com gestos por prompt | Kling Avatar 2.0 | Até cinco minutos e exemplos de corpo/mãos | PT-BR, custo final e fidelidade longa sem teste |
| Cena multimodal curta | H3/Hailuo 3 | Referência de vídeo/áudio e modelos atuais | Pesos abertos até a publicação real |
| B-roll com identidade aproximada | Veo 3.1 | Três referências, áudio e boa direção de cena | Clone persistente ou continuidade de curso |
| Acabamento/proveniência | Adobe | Ecossistema e serviços audiovisuais | Treino de clone pessoal na API pública |
| Nova integração Sora API | Nenhum | Desligamento iminente | Continuidade de serviço |
5. Protocolo de gravação e treinamento
O arquivo de captura deve ser tratado como um negativo mestre. Grave uma sessão longa e derive dela os trechos que cada fornecedor pede, em vez de repetir condições diferentes para cada plataforma. Guarde o bruto localmente e envie apenas o necessário.
Kit recomendado
- Câmera 4K com controle manual, gravando pelo menos 4:2:0 a bitrate alto; uma câmera dedicada é útil, mas um telefone recente bem fixado pode superar uma webcam ruim.
- Lente equivalente a aproximadamente 50–85 mm em full frame para busto, evitando grande-angular perto do rosto. Em sensor APS-C, algo perto de 35–56 mm produz campo semelhante.
- Tripé firme, câmera na altura dos olhos, foco e balanço de branco travados.
- Duas fontes de luz suaves a 45 graus ou uma grande luz principal e preenchimento/rebatedor. O fundo deve ser uniformemente iluminado e sem reflexos.
- Microfone XLR cardioide, interface confiável, pop filter e ambiente tratado. A orientação atual da OpenAI para custom voices sugere microfone XLR, pop filter e distância constante de 7–8 polegadas (aproximadamente 18–20 cm). Guia de TTS da OpenAI.
- Clap ou palmas no início para referência, ainda que o áudio vá ser substituído.
- Uma folha de continuidade com câmera, lente, distância, altura, temperatura de cor, potência das luzes, roupa, maquiagem, microfone, ganho e versão do roteiro.
Imagem e enquadramento
Grave dois masters separados:
- Busto: cabeça, ombros e parte do tórax; espaço acima da cabeça moderado; mãos normalmente fora do quadro. É a base mais fácil para aulas.
- Plano médio com mãos: da cintura ou quadril para cima; mãos sempre dentro do quadro; mesa ou objetos só se forem parte consistente da identidade.
Use fundo liso cinza, branco ou chroma quando o fornecedor pedir. Não use chroma automaticamente: cabelos e reflexos podem recortar pior que um fundo neutro. Evite estampas finas, joias balançando, óculos com reflexo, mechas cobrindo a boca e tecido que se confunda com o fundo. Grave a roupa que representa o “Pablo institucional” e crie outro master casual; não dependa de um único clone para todos os contextos.
Mantenha 1/50 s para 25 fps ou 1/60 s para 30 fps como ponto de partida, ISO baixo e abertura suficiente para olhos, nariz e orelhas não saírem de foco com pequenas inclinações. Esse é um protocolo proposto, não exigência universal dos serviços.
Roteiro de captura de vídeo
| Bloco | Duração sugerida | Conteúdo |
|---|---|---|
| Neutro | 2 min | Fala calma, olhando para a lente, pequenas pausas naturais |
| Didático | 3 min | Explicação com números, siglas, listas e mudança de ênfase |
| Expressivo | 3 min | Alegria, dúvida, preocupação, surpresa contida e convicção |
| Fonético | 2 min | Vogais, encontros consonantais, palavras com r, s, lh, nh, ão e nomes próprios |
| Gestos | 5 min | Mãos abertas, apontar, contar, comparar tamanhos, indicar tela e repousar |
| Perguntas | 2 min | Frases interrogativas e respostas curtas, sem teatralidade excessiva |
| Pausas | 2 min | Respiração, escuta, olhar breve para os lados e retorno à lente |
| Texto comercial | 3 min | Uma chamada real do Portal IDEA, com energia sustentável |
| Segurança | 1 min | Consentimento específico exigido pelo fornecedor, em take separado |
| Folga | 7 min | Repetições limpas, mudanças controladas e correções |
Total sugerido: 30 minutos úteis, mais testes. Para um serviço que pede um minuto, escolha um trecho contínuo impecável; para cinco minutos, use neutro + didático. Não acelere um take longo nem corte frases dentro da amostra de treinamento, salvo orientação expressa.
Quanto gravar: 5, 10, 30 ou 60 minutos
| Duração | Quando basta | O que falta | Recomendação |
|---|---|---|---|
| 5 min | Avatar instantâneo, piloto e serviço com limite baixo | Pouca variação emocional e fonética | Gravar 30 min e selecionar os melhores cinco |
| 10 min | Clone básico recorrente e voz de boa qualidade | Pode não cobrir todos os ritmos e gestos | Bom pacote mínimo reutilizável |
| 30 min | Dataset principal para voz e visual, várias energias | Exige direção e controle de continuidade | Melhor ponto de partida para Pablo |
| 60 min | Fine-tuning, múltiplos estilos ou fornecedor que se beneficia disso | Material ruim pode ensinar inconsistência | Só após validar os primeiros 30 min |
Mais minutos não compensam eco, clipping, foco oscilando ou atuação contraditória. A consistência do sinal importa mais que preencher uma cota.
Dataset de voz
Grave WAV mono, PCM, 24-bit, 48 kHz como master e derive 24 kHz/16-bit ou outro formato exigido. Evite compressor, gate e remoção agressiva de ruído no bruto. Mantenha picos com folga e voz suficientemente acima do ruído. Produza:
- 10 minutos neutros, com ritmo de aula;
- 5 minutos energéticos, mas não publicitários demais;
- 5 minutos de perguntas, números, datas, URLs, siglas e termos técnicos;
- 5 minutos de nomes brasileiros, estrangeiros e vocabulário do Portal IDEA;
- 5 minutos com pausas, frases curtas e longas;
- consentimentos em arquivos separados, com o texto exato de cada plataforma.
Prepare um pequeno dicionário de pronúncia: IDEA, Pablo, nomes de cursos, cidades, tecnologias e professores. Se o motor não suportar léxico, teste grafias auxiliares na camada de roteiro, sem alterar legendas.
Segurança dos arquivos mestres
- Armazene o bruto criptografado, com duas cópias e controle de acesso.
- Gere hashes SHA-256 e registre data, responsável, licença e consentimentos.
- Use uma conta separada para fornecedores, MFA e e-mail controlado pela empresa.
- Nunca envie o conjunto completo quando 30 segundos forem suficientes.
- Registre todo upload, finalidade, região, prazo de exclusão solicitado e comprovante.
- Não entregue masters a freelancers por link público; use links com expiração e menor privilégio.
6. Vale da estranheza: diagnóstico e correção
Sinais que mais denunciam o clone
| Sinal | Causa provável | Correção prática |
|---|---|---|
| Dentes mudam de tamanho ou forma | Geração fraca da região oral | Reduzir movimento, melhorar referência, trocar motor ou plano mais fechado |
| Boca está certa por fonema, mas parece “colada” | Só a região labial acompanha o áudio | Usar modelo que mova mandíbula, bochechas e cabeça; reduzir close |
| Piscadas regulares demais | Loop ou condicionamento pobre | Take mais longo, modelo de performance ou cortes de câmera |
| Olhar atravessa a lente | Estimativa ocular instável | Captura frontal, câmera na altura dos olhos, menor desvio de cabeça |
| Pele excessivamente lisa | Upscale/face restoration agressivo | Desligar restauração, conservar grão e textura |
| Cabeça mexe sem relação com a frase | Movimento derivado apenas do áudio | Vídeo-guia ou clone treinado com atuação consistente |
| Mãos fundem ou aparecem sem motivo | Gerador corporal e referência inadequados | Enquadrar busto ou usar performance gravada; evitar objetos complexos |
| Voz tem timbre parecido, sotaque diferente | Modelo multilíngue otimizado em outro idioma | Dataset PT-BR, texto com pronúncia, modelo validado em português |
| Respiração desaparece | TTS ou limpeza agressiva | Adicionar pausas naturais e room tone; não falsificar respiração a cada frase |
| Volume e emoção mudam entre clipes | Geração fragmentada | Lock de parâmetros, mesma referência, loudness e QC por lote |
| Roupa/cabelo oscilam | Identidade condicionada por poucas imagens | Avatar persistente, imagem de referência melhor ou vídeo-base |
| Silêncio com rosto congelado | Motor só reage à fala | Inserir escuta/idle dedicado ou cortar para slide |
O erro mais comum é tentar consertar tudo com mais pós-processamento. Interpolação, face restoration, super-resolução e um segundo lip-sync podem apagar textura ou criar uma nova boca. Faça uma mudança por vez e guarde a versão anterior.
Regras de direção que ajudam
- Um plano de seis a quinze segundos é mais fácil de aprovar que um monólogo contínuo.
- Corte para slide, tela ou B-roll quando a frase exigir ação que o avatar não executa.
- Use gestos maiores em plano médio e microexpressões em close; não peça ambos ao mesmo tempo.
- Não faça o avatar tocar o próprio rosto, cruzar dedos ou manipular objetos na primeira produção.
- Mantenha pequenas assimetrias reais. Simetria, pele perfeita e cadência perfeita podem parecer menos humanas.
- A legenda esconde parte da região inferior, mas não deve servir para encobrir lip-sync ruim.
- Compare o avatar com um take real do mesmo roteiro, não apenas com outros avatares.
Duração e segmentação
| Vídeo final | Segmentação recomendada | Risco principal |
|---|---|---|
| 30 s | 2–4 tomadas | Troca visual excessiva para uma mensagem curta |
| 1 min | 4–8 tomadas | Repetição de gesto e piscada |
| 5 min | Blocos de 10–25 s, alternados com tela/B-roll | Deriva de identidade e voz entre blocos |
| 10 min | Capítulos de 60–120 s, com avatar em 20–40% | Fadiga do espectador e inconsistência acumulada |
| 30 min | Aula modular; rosto em aberturas, transições e trechos-chave | Tentativa de gerar um plano contínuo e caro |
Os blocos não precisam ser minúsculos se o motor suporta dez minutos. Segmentação é uma ferramenta editorial: permite regravar uma frase, trocar uma tomada defeituosa e controlar custo. Preserve continuidade com o mesmo master visual, voz, roupa, balanço de branco, câmera e parâmetros de geração.
7. Modelos locais e de código disponível
Quase todos os pipelines visuais usam Python/PyTorch. Uma interface Gradio facilita demonstração, mas não equivale a uma API de produção. Da mesma forma, um node do ComfyUI pode ser comunitário mesmo quando o modelo é oficial.
Inventário comparativo
| Projeto oficial | Função | Licença comercial | Interface/VRAM conhecida | Avaliação prática em 2026 |
|---|---|---|---|---|
| LivePortrait | Foto/vídeo + performance; retarget facial | Código MIT; é preciso substituir modelos InsightFace não comerciais, como manda a licença | CLI, Gradio; nodes comunitários | Excelente para controlar expressão; não gera voz |
| MuseTalk 1.5 | Vídeo/foto + áudio; edita boca | MIT; README permite uso comercial dos modelos, mas samples não | CLI, Gradio, avatar pré-processado; node comunitário | Primeira opção local para vídeo-base; região gerada 256×256 |
| Wav2Lip | Vídeo + áudio | Versão aberta restringe uso comercial; produto Sync é separado | CLI; Docker comunitário | Baseline histórico, não produção monetizada |
| SadTalker | Foto + áudio; cabeça/face | Apache-2.0, com componentes a revisar | CLI, Gradio, Docker/WSL | Acessível, mas visual e atividade são mais antigos |
| Hallo | Foto + áudio por difusão | MIT no código; InsightFace e pesos exigem auditoria | CLI/Gradio; comunidade Windows/Docker/ComfyUI | Baseline de 2024 |
| Hallo2 | Retrato longo e super-resolução | MIT no código; CodeFormer/S-Lab e InsightFace separados | CLI; testado em A100 | “4K” inclui pós-processamento, não detalhe facial nativo garantido |
| Hallo3 | Retrato áudio-dirigido com DiT | MIT no código; backbone CogVideoX-5B tem licença própria | CLI; H100 usada pelos autores | Pesado e sem prova integral em 32 GB |
| EchoMimic | Foto + áudio + landmarks | Apache-2.0 no código; cadeia exata deve ser revisada | CLI/Gradio | Landmarks editáveis, ainda com atividade 2026 |
| EchoMimicV2 | Meio corpo, áudio e pose | Apache-2.0, dependências separadas | CLI/Gradio; 16–24 GB em receitas | Mais controle de gesto que áudio isolado |
| EchoMimicV3/Flash | Animação multimodal, modelo 1,3B | Código e pesos Apache-2.0 | Low-VRAM oficial 12 GB; node comunitário 16 GB | Prioridade para foto animada local |
| AniPortrait | Foto + áudio ou performance | Código Apache-2.0; cadeia de pesos NC | CLI/Gradio | Interessante, mas último push confirmado em 2024 |
| MimicMotion | Imagem + pose/vídeo corporal | Código Apache-2.0; backbone SVD separado | CLI; 16 GB/72 frames na receita | Corpo e gesto, não voz/lip-sync completo |
| V-Express | Foto + áudio + keypoints | Código permite comercial; checkpoints distribuídos são só pesquisa | CLI; node comunitário; modo econômico ~8 GB e lento | Excluir os pesos públicos da produção comercial |
| LatentSync | Vídeo + áudio; lip-sync por difusão | Código Apache-2.0; auditar checkpoints/SD/InsightFace | CLI; 1.5 requer 8 GB, 1.6 requer 18 GB | Qualidade potencial maior; 1.6 cabe na 5090 |
| JoyVASA | Áudio dirige dinâmica em renderer LivePortrait | Código MIT; herda cuidados da cadeia | CLI; integra FasterLivePortrait | Converte um renderer de performance em talking-head |
| StableAnimator | Imagem + sequência de poses | Código MIT; SVD/encoder precisam revisão | CLI; receita básica 8 GB, Pro até 16 GB | Corpo controlado; não resolve fala sozinho |
| InfiniteTalk | Foto/vídeo + áudio, dubbing longo | Código/modelos declarados Apache-2.0 | CLI, JSON, Gradio; branch ComfyUI oficial | Muito útil; upstream admite deriva de cor em I2V longo |
| MultiTalk | Várias pessoas e áudios | Apache-2.0 declarado | CLI/JSON/Gradio, INT8/low-VRAM | Bom para diálogo sem trocar a boca do interlocutor |
| HuMo | Texto + imagem + áudio; cena/sujeito | Código Apache-2.0; pesos oficiais | CLI; 1.7B no ComfyUI | Criativo; clipes longos podem degradar |
| Wan2.2 S2V/Animate | Fala para vídeo ou transferência de atuação | Família Apache-2.0; revisar preprocessing | CLI, Diffusers e ComfyUI | S2V-14B oficial pede 80 GB; Animate é mais pertinente para performance |
| FantasyTalking | Foto + áudio + prompt, sobre Wan | Código Apache-2.0; cadeia de pesos exige checklist | CLI/Gradio; modo 5 GB é muito lento | Experimental em GPU menor, não produção rápida |
| Sonic | Foto + áudio, dinâmica global | CC BY-NC-SA 4.0 | CLI/Gradio; node comunitário | Não usar em conteúdo monetizado sem outra licença |
| LongCat-Video-Avatar 1.5 | Foto/texto + um ou mais áudios, continuação | Código e pesos MIT | CLI/JSON, Streamlit, INT8; exemplos usam 2 GPUs | Projeto moderno mais interessante para qualidade local |
| SoulX-FlashHead | Foto + áudio; Lite/Pro streaming | Código e pesos Apache-2.0; revisar VAE LTX | CLI, Gradio e node comunitário | Projeto moderno mais interessante para baixa latência |
| SoulX-LiveAct | Animação longa, emoção e ação | Pesos Apache-2.0; licença do código não confirmada | CLI/JSON/GUI; FP8/offload e FP4 Blackwell | 6 fps reportados em uma RTX 5090; 20 fps usa 2×H100/H200 |
| Ditto | Áudio para retrato, renderer leve | Código Apache-2.0; pesos oficiais, dependências a auditar | PyTorch, ONNX, TensorRT | Boa base de engenharia para latência |
| Alibaba LiveAvatar | Difusão streaming 14B | Apache-2.0 na maior parte da cadeia/Wan | CLI/Gradio; mínimo 48 GB FP8 | Fora da 5090 na receita oficial |
| GAIR LiveTalk | Texto/imagem/áudio, 1,3B | Código e pesos Apache-2.0 | CLI; ~20 GB, 64 GB RAM; script sem streaming I/O | Paper fala em realtime, entrega pública ainda requer servidor |
| OmniAvatar | Foto/texto + áudio; corpo inteiro | Pesos disponíveis; licença explícita do código NC | CLI, offload, FSDP | Promissor, mas licença e identidade precisam validação |
| TalkVerse | Corpus e baseline S2V-5B | Snap Non-Commercial License | CLI | Referência científica, não produção comercial |
| Audio2Face-3D | Áudio para animação facial de rig 3D | SDK MIT, treino Apache, pesos NVIDIA Open Model License; NIM separado | C++/Python, Maya/Unreal, NIM | Bom para personagem 3D; não transforma uma selfie sozinho |
Projetos anunciados, mas não instaláveis como se fossem um pacote pronto
- OmniHuman-1/1.5: papers e demos da ByteDance, sem pesos oficiais locais confirmados. Repositórios de terceiros com o mesmo nome não resolvem isso.
- CyberHost: paper e demonstração; distribuição oficial executável de pesos não confirmada.
- Omni-LiveAvatar: paper de agosto de 2026; o README afirma que código e checkpoints ainda não foram lançados.
- IntelLabs LiveAvatar: outro projeto, de avatar Gaussian 3D, com pesos ainda em preparação na consulta.
Atividade e comunidade verificadas
O snapshot público do GitHub foi coletado em 05/09/2026. open_issues_count inclui pull requests e pushed_at pode refletir documentação ou uma branch; são sinais, não selos de manutenção.
| Repositório | Stars | Forks | Issues + PR abertas | Último push UTC |
|---|---|---|---|---|
| LivePortrait | 19.007 | 1.979 | 289 | 01/06/2026 |
| MuseTalk | 6.512 | 943 | 172 | 26/09/2025 |
| Wav2Lip | 13.193 | 2.848 | 370 | 22/06/2025 |
| SadTalker | 14.069 | 2.693 | 665 | 26/06/2024 |
| EchoMimic V2 | 4.652 | 552 | 76 | 23/02/2026 |
| EchoMimic V3 | 1.038 | 125 | 25 | 18/03/2026 |
| LatentSync | 6.050 | 977 | 228 | 20/06/2025 |
| InfiniteTalk | 7.787 | 1.350 | 167 | 22/05/2026 |
| MultiTalk | 2.998 | 496 | 153 | 22/05/2026 |
| Wan2.2 (família) | 17.406 | 2.227 | 297 | 17/03/2026 |
| LongCat-Video (família) | 7.777 | 1.391 | 78 | 27/05/2026 |
| SoulX-FlashHead | 1.039 | 122 | 30 | 28/05/2026 |
| JoyVASA | 878 | 91 | 42 | 16/04/2026 |
| LiveTalking | 9.419 | 1.493 | 236 | 30/08/2026 |
O que sua RTX 5090 consegue de forma realista
A RTX 5090 desktop tem 32 GB de VRAM; a RTX 5070 Ti tem 16 GB e a 5070, 12 GB. Não use especificações de notebook para planejar as placas desktop. RTX 5090, família RTX 5070.
| Modelo/fluxo | Evidência publicada | Leitura correta |
|---|---|---|
| MuseTalk | 30+ fps em V100 no fluxo pré-processado; demonstração 4 GB levou ~5 min para 8 s | Cabe em VRAM modesta; 4 GB não significa realtime |
| LatentSync 1.5/1.6 | 8/18 GB | 5090 comporta 1.6; 5070 Ti/5070 ficam abaixo do mínimo 1.6 |
| EchoMimic V3 | modo low-VRAM 12 GB; node 16 GB | Candidato para todas, com resolução/configuração ajustada |
| MimicMotion | 16 GB para 72 frames; exemplo de 35 s em ~20 min numa 4090 | Cabe na 5070 Ti em receita específica, mas não é rápido |
| StableAnimator | básico 8 GB; Pro pode demandar 16 GB | Útil para pose, não para fala isoladamente |
| Wan2.2 S2V-14B | comando oficial pede 80 GB | Não cabe na 5090 sem otimização/quantização não equivalentes à receita oficial |
| LongCat 1.5 | INT8 oficial; exemplos usam duas GPUs; PR comunitária relata 24 GB | Deve ser testado; PR aberta não é suporte oficial |
| SoulX FlashHead Lite | autores reportam 96 fps em 1×4090 | Boa prioridade para latência; medir request completo, não só loop quente |
| SoulX FlashHead Pro | 10,8 fps em 1×4090; 25+ fps em 2×5090 | Uma 5090 não foi demonstrada como realtime Pro nessa medição |
| SoulX LiveAct | 6 fps em 1×5090 com FP8 KV/offload | Um minuto a 24 fps demanda ao menos quatro minutos de geração, antes de overhead |
| Alibaba LiveAvatar | mínimo 48 GB em FP8 | Fora da receita upstream para 32 GB |
| GAIR LiveTalk | cerca de 20 GB e 64 GB RAM no script | 5090 plausível; ainda é preciso construir streaming |
O PyTorch 2.7 adicionou suporte a Blackwell com CUDA 12.8, mas cada repositório fixa versões de PyTorch, CUDA, xformers, FlashAttention, SageAttention ou TensorRT. Atualizar tudo à força costuma quebrar operadores. PyTorch 2.7. Eu começaria com 64 GB de RAM e NVMe espaçoso; 128 GB só depois de medir offload e simultaneidade. Essa é recomendação de operação, não requisito oficial.
ComfyUI, Docker e segurança
ComfyUI-WanVideoWrapper, Wan2GP, ComfyUI-LivePortraitKJ, ComfyUI-MuseTalk, FasterLivePortrait e LiveTalking reduzem trabalho de integração. Eles não reescrevem a licença dos modelos carregados.
Para começar, prefira uma imagem Docker por família de dependências, GPU atribuída explicitamente e volumes somente de entrada/saída/modelos. Não use --privileged, não exponha Gradio/ComfyUI em 0.0.0.0 e não aceite workflows de terceiros sem ler custom nodes: são código Python executável. Fixe commits, hashes de pesos e versões. Mantenha o serviço em 127.0.0.1 ou numa rede privada/Tailscale com autenticação.
O servidor ComfyUI oferece POST /prompt, histórico, fila e WebSocket de eventos, o que basta para um worker interno. Não é necessário dar a interface inteira ao público. Rotas do servidor ComfyUI.
Rota local recomendada
- Base confiável: gravação real de Pablo + voz real ou TTS aprovado + MuseTalk.
- Foto animada: EchoMimic V3/Flash e SoulX-FlashHead Lite.
- Qualidade criativa: LongCat-Video-Avatar 1.5 em lote, medindo VRAM/tempo.
- Corpo dirigido: vídeo de performance + Wan Animate/MimicMotion; lip-sync só depois, se necessário.
- Laboratório: SoulX-LiveAct, HuMo e LiveTalk.
- Fora da produção comercial sem licença: Wav2Lip aberto, V-Express checkpoints, Sonic e TalkVerse.
Um teste independente de agosto de 2026 comparou modelos em infraestrutura Modal e publicou vídeos, tempo e memória. Ele encontrou, por exemplo, quase 47 GB para LongCat 1.5 em H200 e 33,7 GB para uma configuração de EchoMimic Flash, embora existam receitas low-VRAM diferentes. Isso mostra como resolução, carregamento, compilação e configuração mudam o resultado. É evidência observacional de uma empresa que vende desenvolvimento, não benchmark universal nem teste em 5090. Tight Studio: talking avatars.
8. Clonagem de voz em português brasileiro
A voz real gravada continua sendo o padrão de referência. Ela pode alimentar diretamente Hedra, MuseTalk, LatentSync ou outro motor visual, sem passar por TTS. A clonagem é valiosa quando o roteiro muda com frequência ou Pablo não pode gravar; não deve ser uma etapa obrigatória em todos os vídeos.
Serviços comerciais
| Serviço | Material e modalidade | PT-BR | Preço comparável | Risco ou limite |
|---|---|---|---|---|
| ElevenLabs | IVC ~1–5 min; PVC a partir de 30 min, preferível 1–3 h | Multilingual v2 documenta Brasil/Portugal; v3 é mais expressivo | API v2/v3: US$0,10/1.000 caracteres; Flash US$0,05 | PVC exige plano/verificação; opt-out não desfaz treino passado |
| Cartesia Sonic 3.6 | IVC 10–60 s; PVC >=30 min, recomendado >=2 h | Português entre 44 idiomas; sotaque deve ser testado | Pro US$5/100 mil créditos; Startup US$49/1,25 milhão | PVC só Startup; ZDR de inferência não cobre criação/clonagem |
| Google Chirp 3 ICV | Referência e consentimento de até 10 s | pt-BR explícito | US$60/milhão de caracteres | Acesso por allowlist |
| Azure Personal Voice | Personal ~1 min; Professional 300–2.000 frases | Multilíngue, região/produto precisam confirmação | Treino, hosting e síntese variam | Aprovação e verificação biométrica |
| OpenAI custom voices | Consentimento + amostra de até 30 s | Português suportado; frase de consentimento em português | Acesso/preço específico NC | Somente clientes elegíveis; criação é por API |
| Resemble AI | Rapid anuncia 10 s; Professional 10–25 min+ | Português anunciado | Tarifa atual não ficou inequívoca | Cotação e teste necessários |
| Inworld TTS 2 | Clone anunciado e API realtime | Cobertura ampla anunciada; PT-BR precisa audição | US$25/milhão; Flash US$15/milhão | Consentimento/retenção devem ser confirmados |
| Mistral Voxtral TTS | Customização na API/Studio | Português entre nove idiomas | US$0,016/1.000 caracteres | Pesos locais CC BY-NC; API comercial é outro produto |
| PlayHT/PlayAI | Operação atual não confirmada | NC | NC | Adquirida pela Meta em 2025; não basear projeto novo sem confirmação |
O ElevenLabs possui duas contabilidades. No produto criativo, Starter custa US$6/30 mil créditos, Creator US$22/121 mil, Pro US$99/600 mil e Scale US$299/1,8 milhão. A API mostra saldo em dólares: US$22 correspondem a 220 mil caracteres na tarifa de US$0,10/mil. Não some mensalidade e consumo já incluído, nem converta crédito criativo em caractere de API sem a tabela correta. Preços criativos, preços da API.
As custom voices da OpenAI são reais e funcionam em TTS, Realtime e áudio de Chat Completions. A organização precisa ser elegível e criar a voz por API. Há dois arquivos: consentimento com a frase exata e amostra correspondente; ambos têm até 30 segundos. A lista inclui português e fornece a frase: “Eu sou o proprietário desta voz e autorizo o OpenAI a usá-la para criar um modelo de voz sintética.” Isso é uma opção a acompanhar ou cotar, não um recurso de varejo garantido para a conta atual. Documentação oficial.
Custo de TTS por texto
Hipótese: 1.000 caracteres por minuto falado. Substitua pela contagem do roteiro, pois a velocidade muda a relação. Não inclui avatar, revisão ou mensalidade necessária para ter acesso ao clone.
| Motor | Base | 10 min | 100 min | 500 min | 1.000 min |
|---|---|---|---|---|---|
| ElevenLabs v2/v3 | US$0,10/1.000 caracteres | 1,00 | 10 | 50 | 100 |
| ElevenLabs Flash/Turbo | US$0,05/1.000 | 0,50 | 5 | 25 | 50 |
| ElevenLabs Voice Changer | US$0,12/min de entrada | 1,20 | 12 | 60 | 120 |
| Google Chirp 3 ICV | US$60/milhão | 0,60 | 6 | 30 | 60 |
| Inworld TTS 2 | US$25/milhão | 0,25 | 2,50 | 12,50 | 25 |
| Inworld TTS 2 Flash | US$15/milhão | 0,15 | 1,50 | 7,50 | 15 |
| Mistral Voxtral API | US$0,016/1.000 | 0,16 | 1,60 | 8 | 16 |
Centavos de síntese não determinam o custo do vídeo: uma pronúncia errada que força re-render de US$4/min de avatar é mais cara que escolher um TTS melhor.
Modelos locais
| Projeto | Clone e português | Licença código/pesos | Operação | Decisão |
|---|---|---|---|---|
| Qwen3-TTS | Base 0,6B/1,7B clona; português entre 10 idiomas | Apache-2.0/Apache-2.0 | Python, Gradio, batch e cache de prompt | Prioridade local alta |
| Chatterbox Multilingual V3 | Clone e pacote pt-BR | MIT/MIT no pacote verificado | Python, VC, watermark PerTh | Prioridade local alta para PT-BR |
| MOSS-TTS v1.5 | Clone, fala longa, pausas e português entre 31 idiomas | Família Apache-2.0 | SGLang/vLLM-Omni, streaming, GGUF/ONNX | Moderno e potente; mais complexo |
| Fish Speech S2 Pro | Clone, 80+ idiomas e expressão | Fish Audio Research License; comercial exige acordo | API/WebUI/Docker; ~24 GB na receita | Tecnicamente forte, não livre para empresa |
| F5-TTS | Referência + transcrição; PT-BR não garantido | Código MIT; pesos oficiais CC BY-NC | CLI, Gradio, Docker, fine-tuning | Pesquisa, não produção comercial com pesos oficiais |
| XTTS-v2 | Clone curto e português | Código MPL; pesos CPML não comercial | Multi-referência/fine-tuning | Conhecido, porém licença e idade pesam contra |
| OpenVoice V2 | Conversão de timbre; base sem português | MIT/MIT anunciado | TTS-base + conversão | Pode converter um TTS PT-BR externo; duas etapas |
| GPT-SoVITS | Zero-shot/fine-tuning; lista oficial sem português | Código MIT; pesos/dependências variam | API, WebUI, Docker | Não priorizar para PT-BR |
| CosyVoice 3 | Nove idiomas, sem português oficial | Apache-2.0; checkpoint específico a revisar | FastAPI/gRPC/Triton/TRT/vLLM | Serving bom, idioma inadequado ao caso |
| IndexTTS 2.5 | Cinco idiomas, sem português | Licença própria Bilibili | Clone, emoção separada e controle | Não é vencedor PT-BR nem licença padrão |
| Kokoro 82M | Vozes brasileiras de catálogo; não clona Pablo | Apache-2.0/Apache-2.0 | Pequeno, CPU viável | Ótimo para rascunho, não identidade pessoal |
| RVC | Converte interpretação existente para timbre treinado | Código MIT; cada peso tem seus direitos | WebUI e realtime | Experimento de conversão, não TTS |
| OmniVoice | Zero-shot e 600+ idiomas | Código Apache; pesos CC BY-NC | Modelo de difusão 0,6B | Laboratório, não produção comercial |
| Voxtral 4B TTS | Português; clone offline completo NC | Pesos CC BY-NC | BF16, vLLM-Omni/Docker | Preferir a API comercial se adequado |
Qwen separa três variantes: Base para clonagem, CustomVoice para vozes predefinidas e VoiceDesign para uma voz descrita. O controle de instruções das duas últimas não deve ser prometido ao clone Base. Use referência com transcrição exata; o modo somente embedding é conveniente, mas pode perder qualidade. Model card Base 1,7B, paper.
Chatterbox requer escolher o pacote certo. Turbo/Nano em inglês não demonstram desempenho do Multilingual V3 brasileiro. O pacote pt-BR é a evidência mais direta de foco no sotaque, mas ainda precisa de audição cega com a voz de Pablo. Demo pt-BR, anúncio e metodologia V3.
MOSS-TTS v1.5, publicado em junho de 2026, merece um quinto lugar no benchmark. Há variantes diferentes de geração/serving; uma configuração de 8 GB num backend GGUF/ONNX não prova que toda variante 4B cabe na mesma memória. MOSS v1.5, paper.
TTS direto ou TTS base + conversão
| Fluxo | Vantagem | Perda provável | Quando usar |
|---|---|---|---|
| Voz real → avatar | Preserva atuação, sotaque e identidade | Exige gravação | Conteúdo importante e emocional |
| Texto → clone TTS → avatar | Escala e atualização | Erros de nome, ritmo e emoção | Aulas roteirizadas após validação |
| Texto → voz base → RVC/OpenVoice → avatar | Combina motores e timbre | Dois modelos, duas licenças e artefatos acumulados | Laboratório ou necessidade específica |
A conversão não corrige números mal lidos nem inventa uma interpretação ausente. Sempre que a frase pedir emoção precisa, pode ser mais simples gravá-la.
Saúde dos projetos de voz
Snapshot da API pública GitHub em 05/09/2026; contagens são fotografias, não notas de qualidade.
| Repositório | Stars | Forks | Issues + PR | Último push UTC |
|---|---|---|---|---|
| Qwen3-TTS | 13.278 | 1.725 | 56 | 17/03/2026 |
| Chatterbox | 26.283 | 3.539 | 360 | 21/07/2026 |
| Fish Speech | 32.559 | 2.807 | 14 | 22/08/2026 |
| F5-TTS | 15.199 | 2.207 | 62 | 23/07/2026 |
| OpenVoice | 37.452 | 4.193 | 308 | 19/04/2025 |
| GPT-SoVITS | 61.593 | 6.648 | 892 | 18/08/2026 |
| CosyVoice | 23.466 | 2.671 | 701 | 25/05/2026 |
| IndexTTS | 23.748 | 2.839 | 405 | 18/08/2026 |
| RVC WebUI | 38.118 | 5.259 | 573 | 04/08/2026 |
O repositório Coqui original teve último commit em 2024; o fork Idiap/coqui-ai-TTS continuava ativo em junho de 2026. Isso melhora compatibilidade do software, mas não altera a licença CPML dos pesos XTTS-v2.
Privacidade da voz
No ElevenLabs, desativar o uso para melhoria vale para dados futuros e não desfaz treinamento anterior. No Cartesia, ZDR Enterprise cobre inferência, mas exclui explicitamente clonagem/PVC. Google e Azure exigem consentimento e tratam a voz como material sensível. Local reduz upload, porém arquivos, embeddings e checkpoints continuam capazes de abuso. ElevenLabs: uso de dados, Cartesia ZDR, Azure: privacidade.
9. Três fluxos completos de produção
Fluxo A: maior qualidade e menor risco editorial
Indicado para anúncios, páginas institucionais, abertura de cursos e conteúdos que representam diretamente Pablo.
- Roteiro humano revisado, com marcações de intenção e pronúncia.
- Pablo grava a voz real; para escala, comparar essa referência com ElevenLabs PVC e Cartesia PVC.
- Usar um clone pessoal HeyGen V/IV e uma tomada alternativa em Hedra. Para atuação especial, gravar performance e testar Act-Two.
- Gerar em tomadas de 8–20 s, mantendo Look, roupa, enquadramento e parâmetros.
- Alternar com gravação real, produto, tela e B-roll. Veo/H3 só nas cenas que não precisam manter o rosto por muito tempo.
- Revisor compara rosto, voz e sentido com os masters e rejeita qualquer alteração de identidade.
- Montagem, legendas, normalização, C2PA e disclosure visível.
Vantagem: qualidade controlável e fornecedores especializados. Custo: aproximadamente US$3–5 por minuto visual bruto nos motores prioritários, mais tentativas e mensalidades. Escolha: conteúdo em que a reputação vale mais que economizar uma etapa.
Fluxo B: melhor custo-benefício híbrido
Indicado para catálogo do Portal IDEA, atualizações frequentes e aulas de 5–30 minutos.
- Criar biblioteca de takes reais: neutro, explicação, transições e gestos.
- Gravar voz real quando possível; usar Chatterbox/Qwen local ou ElevenLabs quando o roteiro mudar.
- Aplicar MuseTalk a um vídeo-base coerente, preservando corpo, iluminação e fundo.
- Quando um take-base não combina semanticamente com a frase, usar HeyGen/Hedra somente naquele bloco.
- Mostrar o apresentador em 20–40% da aula e usar slides, tela e gráficos no restante.
- Produzir três lotes: áudio, talking-head e montagem. Rejeitar clipes antes do upscale.
- Arquivar assets e parâmetros; apagar uploads externos após a janela de revisão.
Vantagem: mantém gestos verdadeiros e reduz gastos recorrentes. Limitação: a biblioteca de atuação precisa crescer para evitar repetição. Escolha: ponto de partida recomendado para Pablo.
Fluxo C: local na RTX 5090
Indicado para privacidade, grande volume, experimentação e independência de créditos.
- Debian/Ubuntu atual, driver NVIDIA compatível, Docker com NVIDIA Container Toolkit e volumes separados.
- TTS inicial: Chatterbox Multilingual V3 pt-BR e Qwen3-TTS Base 1.7B. MOSS-TTS como terceiro experimento.
- Vídeo-base: MuseTalk 1.5. Foto: EchoMimic V3/Flash e SoulX-FlashHead Lite.
- Qualidade gerativa: LongCat 1.5 INT8, somente após o pipeline simples estar medido.
- Um worker por GPU, carregando voz e vídeo em sequência se houver pressão de VRAM.
- CLI/ComfyUI apenas internos; wrapper de jobs expõe uma API pequena.
- FFmpeg monta, normaliza e codifica; revisão humana aprova antes da publicação.
Vantagem: dados e custo marginal sob seu controle. Limitação: atualização, compatibilidade CUDA e QC ficam com você. Escolha: melhor laboratório e provável rota de volume, mas não promessa de qualidade máxima sem benchmark.
Comparação dos fluxos
| Critério | A: qualidade comercial | B: híbrido | C: local 5090 |
|---|---|---|---|
| Fidelidade inicial | Potencialmente alta | Alta no corpo e variável no rosto | Depende da configuração |
| Custo fixo | Assinaturas/treino | Biblioteca de takes | Hardware já disponível |
| Custo marginal | Alto em vídeo | Médio/baixo | Energia e tempo de GPU |
| Privacidade | Contratual | Mista | Alta se realmente offline |
| Liberdade de cenário | Alta | Média | Alta, com mais engenharia |
| Velocidade operacional | Alta após onboarding | Alta após biblioteca | Variável |
| Lock-in | Alto | Médio | Baixo nos modelos permissivos |
| Melhor uso | Campanha e institucional | Cursos e escala | Volume, P&D e dados sensíveis |
10. Arquitetura simples de automação
Componentes
cliente/editor
│ POST /video
▼
API Node.js ou FastAPI ── PostgreSQL (jobs, assets, auditoria)
│ ▲
│ job pendente │ status, métricas, erro
▼ │
worker GPU ── TTS ── avatar/lip-sync ── FFmpeg ── C2PA
│
├── storage privado de entrada
└── storage privado de saída + URL temporária
PostgreSQL já basta para a primeira versão. Workers podem obter um job com FOR UPDATE SKIP LOCKED, padrão adequado a consumidores de uma tabela-fila, e atualizar seu estado na mesma transação. Documentação de SELECT. Redis, Kubernetes e um broker dedicado só entram quando houver uma necessidade medida.
Contrato de API
POST /video
Idempotency-Key: 01J...
Authorization: Bearer ...
Content-Type: application/json
{
"script": "Bem-vindo ao Portal IDEA...",
"voice_preset": "pablo-didatico-v3",
"avatar_preset": "pablo-busto-musetalk-v2",
"aspect_ratio": "16:9",
"captions": true,
"disclosure": "Este vídeo utiliza uma representação digital autorizada de Pablo.",
"webhook_url": "https://portal.example/api/video-events"
}
Resposta imediata:
HTTP/1.1 202 Accepted
Location: /video/jobs/8ba7...
{
"job_id": "8ba7...",
"status": "queued",
"estimated_cost_usd": null
}
Endpoints suficientes:
POST /video: valida e enfileira;GET /video/jobs/{id}: estado, etapa, tempo, custo e erro seguro;POST /video/jobs/{id}/cancel: cancela se a etapa permitir;GET /video/jobs/{id}/download: URL assinada curta, só após aprovação;POST /video/jobs/{id}/approve: registra QC humano;DELETE /video/jobs/{id}/assets: aplica política de retenção.
Estados: queued, tts, visual, compositing, qc_pending, approved, failed, cancelled, expired. Cada transição guarda timestamp, versão do modelo, hash dos pesos, hash das entradas, duração, caracteres, GPU, pico de VRAM/RAM, tempo, tentativas e custo do fornecedor.
Worker
- Normaliza o roteiro e resolve pronúncias sem alterar o texto exibido.
- Gera áudio ou valida o áudio enviado.
- Segmenta por frases e pausas; preserva timecodes.
- Chama um adaptador local ou SaaS. O adaptador converte a resposta para um formato interno comum.
- Consulta a operação assíncrona com backoff; não mantém uma requisição HTTP aberta por minutos.
- Verifica duração, resolução, frames, silêncio, integridade e possíveis arquivos vazios.
- FFmpeg monta vídeo, áudio, legendas e disclosure.
- Gera proxy de revisão; só depois produz o master.
- Aplica Content Credentials no arquivo final, após qualquer transcodificação.
- Dispara webhook assinado com HMAC e identificador único.
O ComfyUI recebe um workflow em POST /prompt, retorna prompt_id e expõe histórico e WebSocket. Use-o atrás do adaptador; não exponha /prompt ao usuário final, pois custom nodes e caminhos de arquivo ampliam muito a superfície de ataque. API do ComfyUI.
Segurança mínima
- Chaves de SaaS somente no backend, em secrets; nunca em browser, workflow ou log.
- Lista de presets aprovada; o cliente não envia caminho local, comando, node Python nem URL arbitrária.
- Download de URL externa apenas por allowlist, bloqueando IP privado, redirects e SSRF.
- Limites de caracteres, duração, resolução, tamanho e simultaneidade antes da fila.
- Assets com identificadores aleatórios, criptografia em repouso e URLs expiradas.
- Webhooks com HMAC, timestamp, proteção contra replay e deduplicação.
- Idempotência evita cobrar duas vezes quando o cliente repete
POST. - Containers sem privilégio, sem socket Docker e com sistema de arquivos somente leitura onde possível.
- Uma GPU não executa dois jobs grandes sem um perfil de memória comprovado.
- Erro público não contém prompt interno, caminho, token, stack trace ou dados biométricos.
- Retenção automática diferenciada para bruto, áudio, proxy, master, consentimento e log.
11. Avatar ao vivo para aulas e atendimento
Uma conversa visual completa contém ao menos: detecção de voz, STT, LLM, TTS, geração do avatar e WebRTC. “Primeiro frame em 300 ms” mede apenas parte da experiência. A métrica que importa é o intervalo entre o fim da fala da pessoa e o primeiro áudio inteligível da resposta, além da capacidade de interromper o avatar.
Shortlist realtime
| Sistema | Transporte/integração | Avatar próprio | Controle da pilha | Melhor teste |
|---|---|---|---|---|
| Tavus CVI | Daily/WebRTC e LiveKit | Replica por vídeo ou imagem | Persona, RAG, componentes | Aula/atendimento completo |
| HeyGen LiveAvatar | SDK/streaming; Full e Lite | Clone conforme plano | Lite permite sua pilha | Comparar 720p/1080p e custo de sessão |
| Runway Characters | SDK React, câmera/tela | Uma imagem | Voz, instruções e conhecimento | Tutor que enxerga tela |
| Anam | WebRTC, JS/Python/LiveKit/Pipecat | Foto em menos de 2 min anunciado | LLM/voz próprios possíveis | Latência real desde o Brasil |
| LemonSlice 2.1 | API, streaming e plugins | Imagem | Bring-your-own LLM/voz | Piloto econômico em site |
| D-ID V4 | LiveKit/SDK | V4 e avatares da família | Agente integrado | Comparar expressividade e interrupção |
| SoulX-FlashHead/LiveTalk local | Implementação própria | Foto | Controle máximo | Laboratório; servidor não vem pronto em todos |
Arquitetura de aula ao vivo
- Browser recebe token de sessão curto; a chave-mestra fica no servidor.
- WebRTC conduz áudio/vídeo; WebSocket só carrega eventos e estado.
- O LLM consulta uma base aprovada e cita internamente o material do curso.
- Perguntas fora do escopo, dados pessoais e ações sensíveis exigem escalonamento humano.
- Interrupção cancela TTS e frames pendentes; não basta silenciar o player.
- O sistema informa na abertura que é uma representação digital e mantém indicador durante a sessão.
- A conversa é registrada apenas com finalidade, base legal, prazo e aviso adequados.
Teste em rede brasileira fixa e móvel. Meça p50/p95 de conexão, primeiro frame, fim da fala→primeiro áudio, resposta completa, interrupção, reconexão e custo de tempo ocioso. Uma sessão aberta de dez minutos pode cobrar dez minutos mesmo que o avatar fale dois.
12. Custos locais, nuvem e volume
Fórmulas
custo_visual_saas = minutos_gerados × tarifa_por_minuto
minutos_gerados = minutos_aprovados / taxa_de_aprovação
custo_gpu_nuvem = minutos_aprovados × RTF_visual / 60 × US$_por_hora × fator_de_retry
custo_energia_local = minutos_aprovados × RTF_visual / 60 × kW_da_máquina × R$_por_kWh
RTF_visual aqui significa minutos de GPU por minuto final. Precisa ser medido em cada workflow; não é o RTF de áudio.
Cenários da RTX 5090
A página da Runpod consultada indicava RTX 5090 de 32 GB a partir de US$0,69/h; 4090 a US$0,34/h, A100 PCIe 80 GB a US$1,19/h e H100 PCIe a US$1,99/h. Disponibilidade, região e armazenamento mudam. Runpod GPUs.
| Cenário 5090 na nuvem | 10 min | 100 min | 500 min | 1.000 min |
|---|---|---|---|---|
| RTF 5, US$0,69/h | US$0,58 | US$5,75 | US$28,75 | US$57,50 |
| RTF 20, US$0,69/h | US$2,30 | US$23 | US$115 | US$230 |
| Energia local ilustrativa | 10 min | 100 min | 500 min | 1.000 min |
|---|---|---|---|---|
| RTF 5, máquina 0,75 kW, R$1/kWh | R$0,63 | R$6,25 | R$31,25 | R$62,50 |
| RTF 20, mesma premissa | R$2,50 | R$25 | R$125 | R$250 |
As tabelas são cenários matemáticos, não medição da sua tomada. Não incluem compra da GPU, depreciação, refrigeração, armazenamento, download, compilação, CPU, edição nem trabalho humano. Um workflow que cabe na VRAM mas produz 30% de clipes rejeitados pode custar mais que um SaaS com boa taxa de aprovação.
Orçamento combinado por perfil
| Volume aprovado/mês | Caminho provável | Faixa de atenção |
|---|---|---|
| 10 min | Piloto em 4–5 motores | Mensalidades e custo de criar clones dominam |
| 100 min | Híbrido; local para base, SaaS para takes principais | QC e taxa de aprovação já importam muito |
| 500 min | Local em lote + fornecedor apenas para premium | Automação, armazenamento e tempo do revisor |
| 1.000 min | Local ou contrato Enterprise negociado | Capacidade, filas, retenção e previsibilidade contratual |
Não gere 1.000 minutos de rosto só porque o catálogo tem 1.000 minutos de aula. Se o apresentador ocupar 30%, a carga visual cai para 300 minutos; áudio e edição permanecem.
13. Biometria, contrato, privacidade e direitos
Esta seção é orientação operacional, não parecer jurídico. No Brasil, a LGPD define dado biométrico vinculado a pessoa natural como dado pessoal sensível. Um vídeo ou áudio comum não é automaticamente um template biométrico, mas a extração de características para criar ou verificar um clone pode entrar nessa categoria. O tratamento de dados sensíveis exige uma hipótese do art. 11; consentimento, quando usado, deve ser específico, destacado e ligado a finalidades específicas. LGPD, Lei 13.709/2018.
Pablo ser o titular e consentir com seu próprio clone resolve uma parte importante, mas a empresa ainda precisa administrar fornecedores, funcionários, backups, transferências internacionais, incidentes e a eventual participação de outras pessoas.
Perguntas obrigatórias ao fornecedor
| Tema | Pergunta que precisa de resposta escrita |
|---|---|
| Entrada | Quais fotos, vídeos, áudios, transcrições, embeddings e templates são armazenados? |
| Finalidade | O material serve só ao meu clone ou também melhora modelos gerais? |
| Opt-out | Vale antes e depois do upload? É por conta, workspace ou projeto? |
| Retenção | Qual prazo para bruto, clone, logs, backups, antifraude e consentimento? |
| Exclusão | Apaga o quê, em quanto tempo e com qual comprovante? Há “desaprendizado” de pesos? |
| Suboperadores | Quais empresas, países e nuvens recebem os dados? |
| Segurança | Há criptografia, isolamento entre clientes, MFA, logs e relatório de incidente? |
| Propriedade | Quem possui entrada, saída, avatar e voz; há licença para treinamento? |
| Uso comercial | O plano e o tipo exato de avatar autorizam cursos e anúncios? |
| Portabilidade | Posso exportar o modelo, ou somente vídeos renderizados? |
| Encerramento | O que acontece com assets e direito de uso se o serviço fechar? |
| Incidente | Existe mecanismo para bloquear rapidamente a voz/avatar roubado? |
Plano de retenção proposto
| Material | Retenção inicial sugerida | Motivo |
|---|---|---|
| Masters de captura | Longo prazo, criptografados e offline | Fonte irrepetível e controlada por Pablo |
| Consentimentos | Enquanto houver clone e pelo prazo jurídico definido | Prova de autorização e escopo |
| Arquivos enviados a SaaS | Até aprovação + margem de contestação | Minimização; solicitar exclusão depois |
| Referências locais de inferência | Enquanto o preset estiver ativo | Necessárias para reproduzir |
| Outputs rejeitados | 7–30 dias, salvo incidente | Diagnóstico sem formar arquivo permanente |
| Masters publicados | Enquanto o conteúdo estiver ativo e arquivado | Reedição, auditoria e prova de origem |
| Logs técnicos | 90–180 dias sem biometria bruta | Diagnóstico e abuso; prazo deve ser ajustado |
| Backups | Ciclo definido e documentado | Exclusão precisa alcançar rotação futura |
Os prazos são uma política inicial para discussão, não prazos exigidos pela LGPD. O Portal IDEA deve documentar controlador, operadores, finalidade, acesso, descarte e resposta a incidentes. Para funcionários ou terceiros, use consentimento/contrato próprio e permita revogação conforme o fundamento aplicável; nunca reaproveite uma autorização de um curso para publicidade irrestrita.
Controles técnicos
- Masters e modelos em volume criptografado; chaves separadas do servidor de mídia.
- Acesso por função, MFA e log de leitura/download.
- Clone não aparece em biblioteca pública de vozes ou avatares.
- Tokens de voz, embeddings e checkpoints recebem a mesma proteção do áudio bruto.
- Treino e produção usam contas distintas quando o fornecedor permitir.
- Procedimento de revogação: desabilitar preset, revogar API, apagar cópias, solicitar exclusão externa e registrar evidência.
- Marca d’água discreta e Content Credentials complementam, mas não substituem o disclosure ao público.
- O sistema nunca permite que um cliente digite qualquer texto e gere Pablo sem aprovação editorial.
14. Transparência, C2PA e políticas das plataformas
Disclosure recomendado
Use uma formulação simples e permanente:
Este vídeo utiliza uma representação digital de imagem e/ou voz de Pablo, criada e autorizada por ele. O conteúdo foi revisado pela equipe do Portal IDEA.
Em vídeo curto, uma indicação no início ou na tela e a descrição são suficientes para não esconder o processo. Em aula longa, mantenha a informação na página do curso, nos créditos e no player. Para avatar ao vivo: “Você está falando com uma representação digital de Pablo, não com Pablo em tempo real.”
YouTube
O YouTube exige declaração quando IA faz uma pessoa real parecer dizer ou fazer algo que não disse ou fez, ou quando gera cena realista que não aconteceu. A central de ajuda dispensa, como exemplo, a clonagem da própria voz para narração/dublagem; isso não isenta o vídeo realista do clone, que cai na regra de alteração significativa. Preencha “Uso de IA” no upload mesmo quando a representação é autorizada. Política em português.
Divulgação não transfere direitos sobre a aparência de outra pessoa e não protege conteúdo enganoso. Também não é sinônimo de punição automática; o risco maior é omitir repetidamente uma alteração que a plataforma exige declarar. Conteúdo em massa, repetitivo e sem valor editorial pode ter problema de monetização independentemente de ter sido feito com IA.
TikTok
O TikTok exige rótulo para conteúdo gerado por IA com imagem, áudio ou vídeo realistas, incluindo pessoa real cuja imagem, voz ou palavras foram alteradas. O criador pode usar o rótulo da plataforma e também texto, sticker ou descrição. O rótulo não torna permitido conteúdo que engana de forma prejudicial ou viola outras regras. TikTok: AI-generated content.
Instagram e Facebook
A Meta usa “AI info” quando detecta sinais de ferramentas ou recebe autodeclaração. Para anúncios, a atualização de junho de 2026 estendeu detecção a ferramentas de terceiros e concentra informações em “About this ad”; um humano fotorrealista gerado por ferramentas da Meta recebe indicação perto de “Sponsored”. Transparência de anúncios. Para conteúdo orgânico realista, a regra pública exige disclosure de vídeo ou áudio digitalmente criado/alterado. Use a ferramenta de rótulo e não dependa só de metadata.
C2PA e Content Credentials
A especificação C2PA 2.3, publicada em 05/01/2026, define manifestos assinados e histórico de proveniência. Ela verifica associação e integridade das declarações, mas não decide se o conteúdo é verdadeiro. Uma credencial pode afirmar que um algoritmo treinado participou e registrar ingredientes, edição e editor. C2PA 2.3, Explainer.
O c2patool lê, valida e adiciona manifestos a áudio, imagem e vídeo. Aplique-o depois do FFmpeg final, porque uma transcodificação posterior muda o arquivo e pode invalidar a vinculação. Guarde certificado/chave de assinatura num secret manager; certificado de teste não cria confiança pública. Verifique a saída com ferramenta oficial e mantenha um disclosure legível, pois redes sociais podem remover metadata.
Conteúdo recomendado no manifesto:
- organização/autoria;
digitalSourceTypeadequado a mídia algorítmica;- hashes/ingredientes da captura e do áudio, quando não expuserem dados sensíveis;
- ferramentas e versões;
- data de finalização;
- link para a política de representação digital do Portal IDEA.
15. Matriz editorial dos dez caminhos mais interessantes
As notas de 0 a 10 abaixo são avaliações editoriais provisórias, baseadas em arquitetura, documentação, licenças e demos. Não são medições e não fingem uma audição ou renderização que não ocorreu. 0 em self-host significa indisponível para execução própria, não qualidade zero. Em preço, 10 é mais econômico. Em privacidade, 10 representa maior controle local. MuseTalk recebe nota alta em corpo porque preserva o vídeo real, não porque gera movimentos novos.
Qualidade e adequação
| Caminho | Rosto | Voz | Lip-sync | Corpo | Naturalidade | Consistência | PT-BR |
|---|---|---|---|---|---|---|---|
| HeyGen V/IV + ElevenLabs/voz real | 9 | 9 | 9 | 9 | 8 | 8 | 9 |
| Synthesia Express-2 + voz pessoal | 8 | 8 | 8 | 7 | 7 | 9 | 8 |
| Tavus Phoenix-4 | 8 | 8 | 8 | 7 | 8 | 8 | 8 |
| Hedra Character-3 + ElevenLabs/voz real | 8 | 9 | 8 | 8 | 8 | 7 | 9 |
| MuseTalk + Chatterbox pt-BR | 8 | 8 | 8 | 9 | 8 | 9 | 9 |
| EchoMimic V3 + Qwen3-TTS | 7 | 8 | 7 | 7 | 7 | 6 | 7 |
| LongCat 1.5 + Chatterbox pt-BR | 8 | 8 | 8 | 8 | 8 | 6 | 8 |
| SoulX-FlashHead + Qwen3-TTS | 8 | 8 | 8 | 5 | 8 | 7 | 7 |
| Runway Act-Two + voz real | 8 | 10 | 8 | 9 | 9 | 7 | 10 |
| Anam one-shot realtime | 7 | 7 | 8 | 7 | 8 | 7 | 8 |
Operação
| Caminho | Velocidade | Preço | API | Privacidade | Self-host | Facilidade |
|---|---|---|---|---|---|---|
| HeyGen V/IV + ElevenLabs/voz real | 8 | 4 | 8 | 4 | 0 | 9 |
| Synthesia Express-2 + voz pessoal | 8 | 6 | 5 | 6 | 0 | 9 |
| Tavus Phoenix-4 | 9 | 6 | 9 | 5 | 0 | 8 |
| Hedra Character-3 + ElevenLabs/voz real | 7 | 5 | 9 | 5 | 0 | 7 |
| MuseTalk + Chatterbox pt-BR | 7 | 9 | 7 | 10 | 10 | 5 |
| EchoMimic V3 + Qwen3-TTS | 6 | 9 | 6 | 10 | 10 | 4 |
| LongCat 1.5 + Chatterbox pt-BR | 3 | 8 | 6 | 10 | 10 | 3 |
| SoulX-FlashHead + Qwen3-TTS | 9 | 9 | 7 | 10 | 10 | 4 |
| Runway Act-Two + voz real | 6 | 7 | 9 | 5 | 0 | 7 |
| Anam one-shot realtime | 10 | 8 | 9 | 5 | 0 | 9 |
Não some as colunas para inventar um campeão. A importância muda por uso: self-host e privacidade pesam muito em produção interna; facilidade e consistência podem pesar mais numa campanha que precisa sair amanhã. O benchmark proposto mais adiante substitui estas notas por observações de Pablo.
16. Melhores por categoria
| Categoria | Escolha inicial | Alternativa | Motivo e ressalva |
|---|---|---|---|
| Melhor no geral para Pablo | Fluxo híbrido: vídeo real + MuseTalk + voz real/Chatterbox | HeyGen V/IV | Preserva atuação e controla custo; precisa de biblioteca de takes |
| Melhor SaaS | HeyGen V/IV | Synthesia | Melhor equilíbrio documental; créditos e privacidade exigem atenção |
| Melhor para cursos corporativos | Synthesia | Colossyan | Edição, treinamento, interatividade e governança; não é o mais livre visualmente |
| Melhor open source operacional | MuseTalk 1.5 | EchoMimic V3 | Licença mais clara e problema pequeno; altera só a região necessária |
| Melhor híbrido | MuseTalk + Chatterbox/Qwen + SaaS seletivo | Vídeo real + ElevenLabs + Hedra | Custo, identidade e liberdade equilibrados |
| Melhor PT-BR local | Chatterbox Multilingual V3 pt-BR | Qwen3-TTS Base | Pacote brasileiro explícito; a escolha final depende de audição |
| Melhor PT-BR comercial | ElevenLabs PVC | Google Chirp 3 ICV | Suporte e produto maduros; Google exige allowlist |
| Melhor custo visual SaaS comparável | Hedra 540p/720p | Runway Act-Two | Tarifa nominal menor; qualidade e taxa de aprovação podem inverter |
| Melhor valor local | MuseTalk + Chatterbox | EchoMimic V3 + Qwen | Usa hardware existente e licenças candidatas a comercial |
| Maior qualidade absoluta | Gravação real bem produzida | Performance real + Act-Two/HeyGen seletivo | Nenhum clone deve ser presumido superior ao próprio sujeito |
| Melhor API offline | Hedra | HeyGen | Esquema simples, áudio externo e preço claro; não é Twin treinado |
| Melhor API realtime | Tavus CVI | Anam/LiveAvatar | Componentes e transporte maduros; comparar preço e latência no Brasil |
| Melhor projeto moderno de qualidade | LongCat-Video-Avatar 1.5 | SoulX-LiveAct | MIT e recursos ambiciosos; pesado e ainda exige teste 5090 |
| Melhor projeto moderno de velocidade | SoulX-FlashHead | Ditto | Benchmarks de throughput fortes; request completo pode ser bem mais lento |
| Melhor para corpo dirigido | Wan Animate | MimicMotion/Act-Two | Usa performance; lip-sync pode exigir etapa adicional |
| Melhor para duas pessoas | MultiTalk | Composição de tomadas separadas | Evita trocar a fala entre rostos; aumenta complexidade de QC |
| Melhor para 3D | NVIDIA Audio2Face-3D | Pipeline próprio em Unreal | Controle de rig; custo artístico alto para o duplo fiel |
| Projeto desconhecido que merece atenção | MOSS-TTS v1.5 | GAIR LiveTalk | Licença/serving modernos; ainda menos simples que as opções principais |
| Melhor para privacidade | Pipeline totalmente local | Contrato Enterprise com ZDR específico | ZDR precisa cobrir clonagem, não apenas inferência |
Top 10 para o projeto, em ordem de teste
- MuseTalk 1.5 + voz real/Chatterbox pt-BR: melhor ponto de partida para cursos.
- HeyGen Avatar V e IV: referência comercial; testar ambos porque usuários relatam regressões por input.
- Hedra Character-3: comparador de foto + áudio com custo transparente.
- Chatterbox Multilingual V3 e Qwen3-TTS: duelo local de voz PT-BR.
- SoulX-FlashHead Lite/Pro: caminho de baixa latência na 5090.
- LongCat-Video-Avatar 1.5: geração local moderna e expressiva.
- Synthesia Express-2: referência para cursos e governança.
- Tavus Phoenix-4: referência realtime e de agente.
- Runway Act-Two: atuação dirigida para clipes especiais.
- EchoMimic V3/Flash: foto animada permissiva e adaptável a VRAM menor.
A posição 1 não declara que MuseTalk tem o rosto mais fotorrealista. Ela reflete adequação: Pablo já tem corpo, rosto, estúdio e uma 5090; alterar menos pixels pode ser a solução mais eficiente e fiel.
17. Demonstrações e experiências de usuários
Material oficial útil
| Projeto | Demonstração/documentação | Como usar a evidência |
|---|---|---|
| HeyGen Avatar V | Relatório e comparações | Ver alcance e casos selecionados; não calcular taxa de sucesso |
| Synthesia | Custom Avatar | Entender captura e tipos; confirmar qual motor aparece no vídeo |
| Tavus | CVI | Examinar arquitetura e fluxo realtime |
| Kling Avatar 2.0 | Showcase oficial | Observar gestos, canto e clipes longos escolhidos pela empresa |
| Runway Act-Two | Academy | Comparar performance de entrada e resultado |
| LongCat 1.5 | Repositório e exemplos | Fixar versão e reproduzir, não aceitar só o melhor clipe |
| SoulX FlashHead | Código, pesos e demos | Distinguir Lite/Pro e hardware do benchmark |
| Chatterbox pt-BR | Space brasileira | Testar sotaque com texto próprio, não só exemplo pronto |
| Qwen3-TTS | Repositório | Comparar Base, CustomVoice e VoiceDesign corretamente |
| Veo 3.1 | Documentação e exemplos | Usar como B-roll; os exemplos não comprovam clone longo |
Fontes independentes e comunidade
- Tight Studio, 23/08/2026 publicou vídeos, tempo e memória para vários modelos. O ambiente, GPU e resolução variam, e a empresa vende implementação; ainda assim, é mais útil que repetir benchmarks dos autores.
- Simon Willison, 22/01/2026 clonou a própria voz no Qwen3-TTS e publicou o áudio. É uma demonstração independente em inglês, não prova de PT-BR.
- Hacker News: Qwen3-TTS reúne experiências e críticas de operação. Hardware e amostras não são controlados.
- Reddit/LocalLLaMA: Qwen3-TTS mostra a distância entre a latência destacada no lançamento e configurações comuns, além de relatos sobre português.
- Reddit/HeyGen, abril de 2026 contém relatos de dentes e lábios piores no V para certos materiais. Um participante declarou vínculo com concorrente; é sinal para testar, não prova de inferioridade universal.
- Reddit/HeyGen, maio de 2026 relata diferença entre preview de criação e render posterior. Reforça a necessidade de usar o roteiro próprio.
- Feisworld: Synthesia custom avatar 2026 é uma experiência externa com vídeo, ainda sujeita ao fluxo e material daquela autora.
- Hacker News: LemonSlice documenta o lançamento e perguntas de desenvolvedores; não é benchmark da versão 2.1.
- Reddit/Instructional Design favorece uso breve de avatar e visuais didáticos em vez de uma cabeça falante contínua. É opinião de comunidade, mas combina com princípios de desenho instrucional.
Não foi localizado um benchmark independente de 2026 que compare, com o mesmo locutor brasileiro, as versões atuais de todos os SaaS e modelos locais. Por isso a pesquisa não declara um vencedor de realismo absoluto.
18. Benchmark reproduzível de três minutos
Objetivo
Escolher uma combinação para produção, medir custo por minuto aprovado e criar um conjunto que possa ser repetido após atualizações. O baseline é uma gravação real do mesmo roteiro; ela não concorre como “sexto sistema”, serve de referência.
Cinco sistemas visuais
- HeyGen Avatar V, com o IV como subteste se os créditos permitirem.
- Synthesia Personal Photo/Express-2; registrar a limitação de API.
- Hedra Character-3 em 1080p.
- MuseTalk 1.5 sobre vídeo-base real.
- LongCat-Video-Avatar 1.5 INT8 local.
SoulX-FlashHead é o sexto opcional voltado à velocidade. Tavus/Anam ficam num benchmark realtime separado porque comparar uma sessão interativa com MP4 offline seria injusto.
Cinco vozes
- Voz real de Pablo.
- ElevenLabs PVC.
- Cartesia Sonic 3.6 PVC.
- Chatterbox Multilingual V3 pt-BR.
- Qwen3-TTS Base 1.7B.
Na fase visual, todos devem receber o mesmo áudio real quando o produto permitir. Na fase de voz, use a mesma referência e texto; combine cada voz apenas com o visual vencedor depois. Isso evita atribuir um erro de TTS ao lip-sync.
Roteiro de três minutos
| Tempo | Conteúdo | O que provoca |
|---|---|---|
| 0:00–0:30 | Apresentação calma do Portal IDEA | Identidade, voz neutra e contato visual |
| 0:30–1:00 | Datas, R$19,90, 37%, 2.026, siglas e URL fictícia | Normalização, sincronização e inteligibilidade |
| 1:00–1:30 | Pergunta, pausa, explicação animada e frase séria | Prosódia, piscadas, emoção e transição |
| 1:30–2:00 | Docker, Debian, Tailscale, PostgreSQL e nomes brasileiros | Mistura PT/EN e pronúncia técnica |
| 2:00–2:30 | Comparação usando mãos e apontando dois lados | Corpo, dedos e relação gesto–fala |
| 2:30–3:00 | Silêncio breve, retomada, chamada para ação e despedida | Idle, respiração, consistência e final de tomada |
Não use número de telefone, CPF ou endereço real. Grave três referências visuais: busto neutro, plano médio com mãos e leve rotação de cabeça. Mantenha um arquivo mestre e uma planilha/JSON de parâmetros.
Condições
- Executar três seeds/tentativas quando o sistema oferecer aleatoriedade.
- Manter áudio, resolução solicitada, aspecto e duração iguais; conservar também a saída nativa.
- Não interpolar 24 para 30 fps antes da avaliação.
- Registrar primeiro job “frio” e segundo “quente” nos modelos locais.
- Anotar créditos debitados, inclusive falhas e regenerações.
- Usar versões fixas, hashes de pesos e data/hora.
- Misturar a ordem e ocultar nome do motor para avaliadores.
Avaliação visual e auditiva
Um painel de 8–12 falantes brasileiros, incluindo Pablo e pessoas familiarizadas ou não com ele, dá notas de 1 a 5 para:
- semelhança de rosto e voz;
- naturalidade sem conhecer o original;
- boca/mandíbula/dentes;
- olhar, piscadas e microexpressões;
- pescoço, ombros, mãos e corpo;
- sotaque, pronúncia e clareza;
- emoção e ritmo;
- conforto após três minutos;
- confiança para associar o conteúdo a Pablo.
Peça também comentários livres e uma escolha forçada A/B contra o baseline real. Média sozinha pode esconder um defeito grave; relate mediana, dispersão e quantidade de rejeições.
Medidas técnicas
| Medida | Como registrar | Limite de interpretação |
|---|---|---|
| Tempo frio/quente | Do job aceito ao arquivo válido | SaaS inclui fila e rede; local inclui carga/compilação |
| Pico de VRAM/RAM | nvidia-smi + métricas do processo | Não revela qualidade |
| Frames gerados/s | Frames ÷ tempo da etapa visual | Diferente do FPS do arquivo |
| Custo bruto | Cobrança real do painel/API | Não inclui revisão |
| Taxa de aprovação | duração aprovada ÷ gerada | Depende do padrão editorial |
| Custo/min aprovado | custo total ÷ duração aprovada | Melhor indicador financeiro |
| Sincronização | revisão quadro a quadro e métrica auxiliar | SyncNet não detecta boca estranha |
| Inteligibilidade | transcrição humana/ASR e lista de termos críticos | WER baixo não prova identidade ou naturalidade |
| Estabilidade | contagem de alterações visíveis por minuto | Definir antes o que conta como falha |
Portões de aprovação
Defina os limites antes de ver o nome do vencedor. Uma política inicial razoável:
- nenhum erro em nome da marca, valor, data ou afirmação;
- nenhuma mutação crítica de rosto, dentes, mãos ou roupa no master;
- mediana mínima 4/5 em identidade e inteligibilidade;
- maioria dos avaliadores considera o trecho confortável para aula;
- licença e termos aprovados para uso comercial;
- custo/min aprovado e prazo dentro do orçamento do Portal IDEA;
- procedimento de exclusão e disclosure implementados.
Esses portões são proposta do projeto, não padrão científico. Se nenhum sistema passar, a conclusão correta é usar gravação real e repetir o teste quando versões mudarem.
Artefatos a guardar
benchmark-avatar-2026-09/
README.md
consentimentos/
entradas/hashes.sha256
roteiros/visual.md
roteiros/voz.md
parametros/{sistema}-{versao}.json
metricas/jobs.csv
avaliacoes/anonimizadas.csv
saidas-nativas/
saidas-normalizadas/
relatorio-final.md
Esse diretório deve ficar privado. Publicar apenas trechos autorizados, metodologia, resultados agregados e parâmetros que não revelem biometria ou chaves.
Recomendações práticas
A decisão que eu tomaria agora
Construiria o primeiro lote do Portal IDEA com vídeo-base real + MuseTalk + voz real. Em paralelo, treinaria/testaria Chatterbox pt-BR e Qwen3-TTS para roteiros novos. HeyGen V/IV e Hedra seriam os dois comparadores pagos. Essa combinação usa a 5090, preserva o corpo real, reduz dependência de créditos e ainda mede o nível de qualidade comercial disponível.
Não assinaria plano anual nem enviaria 60 minutos de biometria antes de concluir o benchmark de três minutos. Também não começaria por fine-tuning ou corpo inteiro. Um clone de busto estável e uma voz correta geram mais valor que uma demonstração ambiciosa cheia de falhas.
Pilha local proposta
| Camada | Escolha inicial | Por quê |
|---|---|---|
| Sistema | Debian/Ubuntu já administrado por Pablo | Drivers, Docker e ferramentas conhecidos |
| API | FastAPI | As bibliotecas de inferência já são Python; evita ponte Node desnecessária |
| Banco/fila | PostgreSQL | Jobs, locks, auditoria e estado no mesmo componente |
| Voz A | Chatterbox Multilingual V3 pt-BR | Pacote brasileiro e licença MIT verificada |
| Voz B | Qwen3-TTS Base 1.7B | Clone Apache-2.0 e comparação forte |
| Vídeo principal | MuseTalk 1.5 | Área alterada pequena e uso comercial documentado |
| Foto experimental | EchoMimic V3/Flash | Apache-2.0 e modo low-VRAM |
| Vídeo experimental | LongCat 1.5 INT8 | Modelo atual, MIT, mais expressivo |
| Orquestração visual | CLI/JSON; ComfyUI interno para experimentos | Reprodutibilidade na produção, velocidade no laboratório |
| Montagem | FFmpeg | Segmentação, áudio, legendas, encode e validação |
| Proveniência | c2patool | Manifesto assinado depois do master final |
| Armazenamento | Diretório privado em NVMe/NAS com backup criptografado | Suficiente no início; objeto/S3 só quando necessário |
| Acesso | localhost ou Tailscale autenticado | Não publicar Gradio/ComfyUI |
Use containers separados para modelos com dependências incompatíveis. A API e o PostgreSQL podem subir sempre; o worker GPU carrega só o preset do job. Fixe imagens por digest e repositórios por commit. Não faça atualização automática de modelo em produção.
Plano de 30 dias
Dias 1–3: aprovar política de clone, disclosure, acesso e retenção; criar contas com MFA; definir orçamento e portões do benchmark.
Dias 4–7: montar estúdio e gravar 30 minutos de vídeo/voz. Separar masters, consentimentos e referências. Fazer um take real de três minutos.
Dias 8–12: instalar Chatterbox, Qwen3-TTS e MuseTalk em ambientes isolados. Registrar commits, licenças, pesos, VRAM e tempos. Não disponibilizar API pública.
Dias 13–17: criar amostras HeyGen e Hedra. Adicionar Synthesia se treinamento corporativo for prioridade imediata. Solicitar exclusão de testes que não serão mantidos.
Dias 18–21: executar benchmark cego. Calcular custo/min aprovado, não apenas gerado. Escolher um visual principal, um fallback e uma voz principal.
Dias 22–26: implementar /video, tabela de jobs, worker único, FFmpeg e URLs temporárias. Adicionar webhook somente se já houver consumidor real.
Dias 27–30: produzir um módulo curto, revisar em computador e celular, aplicar disclosure/C2PA e publicar para um grupo limitado. Coletar conforto, confiança e retenção de aprendizagem.
Quando usar cada formato
| Conteúdo | Formato recomendado |
|---|---|
| Aula técnica longa | Pablo real nas aberturas + vídeo-base/MuseTalk + captura de tela |
| Atualização de uma frase | TTS aprovado + MuseTalk sobre take compatível |
| Anúncio principal | Gravação real ou HeyGen/Act-Two com QC quadro a quadro |
| Reels frequentes | Avatar comercial ou Hedra em tomadas curtas, sempre rotulado |
| Vídeo institucional | Real como referência; clone apenas onde traz benefício concreto |
| Curso traduzido | Voz traduzida revisada + lip-sync; divulgar alteração |
| FAQ no site | Texto/voz primeiro; Anam/LemonSlice/Tavus só se vídeo aumentar conversão |
| Aula ao vivo | Pablo real; avatar conversacional como assistente identificado, não substituto silencioso |
Critérios de compra
- A amostra de Pablo passa nos portões de identidade e conforto.
- A tarifa contratada inclui o tipo de avatar e a API desejados.
- A empresa esclarece treino, opt-out, retenção, backups e suboperadores.
- Existe procedimento de exportar masters e continuar sem o fornecedor.
- Custo por minuto aprovado é menor que a alternativa, contando retries e revisão.
- O contrato autoriza publicidade e cursos monetizados.
- A plataforma permite disclosure e não bloqueia Content Credentials.
- Suporte e SLA são adequados ao volume; o produto não está apenas em beta sem compromisso.
Riscos e respostas
| Risco | Resposta |
|---|---|
| Roubo do clone | Assets privados, MFA, acesso por função, revogação e monitoramento |
| Mudança de preço | Limites mensais, alerta de consumo, exportar masters, fallback local |
| Regressão do modelo | Fixar versão; benchmark de regressão antes de trocar alias latest |
| Erro de conteúdo | Roteiro aprovado; agente realtime limitado a fontes e escalonamento humano |
| Rejeição do público | Disclosure claro, uso moderado e opção de assistir à gravação real |
| Artefato em mãos/rosto | Enquadramento simples, tomadas curtas, QC e fallback real |
| Licença incompatível | Registro por código, pesos, backbone, dataset e output; revisão antes da produção |
| Serviço encerra | Não depender do clone hospedado como único master; manter pipeline local |
Conclusão
Em setembro de 2026, já é possível criar uma representação digital convincente de Pablo para trechos de aula, anúncios e vídeos institucionais. Ainda não existe uma escolha universal que seja simultaneamente a mais fiel, barata, portátil, privada, simples e expressiva. Os produtos comerciais mais fortes simplificam a operação, mas prendem o clone ao fornecedor; os modelos locais dão controle, mas transferem manutenção e revisão para sua equipe.
O caminho recomendado é deliberadamente conservador: mudar menos do material real. Uma boa biblioteca de vídeos de Pablo, voz real ou clone PT-BR aprovado e MuseTalk oferecem uma base sólida. HeyGen e Hedra mostram quanto se ganha ao comprar geração comercial; SoulX, EchoMimic e LongCat mostram até onde a RTX 5090 pode levar o laboratório local. Synthesia faz sentido quando o problema central é construir cursos, e Tavus/Anam/LiveAvatar quando o produto é uma conversa.
O benchmark de três minutos é a próxima ação. Ele deve decidir com o rosto e a voz de Pablo, não com demos escolhidas por fornecedores. Se nenhum clone superar os portões de confiança, a gravação real continua sendo a solução certa. Isso também é um resultado útil.
Fontes consultadas
Avatares comerciais e vídeo
- HeyGen — Avatar V
- HeyGen — preços
- HeyGen — preços da API
- Synthesia — comparação de tipos de avatar
- Synthesia — preços
- Tavus — CVI
- LiveAvatar — documentação
- Captions/Mirage — preço da API
- D-ID — V4 Expressive
- Hedra — Character-3
- Runway — Act-Two
- Runway — preços da API
- Kling — Avatar 2.0
- MiniMax — H3
- Google — Veo 3.1 na Gemini API
- Google — preços Gemini/Veo
- Adobe — Firefly Avatar API
- OpenAI — descontinuações da API
Modelos visuais locais
- LivePortrait
- MuseTalk
- LatentSync
- EchoMimic V3
- InfiniteTalk
- MultiTalk
- Wan2.2
- LongCat-Video
- SoulX-FlashHead
- SoulX-LiveAct
- NVIDIA Audio2Face-3D
- ComfyUI — API do servidor
Voz
- OpenAI — Text to Speech e custom voices
- ElevenLabs — Professional Voice Cloning
- Cartesia — voice cloning
- Google — Chirp 3 Instant Custom Voice
- Azure — Personal Voice
- Qwen3-TTS
- Chatterbox
- Chatterbox Multilingual pt-BR
- MOSS-TTS
- Fish Speech
- F5-TTS
- OpenVoice
Direitos, transparência e infraestrutura
- Lei Geral de Proteção de Dados
- YouTube — transparência de conteúdo com IA
- TikTok — AI-generated content
- Meta — transparência de anúncios com GenAI
- C2PA — especificação 2.3
- Content Authenticity Initiative — c2patool
- Runpod — GPUs e preços
- PostgreSQL — SELECT e SKIP LOCKED
Experiências e avaliações externas
- Tight Studio — teste de modelos open source de avatar
- Simon Willison — Qwen3-TTS
- Hacker News — discussão Qwen3-TTS
- Reddit — Avatar IV versus V
- Feisworld — custom avatar Synthesia em 2026
Nota sobre atualidade
Pesquisa concluída em 5 de setembro de 2026. Modelos, preços, termos, limites de API e políticas de plataforma mudam rapidamente; confirme a versão atual das fontes oficiais e os termos contratuais antes de enviar biometria, assinar planos ou publicar em escala.
Did this resonate?
Related documents
- 001
- 002
- 003
- 004
- 005