A IA não usa a sua frase como ela foi escrita. Ela extrai dela uma descrição organizada, que funciona como uma lista de instruções para as etapas seguintes. Essa descrição costuma responder a quatro perguntas: o que aparece na cena, o que acontece nela, como a imagem deve parecer e quanto tempo o trecho deve durar. O que não estiver escrito fica em aberto, e a IA preenche essa lacuna com uma escolha própria.
Um pedido que já traz os quatro elementos
"Um cachorro correndo na praia ao pôr do sol, em estilo realista, 5 segundos." Cena: cachorro, praia, pôr do sol. Ação: correr. Estilo: realista. Duração: 5 segundos. Como nada ficou em aberto, sobra pouca margem para a IA decidir por conta própria.
Por que o mesmo texto pode gerar vídeos diferentes
Dois motivos se somam. Primeiro, a descrição extraída do texto não é única: pequenas diferenças de interpretação mudam o que é pedido. Segundo, o próprio processo de geração tem variação, então a mesma descrição pode ser executada de formas ligeiramente distintas. A clareza do pedido não garante um resultado exato, mas reduz muito o espaço para surpresas.