De efeitos visuais à geração de cenas completas, a
inteligência artificial começa a ocupar diferentes etapas da produção
audiovisual. Ainda está longe de substituir o processo de realização de um
filme, mas já reduz tempo e custos, altera rotinas profissionais e permite
criar imagens que antes não caberiam em determinados orçamentos. Ao mesmo
tempo, novas ferramentas começam a avançar sobre uma fronteira diferente:
produzir imagem, movimento, diálogos e sons sem que uma câmera tenha registrado
a cena.
Segundo a empresa, a sequência foi concluída dez vezes mais
rápido do que seria pelos métodos tradicionais de efeitos visuais. A Netflix
acrescentou que realizar o mesmo trabalho convencionalmente teria um custo
incompatível com o orçamento da série. O caso tornou-se especialmente revelador
porque retira a discussão sobre inteligência artificial do terreno das
previsões. A tecnologia já está sendo utilizada profissionalmente e começa a
alterar decisões concretas sobre o que pode ou não ser colocado na tela.
Isso não significa que os grandes estúdios estejam
entregando filmes inteiros à inteligência artificial. O processo é mais gradual
e fragmentado. Diferentes ferramentas estão sendo incorporadas a etapas
específicas da produção, desde a concepção visual anterior às filmagens até
efeitos, transformação de rostos e vozes e montagem.
Ao mesmo tempo, uma segunda frente começa a avançar mais
rapidamente. Sistemas generativos já conseguem produzir pequenos trechos
audiovisuais nos quais a imagem, os personagens, os movimentos de câmera, as
falas e os sons podem ser criados digitalmente, sem que aquela cena tenha sido
filmada.
São duas transformações relacionadas, mas diferentes. Em
uma, a inteligência artificial entra no processo tradicional de fazer um filme
e modifica determinadas etapas. Na outra, começa a gerar o próprio material
audiovisual que antes dependeria de uma filmagem, animação ou efeitos digitais
convencionais.
ANTES DE COMEÇAR A FILMAR
Boa parte do trabalho de um filme ocorre antes que a câmera
seja ligada. Diretores e suas equipes desenvolvem referências visuais, desenham
personagens e cenários, produzem storyboards e, em projetos mais complexos,
constroem versões preliminares das sequências para decidir como serão
realizadas.
A IA generativa está reduzindo o tempo necessário para
produzir algumas dessas alternativas. A partir de descrições, desenhos e
imagens de referência, artistas podem gerar rapidamente diferentes
possibilidades para um cenário ou personagem e produzir versões preliminares de
uma sequência. O trabalho humano permanece necessário para escolher, corrigir e
dirigir o resultado, mas aumenta consideravelmente o número de alternativas que
pode ser experimentado em determinado período.
Os grandes estúdios já observam essa possibilidade. A
Lionsgate, responsável por franquias como John Wick e Jogos Vorazes,
estabeleceu uma parceria com a empresa de inteligência artificial Runway para
desenvolver aplicações destinadas ao processo de produção, incluindo storyboard
e previsualização.
O interesse econômico é evidente. Decisões tomadas com maior
rapidez antes das filmagens podem evitar reconstruções, novas diárias de
estúdio e retrabalho posterior. Nesse estágio, a inteligência artificial pode
não aparecer diretamente na tela e o espectador dificilmente saberá que foi
utilizada, embora seus efeitos sejam percebidos no tempo e nos recursos
necessários para produzir o filme.
QUANDO A IMAGEM NÃO ESTAVA DIANTE DA CÂMERA
Os efeitos visuais constituem uma das áreas em que a
transformação é mais fácil de perceber. Criar uma cidade inexistente, destruir
digitalmente um prédio ou colocar milhares de pessoas em uma batalha exige
tradicionalmente várias especialidades. Objetos precisam ser modelados em três
dimensões, superfícies recebem texturas, movimentos são animados, partículas
são simuladas, iluminação é construída e as imagens precisam ser renderizadas e
integradas às cenas filmadas.
A inteligência artificial não eliminou esse processo, mas
começou a executar ou acelerar partes dele. Sistemas generativos podem produzir
elementos de uma imagem a partir das orientações e referências fornecidas pelos
artistas, diminuindo o trabalho necessário para chegar a determinados
resultados.
A série bíblica House of David, da Amazon, levou essa
utilização a uma escala maior. A segunda temporada empregou inteligência
artificial em mais de 350 planos, segundo levantamento publicado pela revista
americana Wired. A tecnologia participou da criação e ampliação de
exércitos, ambientes e elementos de grandes sequências. Seus realizadores
afirmam que parte dessas imagens não poderia ser produzida na mesma escala
dentro do orçamento disponível pelos métodos tradicionais.
Os dois exemplos introduzem uma consequência que vai além da
redução de despesas. Se determinadas imagens se tornam mais baratas, produções
menores passam a considerar cenas que anteriormente seriam eliminadas ainda no
roteiro. Para um blockbuster de 200 milhões de dólares, reduzir o custo de uma
sequência pode representar apenas eficiência financeira. Para um filme de
poucos milhões, a mesma redução pode determinar se a sequência existirá.
ROSTOS, VOZES E INTERPRETAÇÕES
Em Here, dirigido por Robert Zemeckis, tecnologia
desenvolvida pela empresa Metaphysic foi utilizada para mostrar Tom Hanks e
outros integrantes do elenco em diferentes idades. Rejuvenescimento digital não
é novidade no cinema, mas o processo tradicional costuma depender de um extenso
trabalho de pós-produção realizado depois das filmagens. No filme de Zemeckis,
os rostos transformados podiam ser visualizados ainda durante a realização das
cenas, permitindo que diretor e atores avaliassem imediatamente o efeito.
Em O Brutalista, de Brady Corbet, a intervenção
ocorreu na voz. Adrien Brody e Felicity Jones interpretam personagens húngaros,
e uma tecnologia desenvolvida pela Respeecher foi utilizada na pós-produção
para aperfeiçoar determinados fonemas da pronúncia. O sistema não criou as
interpretações nem substituiu as vozes dos atores. A intenção foi preservar
ritmo, emoção e características vocais enquanto pequenos elementos da pronúncia
eram corrigidos.
Outra utilização ocorreu em Emilia Pérez, no qual
ferramentas de processamento vocal ajudaram a combinar características de vozes
durante passagens musicais. Esses casos mostram que a questão não se resume à
possibilidade mais extrema de criar atores digitais. A IA pode penetrar na
interpretação de maneira quase imperceptível, modificando aspectos específicos
de uma performance que continua sendo essencialmente humana.
Essa capacidade também torna mais difícil estabelecer
limites. Quanto mais sofisticada se torna a possibilidade de modificar rostos e
vozes, maior é a necessidade de determinar quem pode autorizar essas
alterações, durante quanto tempo uma imagem digital pode ser utilizada e de que
maneira o profissional deve ser remunerado.
E SE A CENA NÃO FOR FILMADA?
As ferramentas mais recentes de geração de vídeo introduzem
uma possibilidade diferente.
Sistemas como Veo, desenvolvido pelo Google DeepMind,
já conseguem produzir sequências audiovisuais a partir de instruções escritas e
imagens de referência. O Flow, ferramenta do Google voltada à criação
audiovisual, utiliza modelos como o Veo para permitir que o usuário desenvolva
cenas, controle personagens e ambientes e experimente diferentes movimentos de
câmera. As versões mais recentes também podem gerar áudio, incluindo diálogos,
ruídos e outros elementos sonoros.
Na prática, isso significa que uma pessoa pode descrever uma
situação, estabelecer referências visuais e obter um pequeno trecho no qual
personagens se movimentam, a câmera percorre o ambiente e sons acompanham a
ação, embora aquela cena nunca tenha existido diante de uma câmera.
A diferença em relação aos efeitos visuais tradicionais é
considerável. Mesmo uma cena inteiramente criada por computação gráfica costuma
ser construída por equipes que modelam objetos e personagens, animam seus
movimentos, determinam iluminação, posicionam câmeras virtuais e integram os
diferentes elementos. Nos sistemas generativos, parte significativa desse
resultado pode surgir diretamente das instruções e referências fornecidas ao
modelo.
Isso não equivale a produzir um longa-metragem. Os sistemas
atuais ainda apresentam dificuldades de continuidade, consistência dos
personagens e controle preciso sobre acontecimentos que precisam se desenvolver
durante várias cenas. Uma imagem pode funcionar durante alguns segundos e
apresentar problemas quando o personagem precisa permanecer exatamente o mesmo,
usar a mesma roupa, ocupar um espaço coerente e continuar uma ação iniciada
anteriormente.
A importância da tecnologia, entretanto, não depende de ela
já conseguir realizar sozinha um filme de duas horas. Pela primeira vez,
ferramentas acessíveis começam a reunir funções que antes estavam distribuídas
por diferentes etapas da produção audiovisual.
UM PEQUENO ESTÚDIO DENTRO DO COMPUTADOR
É fora dos grandes estúdios que essa capacidade pode
produzir seus efeitos mais rapidamente.
O YouTube incorporou ferramentas generativas ao Shorts e
passou a oferecer recursos capazes de auxiliar também na montagem. Um sistema
pode examinar o material gravado, selecionar trechos e preparar um primeiro
corte, deixando para o criador as decisões posteriores de revisão e acabamento.
Outras ferramentas permitem gerar diretamente imagens e pequenos vídeos.
Para uma produtora, automatizar uma etapa representa
principalmente economia de tempo ou dinheiro. Para uma pessoa trabalhando
sozinha, a consequência pode ser mais profunda porque recursos antes
inacessíveis passam a estar disponíveis.
Uma sequência que exigiria locação, câmera, iluminação,
figurino, atores e pós-produção pode, em determinadas circunstâncias, ser
simulada em um computador. Um criador pode produzir imagens de lugares onde
nunca esteve, personagens que não foram interpretados por atores e movimentos
de câmera que não foram realizados por uma câmera física.
Isso não significa que uma pessoa diante de um computador
tenha adquirido todas as competências de uma equipe cinematográfica. Escolher
uma imagem, construir uma narrativa, dirigir uma interpretação e determinar
ritmo continuam sendo decisões criativas. A facilidade de gerar material também
pode produzir grandes quantidades de imagens tecnicamente impressionantes e
artisticamente irrelevantes.
O que mudou é a relação entre recursos disponíveis e
capacidade de produzir. A barreira econômica para criar determinados tipos de
imagem começou a cair, e esse movimento pode ter consequências especialmente
importantes para produtores independentes e pequenas empresas audiovisuais.
HOLLYWOOD ADOTA A TECNOLOGIA COM CAUTELA
Uma projeção da consultoria Deloitte para 2025 estimava que
os grandes estúdios destinariam menos de 3% de seus orçamentos de produção à
inteligência artificial generativa. A adoção ocorreria inicialmente com maior
intensidade em áreas como marketing, localização e dublagem e em funções
específicas dentro da produção.
Os acontecimentos posteriores parecem confirmar parte dessa
previsão. A Netflix utilizou IA generativa em El Eternauta. A Lionsgate
estabeleceu parceria com a Runway. A Amazon MGM criou uma iniciativa voltada ao
desenvolvimento de aplicações de inteligência artificial para cinema e
televisão. Nenhum desses movimentos representa o abandono do modelo tradicional
de produção, mas todos indicam que a tecnologia começou a ser incorporada à
estrutura dos estúdios.
A inteligência artificial, nesse sentido, entrou em
Hollywood pelas bordas. Em vez de substituir de uma só vez atores, diretores ou
equipes inteiras, começou realizando tarefas delimitadas: criando uma imagem
preliminar, alterando um rosto, corrigindo uma pronúncia, ampliando uma
multidão ou produzindo parte de um efeito visual.
Ao mesmo tempo, ferramentas como Flow e Veo mostram que
existe uma segunda trajetória acontecendo fora desse processo incremental.
Enquanto os estúdios incorporam IA a uma cadeia de produção já existente,
sistemas generativos começam a demonstrar que algumas dessas etapas podem ser
condensadas dentro da mesma ferramenta. As duas tendências ainda estão
distantes de convergir completamente, mas a possibilidade ajuda a explicar por
que a discussão desperta tanta atenção na indústria.
UMA DISCUSSÃO QUE CHEGOU AOS CONTRATOS DE TRABALHO
Talvez a demonstração mais concreta de que a questão deixou
de ser apenas tecnológica esteja nas negociações trabalhistas de Hollywood.
A SAG-AFTRA, sindicato que representa atores e outros
profissionais, estabeleceu regras para a criação e utilização de réplicas
digitais, incluindo condições relacionadas a consentimento e remuneração. O
Writers Guild of America negociou proteções relativas à inteligência artificial
e ao eventual uso de obras para treinamento de sistemas generativos. A
Directors Guild of America também incluiu a tecnologia entre os assuntos
relevantes de suas negociações.
Nenhuma dessas medidas permite concluir que a inteligência
artificial provocará uma eliminação maciça de empregos no audiovisual. Os
efeitos sobre o mercado de trabalho ainda estão sendo medidos e provavelmente
serão diferentes entre as diversas profissões.
As negociações demonstram, entretanto, que a indústria já
reconhece conflitos concretos. Se uma réplica digital de um ator pode continuar
sendo utilizada depois da filmagem, torna-se necessário definir quem controla
aquela imagem. Se um sistema pode produzir textos a partir de grandes
quantidades de obras anteriores, roteiristas querem saber em que condições seus
trabalhos podem integrar o treinamento. Se partes do processo criativo passam a
ser automatizadas, sindicatos precisam discutir quais atividades permanecem
protegidas pelos contratos profissionais.
A regulamentação começa, assim, a ser construída enquanto a
tecnologia continua avançando.
A ECONOMIA PODE MUDAR ANTES DA ESTÉTICA
Durante toda a história do cinema, aquilo que um diretor
consegue colocar na tela depende também dos recursos disponíveis. Cenários,
multidões, efeitos visuais, viagens, equipamentos e equipes têm custos que
condicionam decisões artísticas. Muitas ideias não deixam de ser realizadas
porque sejam tecnicamente impossíveis, mas porque não cabem no orçamento.
Se a inteligência artificial reduzir significativamente o
custo de algumas dessas etapas, a primeira grande consequência pode ser
econômica, e não estética. Produções de orçamento reduzido poderão adquirir
recursos visuais antes restritos aos grandes estúdios, enquanto produções
maiores poderão utilizar a mesma tecnologia para diminuir despesas ou ampliar
sua escala.
A geração audiovisual amplia essa questão. Quando uma
ferramenta começa a reunir criação de cenário, personagem, movimento, câmera e
som, não está apenas acelerando uma tarefa existente. Está alterando a
quantidade de infraestrutura necessária para produzir determinados minutos de
audiovisual. Ainda não sabemos até que ponto essa capacidade poderá ser
transportada dos pequenos vídeos atuais para narrativas longas e complexas, mas
a direção da mudança já pode ser observada.
Esse processo contém uma contradição. Ferramentas
generativas podem democratizar o acesso a determinados meios de produção ao
mesmo tempo que dependem de modelos tecnológicos controlados por um número
pequeno de grandes empresas. Podem ampliar as possibilidades de cineastas
independentes e simultaneamente reduzir a necessidade de profissionais em
determinadas funções. Podem permitir a realização de imagens antes inviáveis
sem garantir que essas imagens produzam filmes melhores.
Também permanece uma diferença considerável entre eficiência
e qualidade. Uma sequência realizada em menos tempo não é necessariamente
superior àquela criada pelos métodos tradicionais. A capacidade de gerar uma
cena a partir de algumas instruções não substitui automaticamente direção,
dramaturgia, interpretação, montagem ou conhecimento cinematográfico.
Por isso, a imagem de um cineasta escrevendo algumas frases
e recebendo pouco depois um longa-metragem pronto ainda não corresponde à
realidade da produção profissional. O cenário atual é mais complexo. De um
lado, ferramentas de inteligência artificial assumem parcelas específicas de um
processo que continua envolvendo centenas de decisões humanas. De outro,
sistemas como Flow e Veo começam a demonstrar que algumas dessas parcelas podem
ser reunidas e que imagens e sons podem nascer sem passar pelo percurso
tradicional de filmagem.
O desabamento produzido para El Eternauta talvez seja
uma boa representação do primeiro movimento. Para o espectador, é apenas uma
imagem dentro de uma série. Para a indústria, demonstra que uma cena
considerada cara demais pode passar a caber no orçamento quando parte do
processo produtivo é realizada de outra maneira.
Uma cena criada inteiramente dentro de um sistema generativo
aponta para o movimento seguinte. Nesse caso, não se trata apenas de encontrar
uma forma mais rápida de produzir uma imagem que seria realizada pelos métodos
conhecidos. Parte do próprio caminho entre imaginar a cena e transformá-la em
audiovisual começa a ser redesenhada.
A discussão, portanto, já não é sobre quando a inteligência
artificial chegará ao cinema. Ela chegou, ainda de maneira fragmentada,
desigual e com limitações importantes. A questão agora é saber o que ocorrerá
quando aquilo que hoje aparece em experiências isoladas se tornar parte
habitual do processo de produção.
O que acontece com o cinema quando partes cada vez
maiores de um filme podem ser produzidas de outra maneira?
Ensaio mais aprofundado na BIBLIOTECA