← Voltar para Início
● Documentação Renderizada em Markdown
Vídeo Timecoding & Gemini Live API: Multimodalidade e Voz em Tempo Real
A maioria das plataformas de IA apenas lê texto. O Google Gemini foi construído desde o seu núcleo fundamental (natively multimodal) para processar fluxos brutos de vídeo, áudio e imagem.
🎥 1. Vídeo Timecoding Nativo
Você pode fazer upload de um vídeo de 45 minutos (palestra, aula, gravação de reunião, execução de exercícios) diretamente para a API.
Casos de Uso Extraordinários:
- "Localize o minuto e segundo em que o apresentador menciona o orçamento do projeto e resuma o que ele disse."
- "Aponte erros de postura ou biomecânica aos 12m40s."
- "Gere uma tabela com 5 cortes verticais (Reels/Shorts) com minutagem exata de início, fim e legenda sugerida."
🎙️ 2. Gemini Live API (<300ms)
A Live API opera via conexões WebSockets bidirecionais contínuas, permitindo conversar com a IA por voz e vídeo ao vivo.
Principais Inovações:
- Interrupção Natural (Voice Activity Detection - VAD): Você pode falar por cima da IA e ela interrompe a fala imediatamente para ouvir você, exatamente como uma pessoa real;
- Entonação & Afetividade: O modelo compreende se o usuário está calmo, frustrado ou animado pelo tom da voz;
- Visão Contínua de Tela: Permite criar mentores que assistem ao usuário programando ou estudando e corrigem erros ao vivo.