GPT-4o (Omni): o que muda em maio com as novas funções de áudio, vídeo e comando por voz

O mês de maio trouxe uma virada concreta no uso da inteligência artificial com a liberação das funções multimodais do modelo GPT-4o (Omni) para mais usuários ao redor do mundo.

Apresentado oficialmente semanas atrás pela OpenAI, o GPT-4o já vinha sendo chamado de “modelo multimodal nativo”. Agora, essa promessa está sendo colocada em prática — com comandos por voz mais rápidos, leitura de imagens em tempo real, análise de vídeos curtos e respostas com entonação emocional.

Não é mais sobre escrever para a IA — é sobre interagir com ela como se fosse uma pessoa do time.

As atualizações de maio destravam recursos que já estavam anunciados, mas agora começam a aparecer no ChatGPT para usuários Plus e empresas. Entre os destaques:

  • Compreensão por voz mais fluida: o GPT-4o responde com voz natural em menos de meio segundo, com entonação adaptativa (mais calma, mais enfática, mais empática).
  • Leitura de tela via imagem: é possível tirar uma captura de tela de um sistema ou site e pedir um diagnóstico, sugestão ou ação imediata.
  • Interação por vídeo curto: usuários podem gravar um vídeo rápido explicando um problema ou mostrando um processo, e o modelo entende o contexto visual e sonoro.
  • Assistente ativo e proativo: com a memória ligada, o GPT-4o começa a lembrar de preferências, projetos e histórico — oferecendo sugestões antes mesmo de ser solicitado.
  • Interface simplificada com comandos combinados: agora você pode gravar um áudio, citar um documento e apontar uma imagem — tudo em uma única interação, sem precisar digitar.

O GPT-4o inaugura uma era onde a IA deixa de ser ‘resposta’ e se torna ‘presença’.

Para negócios, isso significa um salto nas aplicações de suporte técnico, onboarding, vendas, treinamentos, diagnósticos visuais e acessibilidade — tudo em tempo real, com mais naturalidade e impacto direto na experiência do usuário.

👉 O programa AI FOUNDERS já está testando essas novas funções com parceiros estratégicos e ajudando empresas a transformar multimodalidade em produtividade real.
Acompanhe os próximos desdobramentos e aplicações práticas em albertokastro.com.

Fontes e referências consultadas:
OpenAI Developer Updates (Maio 2025), GPT-4o Technical Guide, Wired, The Decoder, X/Twitter da OpenAI

Compartilhe nas redes sociais:

Artigos relacionados

IA no WhatsApp: como criar um fluxo de atendimento eficiente que converte

Comparativo entre as IAs mais usadas por empresas em 2025: GPT-4o, Claude, Gemini e Perplexity<

IA e o futuro do áudio: como voice agents estão transformando vendas, suporte e conteúdo

IA multimodal ao vivo: o impacto da combinação entre texto, imagem, áudio e vídeo em tempo real nos negócios