Nenhuma transcrição ainda
Escolha um modo de sessão, grave ou anexe um arquivo.
Use Espaço para gravar rapidamente.
Escolha um modo de sessão, grave ou anexe um arquivo.
Use Espaço para gravar rapidamente.
Quem transforma o áudio em texto. Comece pelo Groq: são 2.000 transcrições por dia sem pagar nada.
Numa máquina com placa de vídeo dedicada, o transcritor local também consegue identificar quem falou — sem mandar nada pra internet. E a espera some junto: nessas máquinas, uma hora de gravação costuma sair em 6 a 12 minutos.
Funciona com placa NVIDIA de 12 GB de memória de vídeo ou mais — na prática, uma RTX 3060 ou mais nova. Placa mais antiga, com menos memória, ou de outra marca continua transcrevendo normalmente, só não separa as vozes.
Não tem certeza do que você tem? Instale e olhe o medidor de velocidade — ele responde na sua máquina melhor do que qualquer tabela.
Esse caminho é o mais técnico, e está em desenvolvimento: pode travar ou trocar os locutores. Se você tem a máquina e topar experimentar, o retorno ajuda muito.
Transcrever é ouvir. As lentes, receitas e comparações precisam de cérebros de IA para pensar em cima do texto.
🔐 O Vox não cobra por uso de IA nem vê seus dados: você conecta suas próprias chaves. Comece com opções grátis ou quase grátis e adicione outros cérebros quando quiser comparar respostas.
Usa a mesma Groq Key da aba Transcrição — grátis, sem custo extra.
Usa a mesma OpenAI Key da aba Transcrição.
Comece pelas gratuitas — dá pra montar uma boa coleção sem gastar nada. Toque no selo 🔒 de cada uma pra ver como ela trata os seus dados.
A diarização separa automaticamente quem fala cada parte da conversa.
Em vez de um texto corrido, você recebe a conversa organizada por pessoa — como se cada participante tivesse sua própria fala. Funciona bem para reuniões, entrevistas, consultas e atendimentos.
Usa a mesma chave da OpenAI que você já configurou na aba Transcrição. O custo é o mesmo da transcrição comum.
Depois de separar as falas, o Vox pode tentar descobrir automaticamente quem é o profissional e quem é o paciente (ou outro papel). Usa a IA de texto que você já configurou.
🤝 Modo assistido
Guias amigáveis nas funções avançadas (diarização, provedores, primeiros usos). Recomendado.Suas chaves ficam só no seu navegador — se ele "esquecer" (cache limpo, troca de aparelho), você as perde de vez. Pra não digitar tudo de novo: baixe um backup protegido por senha e guarde num lugar seguro (e-mail pra você mesmo, nuvem, pendrive). Se um dia precisar reconfigurar, é só restaurar esse arquivo aqui — sem digitar as chaves de novo.
Ao revisar palavras repetidas/suspeitas num texto, escolher "sempre ignorar" ou "sempre trocar" guarda a regra aqui — visível e editável a qualquer momento, nunca escondida.
Nenhuma ainda.
Nenhuma ainda.
⚠️ Tem certeza? Isso apaga chaves de API, idioma, tema, receitas e todos os ajustes.
Vox · My Transcriber
Qual modelo deseja usar?
Os três acertam bastante. A diferença aparece em áudio difícil — sala com eco, microfone longe. Em áudio bom, o Médio chega perto do Preciso e roda muito mais rápido.
Para transcrever suas gravações, o app precisa acessar o microfone do seu computador.
Clique no botão abaixo e depois em "Permitir" quando o Chrome perguntar.
Isso só acontece uma vez.
Pense em voz alta — sua fala vira raciocínio pronto pra trabalhar, com vários cérebros de IA te ajudando a lapidar.
A maioria dos aplicativos já escolheu uma por você, embutiu o custo na mensalidade, e pronto. O Vox faz diferente: você conecta as que quiser e troca entre elas numa girada — como quem gira a rodinha do mouse.
Isso importa porque cada uma pensa de um jeito. Uma escreve melhor, outra é mais rápida, outra é quase de graça. Ter várias é ter escolha em cada trabalho.
Funciona como a carteirinha de uma biblioteca: você apresenta, ela confirma quem é você, e libera o acervo. No mundo da tecnologia isso se chama chave de API — um código que você cria no site do serviço e cola aqui uma vez só.
O Groq, nossa sugestão para começar, executa o Whisper da OpenAI — o cérebro de transcrição que erra menos e entende mais dialetos — em chips próprios que o tornam centenas de vezes mais rápido. Criando, literalmente, um Whisper melhorado.
E oferece 2.000 minutos de áudio por dia de graça. Para a maioria das pessoas, isso cobre o mês inteiro e sobra muito. Se um dia você passar disso, paga menos de 5 centavos de dólar por hora — tão barato que você coloca 5 dólares de crédito e esquece durante meses.
🔒 Sua chave fica guardada só no seu aparelho. Não passa por nós — não temos servidor pra onde ela iria. Você pode apagar ou trocar quando quiser.
Sua resposta define o que a gente configura primeiro.
O Groq roda a mesma tecnologia de transcrição da OpenAI, mas é 4 a 5 vezes mais rápido e dá 2.000 transcrições por dia sem cobrar nada.
Existe uma versão do transcritor que roda na sua própria máquina. Sem chave, sem cadastro e sem gastar API — seu áudio não sai daí, e transcrever não custa nada além da energia elétrica.
A velocidade depende do seu computador, e o app mede isso pra você: mostra quantos segundos ele leva por minuto de áudio. Abaixo de 10 fica verde. E durante uma gravação ele já vai transcrevendo em pedaços, então quando você para, boa parte do texto já está escrita.
Vale quando o sigilo pesa mais que a pressa — entrevista confidencial, documentos sensíveis, entre outros. Só uma coisa a gente prefere avisar antes: identificar quem fala ainda depende de serviço na internet.
A instalação do transcritor local tem seu próprio passo a passo, dentro das Configurações → Local. Você pode fazer isso a qualquer momento.
Sem isso, a transcrição vem num bloco só, tudo misturado. Com isso, vem assim: "Profissional: … / Paciente: …". Numa consulta ou entrevista, é a diferença entre um texto que você ainda vai ter que desembaraçar e um que já está pronto pra usar.
Isso precisa de um segundo serviço, porque o Groq não separa vozes. O AssemblyAI é o melhor nisso hoje e dá $50 de crédito para começar — o suficiente para centenas de horas de áudio. Passando disso, a transcrição custa cerca de 15 a 20 centavos de dólar por hora, e a separação de vozes acrescenta 2 centavos por hora.
🔗 Criar conta grátis no AssemblyAIVocê será levado direto às configurações para conectar suas chaves de acesso.
v
Pense em voz alta — sua fala vira raciocínio pronto pra trabalhar, com vários cérebros de IA te ajudando a lapidar. Suas chaves, seus dados: nada passa pelos nossos servidores, porque não temos servidores.
Envie o link para que outras pessoas possam usar o app no próprio dispositivo.
Pergunte a mesma coisa pra duas pessoas de formações diferentes e você recebe duas respostas — nenhuma errada, cada uma enxergando de um ângulo. Com as inteligências artificiais é igual: cada uma foi treinada de um jeito, então cada uma percebe coisas diferentes no seu texto.
Por isso a troca aqui é uma girada só. Quanto mais fácil trocar, mais você experimenta — e é experimentando que aparece o que você sozinho não tinha visto.
O menu do cérebro tem três linhas porque são três trabalhos diferentes: transcrever o áudio, separar as vozes de quem falou, e pensar em cima do texto. Cada um pode usar um serviço diferente — e você troca cada um na sua própria roleta.
Pensa assim: a busca comum é feita palavra por palavra — se você não escreve exatamente igual ao que tá na nota, ela não acha. A busca por sentido é diferente. Você digita "médico", e ela acha a nota onde você falou "doutor". Digita "dinheiro", ela acha onde você falou "grana". Ela procura pelo ASSUNTO, não pela palavra em si.
Por trás disso, cada nota vira uma espécie de "impressão digital" numérica do que ela quer dizer, e a comparação entre impressões acontece aqui no seu aparelho. Só o texto sai, uma vez, pra IA gerar essa impressão — depois disso, tudo fica guardado só com você.
Ligando isso você ganha duas ferramentas, não uma: a busca por sentido e as Notas relacionadas (no menu ⋯ Mais), que junta sozinha as notas que falam do mesmo assunto. As duas leem o mesmo índice — monta uma vez, serve pras duas.
Não quer mexer nas chaves agora? Sem problema — enquanto isso, o Vox já faz muita coisa boa sem precisar de nenhuma API especial:
🔎 A busca comum já ignora acento e erro de digitação, e mostra o trecho encontrado em destaque · 📅 O Resumo do dia junta tudo que você gravou · 🎭 As lentes (resumo, plano de ação, tom) funcionam com qualquer cérebro configurado · 🔮 A diarização separa quem falou o quê · 📤 Dá pra exportar em TXT, Markdown, HTML ou direto pro Obsidian.
Você lê uma nota por vez — é assim que a cabeça humana funciona. Só que algumas coisas só aparecem quando se olha várias notas juntas: um assunto que você voltou a tocar cinco vezes sem perceber, uma promessa que você fez em voz alta e nunca mais mencionou, uma ideia que mudou ao longo dos meses.
Este painel lê várias notas de uma vez e aponta só essas três coisas. Ele não resume, não aconselha e não tenta adivinhar o que você sentiu.
Se aparecer "nada que se repita", isso é resposta de verdade e não falha — quer dizer que suas notas andaram variadas. E lembre: mudar de ideia não é defeito nenhum. O painel aponta a mudança sem julgar, porque só você sabe se foi amadurecimento ou distração.