1Antes de empezar
Necesitas dos cosas:
- Una cuenta de Google (Gmail) gratuita, para poder usar Colab.
- Tu archivo de audio o video: mp3, wav, m4a, ogg, flac, aac, mp4, mov, mkv, webm, entre otros. Si subes un video, el script extrae el audio automáticamente — no hace falta convertir nada antes.
2Abre tu copia del script en Colab
Haz clic en "Abrir mi copia en Google Colab" de arriba. Se abre el cuaderno en tu propia cuenta de Google: todo lo que ejecutes corre en un servidor temporal asignado a ti, no en nuestros servidores. Nosotros nunca vemos tu audio, tu video ni tu transcripción.
El cuaderno tiene solo 2 bloques de código ("celdas"). No necesitas escribir ni entender nada de código, solo ir presionando el botón ▶ de cada uno, en orden.
3(Opcional) Activa la GPU para que sea más rápido
Ve a "Entorno de ejecución" → "Cambiar tipo de entorno" → elige GPU T4 → Guardar. Con GPU la transcripción es mucho más rápida. Sin GPU también funciona perfectamente con CPU, solo tarda algo más según la duración del archivo.
4Ejecuta la Celda 1: instalación
Presiona ▶ en el primer bloque. Instala automáticamente todo lo necesario (faster-whisper, gradio, python-docx y ffmpeg), y tarda entre 2 y 4 minutos. Espera a ver el mensaje "✅ Todo listo" antes de continuar. Solo hace falta ejecutarla una vez por sesión; si algo falla, simplemente vuelve a presionar ▶ en esta misma celda.
5Ejecuta la Celda 2: abre la interfaz visual
El modelo, el idioma, la traducción y las marcas de tiempo se eligen todos dentro de la interfaz (más abajo, en el navegador), no aquí. La única opción que sí conviene dejar lista antes de presionar ▶ es esta:
Activado por defecto. Crea un enlace temporal tipo gradio.live, útil si quieres abrir la herramienta desde el celular u otro dispositivo. Es opcional: si prefieres, puedes desactivarlo y usar únicamente el recuadro que aparece dentro de Colab. El enlace se desactiva solo al cerrar la sesión.
Presiona ▶. Va a tardar uno o dos minutos cargando el modelo de IA. Al final aparece la interfaz lista para usar.
6Sube tu archivo y elige tus opciones
En la interfaz que se abrió:
- Audio o video: sube tu archivo directamente ahí.
- Modelo: elige uno de los 6 modelos disponibles (ver la tabla abajo). Puedes cambiarlo las veces que quieras sin volver a ejecutar celdas.
- Idioma: déjalo en "🔍 Detectar automáticamente" o elige uno manualmente entre casi 100 idiomas — útil si el audio es corto, ruidoso o tiene un acento fuerte.
- Traducir al inglés (opcional): traduce el resultado con un solo clic.
- Incluir marcas de tiempo (opcional): agrega el minuto exacto de cada párrafo en el texto transcrito.
Presiona "📝 Transcribir" y espera. El texto aparece en pantalla y se puede editar directamente ahí antes de descargarlo.
El más veloz de todos. Se equivoca más, sobre todo con acentos fuertes o ruido de fondo.
Buen balance velocidad/precisión, ideal para uso diario en español o cualquier otro idioma.
Más preciso que "Equilibrado". Tarda 2-3 veces más en procesar.
El más preciso de todos, reconoce más de 99 idiomas. Es también el más lento.
Casi tan preciso como "Máxima precisión", pero 6-8 veces más rápido. Algo peor si activas "Traducir al inglés".
El más rápido de todos, pero solo funciona bien con audio en INGLÉS. Para español u otros idiomas, elige otro modelo.
7Descarga tu resultado
Elige entre 4 formatos, cada uno se descarga directamente a tu computadora con un clic (a tu carpeta de Descargas), sin abrirse en una pestaña nueva:
- .txt — texto organizado en párrafos, separados por las pausas naturales del audio.
- .srt y .vtt — subtítulos con marcas de tiempo, listos para usar en editores de video o reproductores web.
- .docx — documento de Word con la transcripción, listo para editar o compartir.
8¿Subiste el archivo equivocado?
¿Listo para transcribir tu audio o video?
Se ejecuta en tu propia cuenta de Google. Nosotros no vemos ni guardamos tus archivos.
Abrir mi copia en Google Colab