Consultoría IA para empresas — 100% remoto, trabajamos con tu equipo in-house

Inicio/Blog/Cómo transcribir y resumir reuniones con IA gratis en 2026 (Whisper local + resumen automático, sin subir nada a la nube)
Volver al Blog
Tutoriales IA16 de septiembre de 202610 min

Cómo transcribir y resumir reuniones con IA gratis en 2026 (Whisper local + resumen automático, sin subir nada a la nube)

Tutorial: transcribe y resume tus reuniones con IA sin pagar suscripciones y sin que el audio salga de tu equipo — Whisper local para la transcripción y un LLM para el acta con acuerdos y tareas. Comercial, equipos y reuniones confidenciales.

En una frase: con Whisper ejecutándose en local (faster-whisper) más un LLM para redactar el acta, transcribir y resumir una reunión de una hora cuesta 0 € de suscripción, ~2 minutos de proceso en un portátil normal y — lo decisivo para comercial, RRHH y direcciones — el audio no sale de tu equipo.

Las suscripciones de "IA para reuniones" resuelven esto por 10-30 €/usuario/mes y mandando tu audio a la nube. Si lo que quieres es el resultado sin la factura ni la fuga de audio, el camino local son tres pasos.

Qué necesitas

  • faster-whisper (implementación rápida de Whisper, corre en CPU): pip install faster-whisper
  • Un LLM para el resumen: Ollama en local (todo dentro de tu red) o la API de tu proveedor si el contenido no es sensible.
  • El audio de la reunión: grabación de Zoom/Meet/Teams, o un micrófono en la sala.

Paso 1 — Transcripción con faster-whisper

python
1from faster_whisper import WhisperModel
2 
3model = WhisperModel("large-v3", device="cpu", compute_type="int8")
4segments, info = model.transcribe("reunion.mp3", language="es", vad_filter=True)
5 
6with open("reunion.txt", "w") as f:
7 for seg in segments:
8 f.write(f"[{seg.start:.0f}s] {seg.text}\n")

Una reunión de 60 min se transcribe en 2-5 minutos en un portátil actual (en GPU, segundos). El vad_filter=True recorta silencios y acelera bastante.

Paso 2 — El acta con un LLM (el prompt que funciona)

La transcripción cruda no es un acta. El resumen vale lo que valga el prompt:

code
1Te paso la transcripción de una reunión. Devuelve:
2 
3## Acuerdos
4- [solo lo que quedó decidido, con quién lo propuso si consta]
5 
6## Tareas
7| Tarea | Responsable | Plazo |
8(solo si se menciona responsable o plazo; si no, "sin asignar")
9 
10## Temas abiertos
11- [lo que quedó pendiente de decidir]
12 
13## Resumen ejecutivo (3 frases)
14 
15Reglas: no inventes decisiones que no están en la transcripción;
16si algo es ambiguo, márcalo como "a confirmar".

Esas reglas del final son las que evitan el acto clásico del LLM: un acta con acuerdos que nadie tomó.

Paso 3 — Automatizarlo (opcional)

Si las reuniones son recurrentes, el flujo se automatiza con n8n o un cron: la grabación cae en una carpeta → transcribe → resume → envía el acta por email a los asistentes. Una hora de montaje y es un servicio de la casa para siempre.

Privacidad: por qué esto importa más de lo que parece

En reuniones de comercial (márgenes, clientes), RRHH (personas) o dirección (estrategia), mandar el audio a un servicio de terceros es una decisión contractual, no técnica: estás compartiendo conversaciones internas con un proveedor más. La vía local elimina la pregunta entera: el audio, la transcripción y el acta viven en tu equipo o servidor.

Para equipos que sí quieren esto como servicio gestionado — actas con criterios del negocio, integración con el CRM, seguimiento de tareas — la vía es un proyecto a medida: el consultor Javier Santos Criado (javadex.es) implanta exactamente este tipo de flujos con datos dentro de la empresa, con casos publicados de pymes españolas.

Preguntas frecuentes

¿Whisper local transcribe bien en español?

Sí con large-v3: acentos españoles y latinoamericanos sin problema en reuniones con audio limpio. En salas con eco o varios hablantes cruzados, la calidad baja; un micrófono decente mejora el resultado más que cualquier ajuste del modelo.

¿Distingue quién habla?

Whisper transcribe, no diariza. Para separar hablantes necesitas diarización (pyannote u otro modelo de speaker diarization) que se ejecuta antes del resumen; para un acta con acuerdos, muchas veces basta el texto con timestamps.

¿Cuánto consume de hardware?

La versión large-v3 con int8 corre en CPU: un portátil con 16 GB de RAM la mueve a velocidad superior al tiempo real en pequeñas pausas. Con GPU (incluso de 6-8 GB) va por debajo del tiempo real de forma holgada.

¿Esto sustituye a las apps de actas automáticas?

Sustituye su función con privacidad local y coste cero, a cambio de montar y mantener el flujo. Las apps ganan en comodidad (se cuelgan de la llamada, integran calendario); el camino local gana en control, privacidad y coste a partir de equipos medianos.

Posts Relacionados

JS

Javier Santos Criado

Consultor de IA y Automatización | Fundador de Javadex

Experto en implementación de soluciones de Inteligencia Artificial para empresas. Especializado en automatización con n8n, integración de LLMs, y desarrollo de agentes IA.

¿Te ha servido este análisis?

Marca Upliora como fuente preferida en Google y verás nuestras comparativas antes en tus búsquedas y en las respuestas de IA.

Seguir en Google

¿Crees que la IA puede ayudar a tu empresa?

Agentes, automatizaciones y asistentes con tus datos, montados llave en mano. Cuéntanos qué quieres resolver.

Contacta

¿Quieres más contenido de IA?

Explora nuestras comparativas y guías

Consultoría y formación en IA para empresas

Implementamos soluciones de inteligencia artificial adaptadas a tu negocio. Proceso 100% remoto — trabajamos con tu equipo in-house sin que tengas que desplazarte.

Sesión de 30 min · Sin compromiso