Actualizado el 21 de septiembre de 2026 10 min de lectura Por Daniel Almazán
IMPORTANTE: algunos enlaces de esta guía son de afiliados. Al contratar la herramienta nos ayudas a seguir trayéndote más guías y reseñas para tu negocio sin costo para ti. Solo recomiendo software que uso de verdad, y digo también dónde falla.
Cada mes llegan las mismas facturas. El internet, la luz, el arrendamiento, el proveedor de siempre. Un PDF idéntico al del mes pasado salvo por tres números. Y alguien —probablemente tú— abre el archivo, busca el total, lo teclea en una hoja de cálculo y archiva el PDF en una carpeta.
Son cuatro minutos por factura. Con quince facturas recurrentes al mes es una hora, todos los meses, tecleando cosas que ya están escritas.
Esta guía es ese proceso, automatizado y corriendo. Con una advertencia que va al principio y no al final, porque cambia si te sirve o no.
Para qué sirve esto y para qué no
Esto funciona para un proveedor que te factura igual todos los meses. El mismo emisor, el mismo formato, las mismas etiquetas en los mismos lugares. Ahí es sólido y no cuesta nada.
No sirve para facturas de emisores distintos. Si recibes documentos de veinte proveedores con veinte diseños, este flujo se rompe con el segundo. Te explico exactamente por qué más abajo, y no es un defecto que se arregle afinando: es la naturaleza del método.
Lo digo aquí arriba porque las guías que encontré sobre este tema prometen lo segundo y entregan lo primero sin avisar.
Lo que no vas a encontrar en las otras guías
Antes de armar nada revisé lo que ya existe en español sobre extraer datos de facturas en PDF. Tres resultados dominan la búsqueda y los tres tienen el mismo hueco.
El primero va en dirección contraria: genera facturas desde una hoja de cálculo en vez de leer las que recibes. El segundo es un artículo conceptual cuyo ejemplo apunta a un servicio de extracción que no existe. El tercero es publicidad de una herramienta de pago, presentada como guía comparativa.
Y ninguno de los tres dice cuánto cuesta procesar una factura, ninguno cubre qué pasa con un PDF escaneado, ninguno explica qué hacer cuando la extracción devuelve un número equivocado, y ninguno dice cuándo no conviene hacerlo.
En contabilidad, un dato mal extraído no es una molestia. Es un número equivocado en tus registros que nadie va a revisar porque el sistema "funciona".
El flujo: seis módulos
Todo corre con Make y tu cuenta de Google. Sin ningún servicio de pago de terceros: nada de PDF.co, ni Parseur, ni Docparser, ni una llave de OpenAI.
Es la misma herramienta con la que se arma el flujo de cotizaciones automáticas por WhatsApp, así que si ya montaste aquél, aquí vas a reconocer la mitad de las piezas.
- Google Drive · Watch Files in a Folder. Vigila una carpeta donde tú dejas caer las facturas.
- Google Drive · Make an API Call. Convierte el PDF en Documento de Google. Aquí está el truco.
- Google Docs · Get Content of a Document. Saca el texto.
- Text parser · Match pattern. Extrae los campos con una expresión regular.
- Google Sheets · Add a Row. Escribe la fila.
- Google Drive · Move a File. Archiva el PDF en otra carpeta.
Paso 1: la carpeta de entrada
Limit viene en 2 por defecto: procesa como máximo dos archivos por ciclo. Si sueltas veinte facturas de golpe, las toma de dos en dos.Y un filtro inmediatamente después, que no es opcional:
Paso 2: el truco del OCR gratis
Este es el paso que ninguna de las otras guías usa, y es el que hace que todo lo demás salga sin costo.
Cuando Google Drive convierte un archivo a Documento de Google, le aplica OCR. Está en su documentación para desarrolladores, textual: "When you convert an image to a Docs, Drive uses Optical Character Recognition (OCR) to convert the image to text."
O sea: en vez de pagar un servicio de reconocimiento de texto, le pides a Drive que copie el PDF convirtiéndolo a documento, y el texto sale del otro lado. Esa conversión no tiene costo adicional.
El módulo Copy a File de Make no expone la opción de conversión, así que hay que usar Make an API Call:
POST a /v3/files/{ID}/copy. El cuerpo pide el mimeType de Documento de Google y el parámetro ocrLanguage mejora el reconocimiento.Dos detalles que me costaron cuatro ejecuciones fallidas:
- El campo Body es texto plano, no un objeto. Si le pasas una estructura, Make la convierte con
String()y a Google le llega literalmente[object Object]. - El campo Headers trae un valor por defecto con
Content-Type: application/json. Si lo dejas vacío a propósito, lo anulas y la llamada va sin el encabezado.
Un límite honesto: Google documenta que la conversión dispara OCR. No promete calidad sobre un escaneo malo. Con un PDF que ya trae capa de texto, el resultado es perfecto. Con una foto torcida tomada con el celular, no esperes milagros.
El paso donde casi todos se equivocan
Aquí está lo que encontré y que no vi en ninguna otra guía, porque solo aparece si de verdad ejecutas el flujo.
La tentación natural es abrir el PDF, ver cómo está ordenado, y escribir la regla de extracción contra ese orden. No funciona.
La fecha se adelanta. Y una expresión que la busca al final ya no la encuentra donde espera: se estira hasta la fecha de la factura siguiente, se come dos bloques, y en el último falla porque ya no queda ninguna fecha por delante.
Lo peor es cómo falla. No da error. Escribe una fila en vez de tres, con la fecha de otra factura. Si no cuentas las filas, no te enteras.
La regla, entonces: las expresiones de extracción se escriben contra el texto que produce el OCR, nunca contra el PDF de origen. Ejecuta el flujo hasta el paso 3, mira lo que devolvió, y escribe la regla contra eso.
Global match en sí es lo que permite sacar varias facturas de un mismo PDF: cada coincidencia sale como un paquete independiente.La expresión que quedó, para que veas la forma más que el detalle:
(?<emisor>...S\.A\.(?:P\.I\.)?\s*DE\s*C\.V\.)
[\s\S]*?R\.\s*F\.\s*C\.\s*(?<rfc_emisor>[A-ZÑ&]{3,4}\d{6}[A-Z0-9]{3})
[\s\S]*?Folio\s+Fiscal\s*:
[\s\S]*?Fecha\s+de\s+Emisi[oó]n\s*:\s*(?<fecha>\d{4}-\d{2}-\d{2})
[\s\S]*?Factura\s*:\s*(?<folio>[A-Z0-9][A-Z0-9\-]+)
[\s\S]*?\$\s*(?<subtotal>[\d,]+\.\d{2})\s*IVA\s*\$\s*(?<impuesto>[\d,]+\.\d{2})
\s*Total[^$]*?\$\s*(?<total>[\d,]+\.\d{2})
Dos decisiones que valen para cualquier factura, no solo para la mía. El ancla en Folio Fiscal descarta la página de resumen, que menciona los mismos folios pero no es un comprobante. Y exigir R.F.C. con puntos distingue el identificador del emisor del que aparece sin puntos más abajo: sin esa distinción, el flujo escribiría el dato equivocado en la columna del emisor, con perfecta consistencia, todos los meses.
Paso 5: la hoja
Con una excepción que prefiero enseñar a esconder:
Y el resultado:
Cuánto cuesta, medido
Make cobra por créditos. Cada acción que ejecuta un módulo consume uno. El plan gratuito da 1.000 créditos al mes y 2 escenarios activos; el plan Core cuesta $12 USD al mes por 10.000 créditos.
Medí tres ejecuciones reales:
| Caso | Operaciones | Créditos |
|---|---|---|
| Revisión sin archivos nuevos | 1 | 1 |
| PDF con 1 factura | 6 | 6 |
| PDF con 3 facturas | 10 | 10 |
Los tres caen sobre la misma recta:
operaciones = 4 + 2 × (facturas dentro del PDF)
Cuatro fijos —vigilar, convertir, leer, extraer— y dos por cada factura: escribir la fila y archivar. Una operación es un crédito, siempre. El extractor de texto no añade costo de inteligencia artificial porque no usa ninguna.
El costo que nadie calcula: la espera
Aquí está el número que me sorprendió, y es el más importante de la guía.
Cada revisión consume una operación aunque no haya nada que procesar. Con el intervalo de 15 minutos que trae el plan gratuito, eso son 96 revisiones al día. 2.880 operaciones al mes, sin haber procesado una sola factura. El plan gratuito da 1.000: se agota solo en unos diez días.
Si tus facturas llegan una vez al mes, revisar cada quince minutos no tiene ninguna justificación. Con una revisión diaria son unas 30 operaciones mensuales. Sumando el procesamiento real, el flujo completo cabe en menos de 50 créditos al mes, dentro del plan gratuito y con margen de sobra.
El costo de una automatización no está en el trabajo que hace. Está en el tiempo que pasa esperando trabajo.
Cuándo NO hacer esto
Cuatro casos donde armar esto es perder el fin de semana.
1. Si recibes facturas de muchos emisores distintos. Ya lo dije arriba y lo repito porque es el error más caro. La regla de extracción se ancla en el vocabulario y el orden de un proveedor. Con otro no extrae nada. Si tu problema son treinta proveedores distintos, necesitas otra cosa, y esa otra cosa cuesta dinero todos los meses.
2. Si son menos de diez facturas recurrentes al mes. Armar esto la primera vez toma entre dos y cuatro horas, contando los errores. Si capturas ocho facturas al mes a cuatro minutos cada una, estás gastando media hora mensual. Recuperas la inversión en el mes seis, suponiendo que nada cambie. No vale la pena.
3. Si nadie va a revisar la hoja. Una automatización de contabilidad que nadie audita es peor que capturar a mano, porque el error a mano se nota y el error automático se repite idéntico durante un año. Si no vas a mirar la hoja una vez al mes, no la automatices.
4. Si tu proveedor cambia el formato seguido. El día que cambie una etiqueta, el flujo deja de extraer. Con la configuración que recomiendo falla visiblemente en vez de escribir basura —eso se elige, no viene así— pero falla. Si tu proveedor rediseña sus facturas cada trimestre, vas a estar reparando esto cada trimestre.
Y una advertencia sobre lo que el flujo no sabe hacer. No entiende de contabilidad. No sabe si una factura está duplicada, si el monto es el que pactaste, ni si ese proveedor ya te cobró este mes. Copia números de un documento a una tabla. Todo lo que sea criterio sigue siendo tuyo.
Si decides hacerlo, por dónde empezar
Primero, junta tres facturas del mismo proveedor de meses distintos y compáralas. Si las tres tienen las mismas etiquetas en el mismo orden, este método te sirve. Si no, ya tienes tu respuesta y te ahorraste la tarde.
Segundo, arma solo los tres primeros módulos y ejecútalos. No escribas todavía ninguna regla de extracción. Corre el flujo, abre el historial y lee el texto que devolvió el paso 3. Ese texto —no el PDF— es contra lo que vas a escribir la regla.
Tercero, baja el intervalo antes de activarlo. Si tus facturas llegan una vez al mes, pon una revisión diaria. Este es el paso que la gente descubre cuando ya se quedó sin créditos.
La herramienta con la que armé este flujo
Es Make.com. Su plan gratuito alcanza de sobra para esto: da 1.000 créditos al mes y el flujo completo, corriéndolo a diario, consume menos de 50. No necesitas tarjeta para probarlo.
Crear una cuenta gratis en Make.com →Enlace de afiliado. Es la herramienta que uso de verdad, y en «Lo que se rompe» digo dónde falla.
Qué tienes que seguir sabiendo hacer tú
Leer una factura. Suena obvio hasta que llevas ocho meses sin abrir un PDF porque "el sistema ya lo captura". El día que el proveedor cambie una tarifa, que te facture un servicio que cancelaste o que duplique un cobro, el flujo va a escribir el número nuevo en tu hoja con la misma obediencia de siempre.
La prueba: si mañana desapareciera esta automatización, ¿sabrías qué buscar en cada factura y por qué? Si la respuesta es no, lo que automatizaste no fue la captura, fue tu atención. Revisa la hoja una vez al mes contra los PDF originales. Diez minutos. Esa revisión es lo que separa un sistema que te ahorra tiempo de uno que te esconde errores.
Lo que se rompe
Todo esto lo encontré ejecutando el flujo, no leyendo la documentación.
El disparador marca los archivos como vistos aunque la ejecución falle. Es el defecto más serio. Si un PDF entra justo cuando el flujo está roto, no se procesa y no vuelve a intentarse nunca. Desaparece en silencio. Por eso la revisión mensual contra los originales no es opcional.
El módulo de archivar se ejecuta una vez por factura, no una vez por PDF. Con un archivo de tres facturas, mueve el mismo PDF tres veces. No falla —la API tolera mover algo que ya está en destino— pero dos de cada tres operaciones son desperdicio: el 20% del costo del ciclo.
El documento convertido hereda la carpeta del PDF original. Como el PDF se mueve a la carpeta de procesadas en el mismo ciclo, el documento nuevo puede aparecer allí en vez de en la carpeta de entrada. Y nadie borra esos documentos intermedios: la carpeta se va llenando indefinidamente.
Cambiar la aplicación de un módulo intermedio rompe los mapeos de todos los siguientes. Cuando sustituí el módulo de extracción, Make marcó el escenario como inválido y lo desactivó, porque el paso 5 apuntaba a campos de una interfaz que ya no existía.
Y el que más tiempo me costó: Make tiene un módulo de extracción con inteligencia artificial integrada que aparece en el editor, valida sin protestar y falla al ejecutarse con un mensaje sobre una versión obsoleta. La versión vigente exige conectar un proveedor externo de pago. Si te encuentras ese error, no es tu configuración: es que ese camino ya no existe. Por eso este flujo usa un extractor de texto y no inteligencia artificial.