PAUL GUERRERO software engineer
← proyectos

vlm-dni-ocr

  • python
  • doctr
  • qwen-vl
  • fastapi

El OCR clásico es bueno hasta que la realidad lo despeina. Una foto de un DNI con mala luz, el documento torcido o una esquina doblada, y el texto que extrae deja de tener sentido antes de que nadie intente leer los campos.

Aquí el modelo de visión sí se gana el sitio: en lugar de leer un texto ya degradado, mira la imagen directamente, como haría una persona. El OCR no desaparece, pero cambia de papel: pasa de ser la fuente de verdad a ser una pista. El propio modelo tiene instrucciones de fiarse de lo que ve en la imagen por encima de lo que le sopla el OCR.

Y debajo de todo, una red de seguridad. Cada campo que sale del modelo pasa por una validación determinista: el formato de la fecha, el dígito de control del DNI. Si algo no cuadra, el campo va a nulo en vez de a un valor inventado. En un documento de identidad, un dato equivocado hace más daño que un hueco: el hueco lo rellena una persona; el error se cuela sin que nadie lo note.


Cómo está hecho — Python · docTR · Qwen3-VL · FastAPI · validación campo a campo