Juan Manuel Neupavert Alzola

Juan Manuel Neupavert Alzola

Especialista en servicios tecnológicos y lingüísticos · Jerez de la Frontera

Technology & language specialist · Jerez de la Frontera

Automatizo procesos documentales para empresas: digitalización de archivo, consulta inteligente de documentación y sistemas de gestión de conocimiento, siempre con opción de funcionamiento local y privado. Mi formación en lingüística computacional añade una capa extra cuando el proyecto trabaja con terminología o lenguaje especializado.

I automate document processes for companies: archive digitization, intelligent document search, and knowledge-management systems, always with a local, private-by-design option. My background in computational linguistics adds an extra layer when the project involves specialized terminology or language.

¿Tienes un archivo documental, un proceso manual que automatizar o un problema terminológico?
Hablemos

Have a document archive, a manual process to automate, or a terminology problem?
Let's talk


Qué hago

What I do

Digitalización y OCRDigitization & OCR Documentos escaneados a texto buscable y editable, sin depender de servicios en la nube. Scanned documents into searchable, editable text, with no dependency on cloud services.
¿Por qué?Why?

Un archivo en papel o en PDF escaneado no se puede buscar ni indexar: hacerlo en local, además, evita subir documentos sensibles a un servicio externo solo para convertirlos.

A paper archive or a scanned PDF can't be searched or indexed — doing it locally also avoids uploading sensitive documents to an outside service just to convert them.

Consulta documental privadaPrivate document Q&A Preguntas en lenguaje natural sobre una colección de documentos, con cita a la página de origen. Natural-language questions over a document collection, with citations back to the source page.
¿Por qué?Why?

Buscar por palabra clave en cientos de páginas falla en cuanto la respuesta está formulada de otra forma; preguntar en lenguaje natural y ver la página exacta evita tener que fiarse a ciegas de la respuesta.

Keyword search across hundreds of pages misses answers phrased differently; asking in natural language and seeing the exact source page means never having to take the answer on faith.

Asistente conversacional para tu webAI assistant for your website Chatbot alojado en la nube con acceso privado por enlace — sin tocar el código de tu web — para que tus usuarios o estudiantes pregunten sobre tus propios documentos a cualquier hora. Cloud-hosted chatbot with private link access — no changes to your website's code — so your users or students can ask about your own documents any time.
¿Por qué?Why?

Una duda fuera de horario no siempre puede esperar a que alguien responda. Un asistente disponible a cualquier hora, que solo contesta con lo que hay en tus propios documentos —nunca con conocimiento genérico inventado, a diferencia de ChatGPT o Claude—, cubre ese hueco.

A question outside office hours can't always wait for someone to answer. An assistant available any time, answering only from your own documents — never inventing from generic knowledge like ChatGPT or Claude would — fills that gap.

Gestión de conocimiento documentalKnowledge management Fragmentos clave de tus documentos organizados, buscables y siempre vinculados al original. Key fragments from your documents, organized, searchable, and always linked back to the original.
¿Por qué?Why?

La información repartida en decenas de documentos es difícil de mantener y de encontrar cuando hace falta; tenerla organizada y vinculada al original evita releer documentos enteros cada vez.

Information scattered across dozens of documents is hard to maintain and hard to find when you need it; keeping it organized and linked to the source avoids re-reading whole documents every time.

Automatización de datos documentalesDocument data automation Extracción de datos de tablas y documentos Word/PDF hacia Excel o bases de datos. Extracting data from tables and Word/PDF documents into Excel or databases.
¿Por qué?Why?

Copiar datos de tablas o PDFs a mano es lento y propenso a errores; automatizar esa extracción libera tiempo para las tareas que sí necesitan criterio humano.

Copying data from tables or PDFs by hand is slow and error-prone; automating that extraction frees up time for the tasks that actually need human judgment.

Terminología y lingüística

Terminology & linguistics

Gestión terminológicaTerminology management Bases multilingües, migración entre formatos (TBX, XLIFF, TMX). Multilingual termbases; migration across formats (TBX, XLIFF, TMX).
¿Por qué?Why?

Sin una base terminológica centralizada, cada traductor o redactor puede usar un término distinto para el mismo concepto — incoherencias que luego cuestan tiempo (y credibilidad) corregir.

Without a centralized termbase, different translators or writers end up using different terms for the same concept — inconsistencies that cost time (and credibility) to fix later.

Extracción de terminologíaTerm extraction Candidatos terminológicos a partir de corpus, criterios lingüísticos y estadísticos. Term candidates from corpora, using linguistic and statistical criteria.
¿Por qué?Why?

Identificar a mano los términos clave de un corpus grande es lento; un proceso semi-automático acelera la fase inicial de cualquier proyecto terminológico.

Manually spotting the key terms in a large corpus is slow; a semi-automated process speeds up the first phase of any terminology project.

Control de calidad terminológicaTerminology QA Revisión de coherencia en proyectos de traducción y localización. Consistency checks across translation and localization projects.
¿Por qué?Why?

Un mismo término traducido de formas distintas dentro del mismo proyecto es uno de los errores de calidad más comunes en traducción y localización; revisarlo sistemáticamente evita que llegue al usuario final.

The same term translated inconsistently within one project is one of the most common quality issues in translation and localization; a systematic check catches it before it reaches the end user.

Preparación de corpusCorpus building Recopilación, limpieza, normalización y análisis de textos especializados. Collection, cleaning, normalization, and analysis of specialized texts.
¿Por qué?Why?

Un corpus mal limpiado o sin normalizar distorsiona cualquier análisis posterior; dedicarle tiempo a esta fase evita conclusiones erróneas más adelante.

A poorly cleaned or unnormalized corpus distorts any analysis built on top of it; getting this stage right prevents wrong conclusions down the line.

Recursos lingüísticosLanguage resources Glosarios, guías de estilo terminológicas, memorias de traducción. Glossaries, terminology style guides, translation memories.
¿Por qué?Why?

Sin glosarios ni memorias de traducción compartidas, cada proyecto nuevo repite decisiones terminológicas ya tomadas antes, perdiendo tiempo y consistencia.

Without shared glossaries or translation memories, every new project re-decides terminology choices already made before, losing both time and consistency.

Consultoría lingüísticaLinguistic consulting Asesoramiento en terminografía, documentación de dominios, estrategia terminológica. Advice on terminography, domain documentation, and terminology strategy.
¿Por qué?Why?

Antes de construir cualquier base terminológica o proceso conviene tener claro qué necesita realmente el dominio y el equipo — evita construir algo que nadie acabará usando.

Before building any termbase or process, it helps to be clear on what the domain and team actually need — it avoids building something no one ends up using.

Ver ejemplos

See examples


Proyectos

Projects

Son ejemplos de lo que sé construir, no la lista completa de lo que ofrezco — cada uno tiene un manual en PDF con más detalle. Si tu necesidad es distinta, hablemos.

These are examples of what I can build, not the full list of what I offer — each one has a PDF manual with more detail. If your need is different, let's talk.

Digitalizador documental (OCR local)(local OCR)

PrototipoPrototype

Convierte documentos escaneados en texto buscable y editable, sin conexión a internet. Detecta automáticamente qué páginas ya tienen texto digital y cuáles necesitan reconocimiento óptico, y es transparente sobre qué páginas no ha podido leer bien en vez de inventar contenido.

Turns scanned documents into searchable, editable text, entirely offline. Automatically detects which pages already have digital text and which need optical recognition, and is transparent about pages it couldn't read well instead of guessing.

Python · Transformers · PyMuPDF · 100% local

Python · Transformers · PyMuPDF · fully local

PDF ¿Quieres más información sobre este programa? Want more information about this program?

RagDesk (Asistente documental privado)(Private document assistant)

En desarrolloIn development

Responde preguntas en lenguaje natural sobre una colección de documentos, citando siempre la página exacta de origen. Funciona enteramente en local cuando así se requiere, sin subir la documentación a ningún servicio externo; admite modelos en la nube como alternativa configurable.

Answers natural-language questions over a document collection, always citing the exact source page. Runs entirely locally when required, with no documents leaving the machine; cloud models are supported as a configurable alternative.

FastAPI · LlamaIndex · Ollama · local o en la nube

FastAPI · LlamaIndex · Ollama · local or cloud

RagDesk — pregunta en lenguaje natural RagDesk — respuesta con cita a la página RagDesk — documentos ingestados
PDF ¿Quieres más información sobre este programa? Want more information about this program?

NeuAlz (Lector de PDF y base de conocimiento)(PDF reader & knowledge base)

PrototipoPrototype

Lector de PDF que convierte cada fragmento seleccionado en una ficha de cita clasificada y buscable, con metadatos bibliográficos y salto directo a la página original. Pensado para investigación, revisión documental y trabajo con bibliografía extensa.

PDF reader that turns each selected fragment into a searchable, tagged citation card with bibliographic metadata and a direct link back to the original page. Built for research, document review, and working with large bibliographies.

Tauri · Rust · SQLite (FTS5)

PDF ¿Quieres más información sobre este programa? Want more information about this program?

AlzoLab

En producciónIn production

Laboratorio de lingüística de corpus en el navegador, sin escribir código. Flujo completo: importación multifuente (web, Wikipedia, archivos) → limpieza y normalización → análisis morfosintáctico con spaCy → extracción terminológica (C-value) → concordancias KWIC → exportación.

Browser-based corpus-linguistics lab, no coding required. End-to-end flow: multi-source import (web, Wikipedia, files) → cleaning and normalization → morphosyntactic analysis with spaCy → term extraction (C-value) → KWIC concordances → export.

Python · Streamlit · spaCy

AlzoLab — importación AlzoLab — limpieza y normalización AlzoLab — análisis con spaCy AlzoLab — concordancias KWIC
PDF ¿Quieres más información sobre este programa? Want more information about this program?

NeupaTerm (Plataforma terminológica)(Terminology platform)

En desarrolloIn development

Plataforma SaaS de gestión terminológica multilingüe, independiente del CAT. Glosarios y fichas terminológicas bilingües por pares de idiomas (ES · EN · PT · DE · IT · FR): categoría gramatical, contextos de uso y equivalencias por idioma. Extracción de candidatos con NLP y consulta de la terminología desde Word, Trados, memoQ o cualquier otra aplicación (NeupaTerm Connect).

CAT-independent, multilingual terminology-management SaaS. Glossaries and bilingual terminological records paired across languages (ES · EN · PT · DE · IT · FR): grammatical category, usage contexts and cross-language equivalences. NLP-based candidate extraction and terminology lookup from Word, Trados, memoQ or any other application (NeupaTerm Connect).

React/Vite · FastAPI · PostgreSQL · spaCy

NeupaTerm — página de acceso NeupaTerm — panel de inicio NeupaTerm — ficha terminológica NeupaTerm Connect — acceso por API
PDF ¿Quieres más información sobre este programa? Want more information about this program?

NeupaLang (Documentación lingüística)(Language documentation)

En desarrolloIn development

Plataforma para la documentación de lenguas minoritarias y en peligro. Interoperabilidad FLEx/ELAN/CLDF, glosa interlineal Leipzig, consentimiento informado (CARE/FAIR) y editor offline.

Platform for documenting minority and endangered languages. FLEx/ELAN/CLDF interoperability, Leipzig interlinear glossing, informed consent (CARE/FAIR) and offline editor.

FastAPI · React · Tauri

PDF ¿Quieres más información sobre este programa? Want more information about this program?

Cómo trabajo

How I work

1. Reunión inicial (15-20 min) — sin compromiso, hablamos de tu problema documental concreto.

1. Initial call (15-20 min) — no strings attached, we talk through your actual document problem.

2. Propuesta por escrito — qué se entrega, precio cerrado y plazo, antes de empezar nada.

2. Written proposal — what gets delivered, fixed price and timeline, before anything starts.

3. Implementación sobre tus propios documentos — en local si así lo prefieres, sin subir nada a terceros.

3. Implementation on your own documents — locally if you prefer, nothing uploaded to third parties.

4. Entrega y formación breve — 15-30 minutos para que tu equipo lo use sin depender de mí.

4. Delivery and a short walkthrough — 15-30 minutes so your team can use it without depending on me.

5. Mantenimiento opcional — si lo necesitas, sigo disponible mes a mes; si no, el proyecto queda cerrado.

5. Optional ongoing maintenance — available month to month if you need it; otherwise the project is simply done.


Formación

Education

Doctorado en Lingüística

PhD in Linguistics

Universidad de Cádiz · En curso

University of Cádiz · In progress

Máster en Ciencias del Lenguaje

Master's in Language Sciences

UCA · 2025 · Media: 9,2 · TFM: M. de Honor

University of Cádiz · 2025 · GPA: 9.2/10 · Thesis: highest distinction

Doble Grado: Lingüística y Lenguas Aplicadas + Estudios Ingleses

Double Bachelor's: Linguistics & Applied Languages + English Studies

Universidad de Cádiz · 2022

University of Cádiz · 2022

Publicaciones

Publications & talks

Comunicación — AESLA 2026

Conference talk — AESLA 2026

Comunicación — AJL 2026

Conference talk — AJL 2026

Comunicación — Tránsitos 2026

Conference talk — Tránsitos 2026

Póster — Congreso AETER 2025

Poster — AETER Conference 2025

Artículo — Estudio exploratorio de usos terminológicos, mecanismos de incorporación al español en e-sports (en preparación)

Article — An exploratory study of terminological usage and incorporation mechanisms into Spanish in esports (in preparation)


Competencias

Skills

Terminología y terminografía · Lenguaje especializado · Lingüística de corpus · NLP y spaCy · Estándares de interoperabilidad (TBX, XLIFF, TMX) · FLEx/LIFT · ELAN/EAF · CLDF · Sketch Engine · UAM CorpusTool · MateCat · Subtitle Edit · Python · Inglés · Español nativo

Terminology & terminography · Languages for Specific Purposes (LSP) · Corpus linguistics · NLP & spaCy · Interoperability standards (TBX, XLIFF, TMX) · FLEx/LIFT · ELAN/EAF · CLDF · Sketch Engine · UAM CorpusTool · MateCat · Subtitle Edit · Python · English · Spanish (native)


Contacto

Contact

juanmanuel@neupavert.com
GitHub · LinkedIn