Paulina Valenzuela Lagos (范寶琳)

Computational Linguist & Applied NLP Researcher
📍 Taipei, Taiwan 📧 paoo.ss@gmail.com 🌐 Web Portfolio LinkedIn GitHub ORCID
WORK AUTHORIZATION (TAIWAN): Valid Alien Resident Certificate (ARC) holder as Ph.D. Candidate at NTUST. Eligible for Student Work Permit (up to 20 hrs/week during semester, full-time during breaks). Eligible for Foreign Special Professional work extension upon graduation (Expected: Jun 2027).
Ph.D. Candidate in Digital Learning & Applied NLP at NTUST specializing in Spanish/multilingual text readability, transformer fine-tuning (BERTIN, BETO), and handcrafted feature extraction (238 metrics). Experienced in deploying interactive web tools (Streamlit, Flask) and data processing pipelines. Seeking an Applied NLP / AI Data Science Internship or R&D position in Taiwan.

Technical Stack

AI & NLP
Transformers (BETO, MarIA, BERTIN), Feature Engineering (238 lexico-semantic metrics), CatBoost, XGBoost, Scikit-learn, spaCy, NLTK, PyTorch
Languages & Tools
Python (Pandas, NumPy, Pytest, ETL), R (Tidyverse, Statistical Modeling), SQL, Bash/Linux, Git, Flask, Streamlit
Languages Spoken
Spanish (Native), English (Fluent - TOEFL 102/120), Mandarin Chinese (Intermediate), Korean (Elementary)

NLP & AI Applied Research Experience

Applied NLP Researcher & ML Developer NTUST · 2022 – Present
Ph.D. Dissertation: Automated Readability & Text Complexity Modeling
  • Hybrid Machine Learning Architecture: Combined pre-trained transformer embeddings (BETO, MarIA, BERTIN) with 238 handcrafted lexico-semantic linguistic features to classify text difficulty across CEFR framework levels.
  • High-Accuracy Classification: Achieved ~87% CEFR classification accuracy and ~0.96 Quadratic Weighted Kappa (QWK) on gold-standard Spanish evaluation corpora.
  • Live Deployment & Web Prototyping: Built and deployed the public CARLA Readability Engine using Streamlit and Python, serving real-time readability scores to educators and researchers.
  • Data Pipeline & ETL Engineering: Scripted automated data pipelines in Python (Pandas, PyTest) for corpus sanitization, POS-tagging, syntactic parse tree extraction, and statistical error distribution analysis across 800+ benchmark texts.
Python Transformers CatBoost Feature Engineering Streamlit ETL
Lead Technical Developer ZebraUp / ZebraPace · 2023 – Present
mHealth Symptom Tracking & Patient Usability Platform
  • Full-Stack Prototyping: Developed a cross-platform mobile app (Flutter/Dart) and analytical dashboard (Streamlit) for Ehlers-Danlos Syndrome (EDS) patients to track pacing and physical symptoms.
  • Data Validation & Telemetry: Designed user testing protocols, data validation rules, and longitudinal telemetry structuring for patient usability.
Flutter Dart Streamlit UI/UX QA

Education & Credentials

Ph.D. Candidate in Digital Learning & Education NTUST, Taiwan · Expected Jun 2027
Specialization: Computational Linguistics, Applied NLP & Adaptive Learning
M.A. in Applied Foreign Languages NTUST, Taiwan · Graduated 2022
B.A. in Letters & B.Ed. in Secondary Education Pontificia Universidad Católica de Chile · Graduated 2018
Technical Certifications HarvardX / Professional Diplomas
  • CS50: Introduction to Computer Science (HarvardX)
  • Python for Data Science & Professional Scripting Diplomas