Elton Alencar (Federal University of Amazonas UFAM, Brazil & Venturus - Innovation and Technology Center MAO, Brazil); Edma Urtiga de Mattos (Federal University of Amazonas, Brazil); Diego A. Amoedo (Universidade Federal do Amazonas & Agência Nacional de Telecomunicações - Anatel, Brazil); Victoria Guimaraes, Pedro V S Matias, Emanuel Oliveira and Luca Naja (UFAM, Brazil); Matheus Figueiredo (Federal University of Amazonas, Brazil); Pedro Oliveira, Matheus Uchoa, Cristian Maia, Lucas Botinelly, Rosiane Brito, Bruno Cardoso, Laura Leite and Lucas Pessoa (UFAM, Brazil); Ana Gabriela Pires (Federal University of Amazonas, Brazil); Alexandre Miranda (FPF Tech, Brazil); Agemilson Pimentel, Ruan Belem and Rômulo Fabrício, Jr. (TPV Technology, Brazil); Celso Barbosa Carvalho (Federal University of Amazonas, Brazil); Waldir Silva (Universidade Federal do Amazonas, Brazil)
Consumer electronics manuals remain a source for configuration, use, and troubleshooting, but present unique challenges for automated question answering due to their specialized symbols, procedural diagrams, and domain-specific terminology. Generalist Vision-Language Models (VLMs) struggle to accurately interpret such content without domain adaptation. This work presents a parameter-efficient for technical Visual Question Answering (VQA) in consumer electronics manuals, emphasizing the trade-off between cross-product generalization and product-specific specialization. A synthetic VQA dataset (2264 question-answer pairs from 295 manual pages) was constructed using DeepSeek-OCR. LoRA-based adaptation was evaluated across five VLM backbones. The results demonstrated performance improvements: Qwen3-VL-8B achieved an Exact Match of 23.84% on multi-product data. Single-product specialization on monitor manuals reached 43.59%, demonstrating that product-specific adaptation reduces generic responses. All datasets, training scripts, and evaluation artifacts are publicly available in our GitHub repository: https://github.com/eltonalencar90/vlms-user-manuals-vqa.