
Lista de lectura curada y taxonomía de investigación sobre ataques y defensas para sistemas de IA integrados en dispositivos móviles, que cubre ataques adversariales, de puerta trasera, de robo de modelos y de energía-latencia, junto con defensas de ofuscación, TEE y marcas de agua.
Los sistemas de IA en dispositivos móviles ejecutan modelos de IA localmente a través de frameworks de ML como LiteRT/TFLite, Core ML, ExecuTorch, ONNX y aceleradores respaldados por hardware. Este repositorio rastrea la investigación de seguridad necesaria para comprender y proteger dichos sistemas, ya que el almacenamiento local de modelos en el dispositivo introduce nuevos riesgos de seguridad.
¿Nuevo en la seguridad MoAI? Empieza aquí:
• A First Look at Deep Learning Apps on Smartphones
• A First Look at On-device Models in iOS Apps
• Mind Your Weight(s): A Large-scale Study on Insufficient ML Model Protection in Mobile Apps
• Robustness of On-device Models: Adversarial Attack to Deep Learning Models on Android Apps
• DeepPayload: Black-box Backdoor Attack on Deep Learning Models through Neural Payload Injection
• Typhon Unleashed: Practical Adversarial Weight Attacks Against On-Device Deep Learning Models
• Energy-Latency Attacks to On-Device Neural Networks via Sponge Poisoning
• ModelObfuscator: Obfuscating Model Information to Protect Deployed ML-based Systems
• ShadowNet: A Secure and Efficient On-device Model Inference System
• THEMIS: Towards Practical IP Protection for Post-Deployment On-Device DL Models
Robustness of On-device Models: Adversarial Attack to Deep Learning Models on Android Apps [Code]
IEEE/ACM International Conference on Software Engineering: Software Engineering in Practice (ICSE-SEIP 2021)
Smart App Attack: Hacking Deep Learning Models in Android Apps [Code]
IEEE Transactions on Information Forensics and Security (TIFS 2022)
Understanding Real-world Threats to Deep Learning Models in Android Apps [Code]
ACM SIGSAC Conference on Computer and Communications Security (CCS 2022)
Cheating Your Apps: Black-box Adversarial Attacks on Deep Learning Apps
Journal of Software: Evolution and Process (JSEP 2024)
A First Look at On-device Models in iOS Apps [Code]
ACM Transactions on Software Engineering and Methodology (TOSEM 2024)
Investigating White-Box Attacks for On-Device Models [Code]
IEEE/ACM International Conference on Software Engineering (ICSE 2024)
TIM: Enabling Large-Scale White-Box Testing on In-App Deep Learning Models [Code]
IEEE Transactions on Information Forensics and Security (TIFS 2024)
DeepPayload: Black-box Backdoor Attack on Deep Learning Models through Neural Payload Injection [Code]
IEEE/ACM International Conference on Software Engineering (ICSE 2021)
MalModel: Hiding Malicious Payload in Mobile Deep Learning Models with Black-box Backdoor Attack [Code]
Automated Software Engineering (ASEJ 2026)
A First Look at Deep Learning Apps on Smartphones [Code]
The World Wide Web Conference (WWW 2019)
A First Look at On-device Models in iOS Apps [Code]
ACM Transactions on Software Engineering and Methodology (TOSEM 2023)
Mind Your Weight(s): A Large-scale Study on Insufficient Machine Learning Model Protection in Mobile Apps [Code]
USENIX Security Symposium (USENIX Security 2021)
REDLC: Learning-Driven Reverse Engineering for Deep Learning Compilers
IEEE International Symposium on Software Reliability Engineering (ISSRE 2024)
Mind Your Weight(s): A Large-scale Study on Insufficient Machine Learning Model Protection in Mobile Apps [Code]
USENIX Security Symposium (USENIX Security 2021)
Understanding Real-world Threats to Deep Learning Models in Android Apps [Code]
ACM SIGSAC Conference on Computer and Communications Security (CCS 2022)
DeMistify: Identifying On-device Machine Learning Models Stealing and Reuse Vulnerabilities in Mobile Apps [Code]
IEEE/ACM International Conference on Software Engineering (ICSE 2024)
Game of Arrows: On the (In-)Security of Weight Obfuscation for On-Device TEE-Shielded LLM Partition Algorithms [Code]
USENIX Security Symposium (USENIX Security 2025)
Model Extraction Attack against On-Device Deep Learning with Power Side Channel
IEEE International Symposium on Quality Electronic Design (ISQED 2024)
DeepCache: Revisiting Cache Side-Channel Attacks in Deep Neural Networks Executables
ACM SIGSAC Conference on Computer and Communications Security (CCS 2024)
ModelObfuscator: Obfuscating Model Information to Protect Deployed ML-Based Systems [Code]
ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2023)
DynaMO: Protecting Mobile DL Models through Coupling Obfuscated DL Operators [Code]
IEEE/ACM International Conference on Automated Software Engineering (ASE 2024)
Model-less Is the Best Model: Generating Pure Code Implementations to Replace On-Device DL Models [Code]
ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2024)
NNSplitter: An Active Defense Solution for DNN Model via Automated Weight Obfuscation [Code]
International Conference on Machine Learning (ICML 2023)
A Novel Obfuscation Method Based on Majority Logic for Preventing Unauthorized Access to Binary Deep Neural Networks
Scientific Reports (Sci. Rep. 2025)
Securing On-device Transformer with Hardware Binding and Reversible Obfuscation [Code]
Annual Computer Security Applications Conference (ACSAC 2025)
MMGuard: Automatically Protecting On-Device Deep Learning Models in Android Apps [Code]
IEEE Security and Privacy Workshops (SPW 2021)
Securing On-device Transformer with Hardware Binding and Reversible Obfuscation [Code]
Annual Computer Security Applications Conference (ACSAC 2025)
Offline Model Guard: Secure and Private ML on Mobile Devices
Design, Automation and Test in Europe Conference (DATE 2020)
GuardiaNN: Fast and Secure On-Device Inference in TrustZone Using Embedded SRAM and Cryptographic Hardware
ACM/IFIP International Middleware Conference (Middleware 2022)
Secure and Efficient Mobile DNN Using Trusted Execution Environments
ACM Asia Conference on Computer and Communications Security (AsiaCCS 2023)
T-Slices: Confidential Execution of Deep Learning Inference at the Untrusted Edge with Arm TrustZone
ACM Conference on Data and Application Security and Privacy (CODASPY 2023)
LEAP: TrustZone Based Developer-Friendly TEE for Intelligent Mobile Apps
IEEE Transactions on Mobile Computing (TMC 2022)
ASGARD: Protecting On-Device Deep Neural Networks with Virtualization-Based Trusted Execution Environments [Code]
Network and Distributed System Security Symposium (NDSS 2025)
TZ-LLM: Protecting On-Device Large Language Models with Arm TrustZone [Code]
European Conference on Computer Systems (EuroSys 2026)
FlexServe: A Fast and Secure LLM Serving System for Mobile Devices with Flexible Resource Isolation
arXiv preprint (arXiv 2026)
DarkneTZ: Towards Model Privacy at the Edge Using Trusted Execution Environments [Code]
Annual International Conference on Mobile Systems, Applications, and Services (MobiSys 2020)
HybridTEE: Secure Mobile DNN Execution Using Hybrid Trusted Execution Environment [Code]
Asian Hardware Oriented Security and Trust Symposium (AsianHOST 2020)- SecDeep: Secure and Performant On-Device Deep Learning Inference Framework for Mobile and IoT Devices
Conferencia Internacional sobre Diseño e Implementación de Internet de las Cosas (IoTDI 2021)
ShadowNet: A Secure and Efficient On-Device Model Inference System for Convolutional Neural Networks [Code]
Simposio IEEE sobre Seguridad y Privacidad (S&P 2023)
MirrorNet: A TEE-Friendly Framework for Secure On-Device DNN Inference
Conferencia Internacional IEEE/ACM sobre Diseño Asistido por Computadora (ICCAD 2023)
TSQP: Safeguarding Real-Time Inference for Quantization Neural Networks on Edge Devices [Code]
Simposio IEEE sobre Seguridad y Privacidad (S&P 2025)
TEESlice: Protecting Sensitive Neural Network Models in Trusted Execution Environments When Attackers Have Pre-Trained Models
Transacciones ACM sobre Ingeniería de Software y Metodología (TOSEM 2025)
TensorShield: Safeguarding On-Device Inference by Shielding Critical DNN Tensors with TEE [Code]
GroupCover: A Secure, Efficient and Scalable Inference Framework for On-Device Model Protection Based on TEEs [Code]
Conferencia Internacional sobre Aprendizaje Automático (ICML 2024)
Game of Arrows: On the (In-)Security of Weight Obfuscation for On-Device TEE-Shielded LLM Partition Algorithms [Code]
Simposio de Seguridad USENIX (USENIX Security 2025)
MirageNet: A Secure, Efficient, and Scalable On-Device Model Protection in Heterogeneous TEE and GPU System
Preimpresión arXiv (arXiv 2026)
Los siguientes problemas abiertos resumen las principales brechas de investigación identificadas en nuestro SoK. Mantenemos aquí las descripciones a alto nivel para los lectores que usen este repositorio. En el artículo se pueden encontrar discusiones más técnicas.
Viabilidad práctica del ataque.
Los ataques adversarios contra modelos en el dispositivo siguen siendo difíciles de realizar tras el despliegue porque a menudo requieren control sobre las entradas del modelo, la inserción de perturbaciones adversarias o el reempaquetado de la aplicación para modificar el código de preprocesamiento. Estos pasos pueden ser poco prácticos o detectables en despliegues reales con usuarios finales.
Modificación sigilosa del modelo.
Los ataques de puerta trasera necesitan encontrar puntos de entrada posteriores al despliegue más allá del envenenamiento estándar en tiempo de entrenamiento, porque los modelos en el dispositivo suelen ser de solo lectura y solo inferencia. El desafío clave es introducir comportamiento malicioso oculto sin producir cambios observables en los artefactos del modelo.
Localización precisa de pesos.
Los ataques adversarios a pesos exponen un riesgo de integridad a nivel de parámetros, pero el despliegue práctico depende de localizar pesos críticos para el comportamiento en el amplio espacio de búsqueda de parámetros. Esto es difícil porque los atacantes a menudo carecen de guía por gradientes y necesitan preservar la utilidad benigna mientras modifican solo parámetros seleccionados.
Extracción fiable del modelo.
El almacenamiento local del modelo no hace que el robo de modelos sea sencillo. La extracción práctica sigue dependiendo de la identificación fiable del modelo, el descifrado y la reconstrucción en presencia de algoritmos de cifrado personalizados, marcos de IA no estándar y comportamientos de carga específicos del tiempo de ejecución.
Heterogeneidad del hardware.
Los ataques de energía-latencia dependen de cómo interactúan los patrones de activación envenenados con el comportamiento de ejecución específico del dispositivo. Pueden amplificar la latencia y el consumo de energía en aceleradores sensibles a la dispersión, pero no transferirse a hardware sin ejecución dependiente de la dispersión.
Equivalencia ejecutable.
La ofuscación de modelos aún necesita preservar la función de predicción original durante la inferencia autorizada. Esta equivalencia ejecutable puede exponer estados de ejecución recuperables, pesos transformados, semántica de operadores o rastros estructurales que permiten la recuperación semántica, estructural o de parámetros.
Aplicación en el lado del cliente.
La autorización de modelos vincula la inferencia correcta a credenciales, comprobaciones de integridad y recuperación de pesos empaquetados. Sin embargo, estas comprobaciones deben ejecutarse dentro de la pila móvil, lo que hace que la aplicación dependa de código del lado del cliente que puede ser sometido a ingeniería inversa, reempaquetado, enganchado o instrumentado tras el despliegue.
Viabilidad del despliegue de TEE.
Las defensas basadas en TEE requieren soporte coordinado entre formatos de modelo, marcos de IA, bibliotecas de operadores, delegados, aceleradores e interfaces de aislamiento CPU/GPU/NPU. Los ecosistemas móviles actuales aún carecen de pilas de inferencia respaldadas por TEE ampliamente adoptadas y transparentes para el desarrollador.
Robustez de la marca de agua.
La marca de agua en modelos permite la verificación de propiedad tras el despliegue, pero los modelos robados pueden redesplegarse mediante conversión de marcos, cifrado o mediación de entrada-salida a nivel de aplicación. Estas transformaciones pueden preservar la inferencia benigna mientras interrumpen las respuestas a disparadores, los patrones de confianza o la semántica de salida utilizados para la verificación.
Más allá de los nueve problemas abiertos anteriores, nuestro SoK destaca tres direcciones emergentes en las que es probable que la seguridad de MoAI se expanda a continuación. Estas direcciones mueven la investigación en seguridad de MoAI hacia una evaluación sistemática, al tiempo que extienden su alcance a las superficies de ataque emergentes introducidas por el entrenamiento en el dispositivo y los sistemas MoAI agénticos. Las resumimos aquí a alto nivel. El artículo complementario proporciona una motivación más detallada, superficies de amenaza y desafíos de investigación.
Los estudios existentes sobre seguridad de MoAI evalúan ataques y defensas utilizando conjuntos de datos auto-recolectados, métricas específicas de método y diferentes modelos de amenaza, y suelen limitarse a una única plataforma (Android o iOS). Esto dificulta la comparación de los resultados de evaluación y pasa por alto las diferencias específicas de cada plataforma. El trabajo futuro debería establecer puntos de referencia unificados que estandaricen conjuntos de datos, métricas y modelos de amenaza, y que admitan la evaluación multiplataforma para una evaluación sistemática, comparable y reproducible de la seguridad de MoAI.
La investigación actual en seguridad de MoAI se centra principalmente en modelos desplegados que son de solo lectura y solo inferencia. El entrenamiento en el dispositivo cambia esta suposición al permitir que los modelos se actualicen localmente, lo que expone gradientes, actualizaciones de parámetros y datos de usuario durante el proceso de entrenamiento. Esto abre nuevas preguntas en torno al ajuste fino local, la integridad de las actualizaciones, la exposición de datos de entrenamiento, el envenenamiento de la personalización y las defensas para los estados en tiempo de entrenamiento en dispositivos de usuarios finales.
Los sistemas MoAI están evolucionando desde la inferencia local pasiva hacia flujos de trabajo agénticos que conectan modelos con sensores, datos privados de usuario, contextos de aplicaciones, servicios del sistema operativo e interfaces entre aplicaciones. Esto desplaza el enfoque de seguridad de proteger únicamente los artefactos del modelo a gobernar las cadenas de contexto a acción. El trabajo futuro debería estudiar la procedencia del contexto móvil, la separación de la intención confiable del usuario del contenido ambiental no confiable, los permisos con alcance de tarea para el uso de herramientas y API, la confirmación y reversión de acciones sensibles, y la auditoría de planes, memoria y acciones del agente.
| Pilar de seguridad MoAI | Qué protege | Ataques representativos | Defensas representativas |
|---|
| Integridad de entrada gobernada por el usuario | La integridad de extremo a extremo de las entradas del usuario, desde la adquisición de datos móviles hasta la entrega al modelo | Ataques adversarios, Ataques de puerta trasera, Ataques de energía y latencia | - |
| Seguridad del modelo residente en el dispositivo | Artefactos de modelos implementados y todas las formas posteriores a la implementación en las que los modelos se almacenan, cargan, transforman o materializan en los dispositivos | Ataques adversarios, Ataques de puerta trasera, Ataques adversarios a pesos, Ataques de robo de modelos, Ataques de energía y latencia | Ofuscación de modelos, Autorización de modelos, TEE, Marcado de agua de modelos |
| Confinamiento del entorno nativo del dispositivo | Cómputo de inferencia sensible y estados de tiempo de ejecución en el sistema operativo móvil, el tiempo de ejecución de IA, el subsistema de memoria y los entornos de ejecución respaldados por hardware | Ataques de robo de modelos, Ataques de energía y latencia | Ofuscación de modelos, TEE |