
모바일 온디바이스 AI 시스템을 위한 공격 및 방어 연구의 엄선된 읽기 목록 및 분류 체계로, 적대적 공격, 백도어 공격, 모델 도난 공격, 에너지-지연 공격을 비롯해 난독화, TEE, 워터마킹 방어를 다룹니다.
Yujin Huang, Xin Zheng, Xingliang Yuan, Kwok-Yan Lam
모바일 온디바이스 AI 시스템은 LiteRT/TFLite, Core ML, ExecuTorch, ONNX와 같은 ML 프레임워크와 하드웨어 기반 가속기를 통해 AI 모델을 로컬에서 실행합니다. 이 저장소는 온디바이스 모델의 로컬 저장으로 인해 발생하는 새로운 보안 위험을 이해하고 보호하는 데 필요한 보안 연구를 추적합니다.
MoAI 보안이 처음이신가요? 여기서 시작하세요:
• A First Look at Deep Learning Apps on Smartphones
• A First Look at On-device Models in iOS Apps
• Mind Your Weight(s): A Large-scale Study on Insufficient ML Model Protection in Mobile Apps
• Robustness of On-device Models: Adversarial Attack to Deep Learning Models on Android Apps
• DeepPayload: Black-box Backdoor Attack on Deep Learning Models through Neural Payload Injection
• Typhon Unleashed: Practical Adversarial Weight Attacks Against On-Device Deep Learning Models
• Energy-Latency Attacks to On-Device Neural Networks via Sponge Poisoning
• ModelObfuscator: Obfuscating Model Information to Protect Deployed ML-based Systems
• ShadowNet: A Secure and Efficient On-device Model Inference System
• THEMIS: Towards Practical IP Protection for Post-Deployment On-Device DL Models
Robustness of On-device Models: Adversarial Attack to Deep Learning Models on Android Apps [Code]
IEEE/ACM International Conference on Software Engineering: Software Engineering in Practice (ICSE-SEIP 2021)
Smart App Attack: Hacking Deep Learning Models in Android Apps [Code]
IEEE Transactions on Information Forensics and Security (TIFS 2022)
Understanding Real-world Threats to Deep Learning Models in Android Apps [Code]
ACM SIGSAC Conference on Computer and Communications Security (CCS 2022)
Cheating Your Apps: Black-box Adversarial Attacks on Deep Learning Apps
Journal of Software: Evolution and Process (JSEP 2024)
A First Look at On-device Models in iOS Apps [Code]
ACM Transactions on Software Engineering and Methodology (TOSEM 2024)
Investigating White-Box Attacks for On-Device Models [Code]
IEEE/ACM International Conference on Software Engineering (ICSE 2024)
TIM: Enabling Large-Scale White-Box Testing on In-App Deep Learning Models [Code]
IEEE Transactions on Information Forensics and Security (TIFS 2024)
DeepPayload: Black-box Backdoor Attack on Deep Learning Models through Neural Payload Injection [Code]
IEEE/ACM International Conference on Software Engineering (ICSE 2021)
MalModel: Hiding Malicious Payload in Mobile Deep Learning Models with Black-box Backdoor Attack [Code]
Automated Software Engineering (ASEJ 2026)
A First Look at Deep Learning Apps on Smartphones [Code]
The World Wide Web Conference (WWW 2019)
A First Look at On-device Models in iOS Apps [Code]
ACM Transactions on Software Engineering and Methodology (TOSEM 2023)
Mind Your Weight(s): A Large-scale Study on Insufficient Machine Learning Model Protection in Mobile Apps [Code]
USENIX Security Symposium (USENIX Security 2021)
REDLC: Learning-Driven Reverse Engineering for Deep Learning Compilers
IEEE International Symposium on Software Reliability Engineering (ISSRE 2024)
Mind Your Weight(s): A Large-scale Study on Insufficient Machine Learning Model Protection in Mobile Apps [Code]
USENIX Security Symposium (USENIX Security 2021)
Understanding Real-world Threats to Deep Learning Models in Android Apps [Code]
ACM SIGSAC Conference on Computer and Communications Security (CCS 2022)
DeMistify: Identifying On-device Machine Learning Models Stealing and Reuse Vulnerabilities in Mobile Apps [Code]
IEEE/ACM International Conference on Software Engineering (ICSE 2024)
Game of Arrows: On the (In-)Security of Weight Obfuscation for On-Device TEE-Shielded LLM Partition Algorithms [Code]
USENIX Security Symposium (USENIX Security 2025)
Model Extraction Attack against On-Device Deep Learning with Power Side Channel
IEEE International Symposium on Quality Electronic Design (ISQED 2024)
DeepCache: Revisiting Cache Side-Channel Attacks in Deep Neural Networks Executables
ACM SIGSAC Conference on Computer and Communications Security (CCS 2024)
ModelObfuscator: Obfuscating Model Information to Protect Deployed ML-Based Systems [Code]
ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2023)
DynaMO: Protecting Mobile DL Models through Coupling Obfuscated DL Operators [Code]
IEEE/ACM International Conference on Automated Software Engineering (ASE 2024)
Model-less Is the Best Model: Generating Pure Code Implementations to Replace On-Device DL Models [Code]
ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2024)
NNSplitter: An Active Defense Solution for DNN Model via Automated Weight Obfuscation [Code]
International Conference on Machine Learning (ICML 2023)
A Novel Obfuscation Method Based on Majority Logic for Preventing Unauthorized Access to Binary Deep Neural Networks
Scientific Reports (Sci. Rep. 2025)
Securing On-device Transformer with Hardware Binding and Reversible Obfuscation [Code]
Annual Computer Security Applications Conference (ACSAC 2025)
MMGuard: Automatically Protecting On-Device Deep Learning Models in Android Apps [Code]
IEEE Security and Privacy Workshops (SPW 2021)
Securing On-device Transformer with Hardware Binding and Reversible Obfuscation [Code]
Annual Computer Security Applications Conference (ACSAC 2025)
Offline Model Guard: Secure and Private ML on Mobile Devices
Design, Automation and Test in Europe Conference (DATE 2020)
GuardiaNN: Fast and Secure On-Device Inference in TrustZone Using Embedded SRAM and Cryptographic Hardware
ACM/IFIP International Middleware Conference (Middleware 2022)
Secure and Efficient Mobile DNN Using Trusted Execution Environments
ACM Asia Conference on Computer and Communications Security (AsiaCCS 2023)
T-Slices: Confidential Execution of Deep Learning Inference at the Untrusted Edge with Arm TrustZone
ACM Conference on Data and Application Security and Privacy (CODASPY 2023)
LEAP: TrustZone Based Developer-Friendly TEE for Intelligent Mobile Apps
IEEE Transactions on Mobile Computing (TMC 2022)
ASGARD: Protecting On-Device Deep Neural Networks with Virtualization-Based Trusted Execution Environments [Code]
Network and Distributed System Security Symposium (NDSS 2025)
TZ-LLM: Protecting On-Device Large Language Models with Arm TrustZone [Code]
European Conference on Computer Systems (EuroSys 2026)
FlexServe: A Fast and Secure LLM Serving System for Mobile Devices with Flexible Resource Isolation
arXiv preprint (arXiv 2026)
DarkneTZ: Towards Model Privacy at the Edge Using Trusted Execution Environments [Code]
Annual International Conference on Mobile Systems, Applications, and Services (MobiSys 2020)
HybridTEE: Secure Mobile DNN Execution Using Hybrid Trusted Execution Environment [Code]
Asian Hardware Oriented Security and Trust Symposium (AsianHOST 2020)- SecDeep: 모바일 및 IoT 기기를 위한 안전하고 성능 좋은 온디바이스 딥러닝 추론 프레임워크
사물인터넷 설계 및 구현 국제 컨퍼런스 (IoTDI 2021)
ShadowNet: 합성곱 신경망을 위한 안전하고 효율적인 온디바이스 모델 추론 시스템 [코드]
IEEE 보안 및 프라이버시 심포지엄 (S&P 2023)
MirrorNet: 안전한 온디바이스 DNN 추론을 위한 TEE 친화적 프레임워크
IEEE/ACM 국제 컴퓨터 지원 설계 컨퍼런스 (ICCAD 2023)
TSQP: 엣지 디바이스에서 양자화 신경망의 실시간 추론 보호 [코드]
IEEE 보안 및 프라이버시 심포지엄 (S&P 2025)
TEESlice: 공격자가 사전 학습 모델을 보유한 경우 신뢰 실행 환경에서 민감한 신경망 모델 보호
ACM 소프트웨어 공학 및 방법론 거래 (TOSEM 2025)
TensorShield: TEE로 중요 DNN 텐서를 보호하여 온디바이스 추론 보호 [코드]
ACM SIGSAC 컴퓨터 및 통신 보안 컨퍼런스 (CCS 2025)
GroupCover: TEE 기반 온디바이스 모델 보호를 위한 안전하고 효율적이며 확장 가능한 추론 프레임워크 [코드]
국제 기계 학습 컨퍼런스 (ICML 2024)
화살의 게임: 온디바이스 TEE 보호 LLM 분할 알고리즘을 위한 가중치 난독화의 (비)보안성에 관하여 [코드]
USENIX 보안 심포지엄 (USENIX Security 2025)
MirageNet: 이기종 TEE 및 GPU 시스템에서 안전하고 효율적이며 확장 가능한 온디바이스 모델 보호
arXiv 사전 인쇄본 (arXiv 2026)
다음 공개 문제는 본 SoK에서 식별된 주요 연구 격차를 요약합니다. 설명은 이 저장소를 사용하는 독자를 위해 높은 수준으로 유지합니다. 보다 기술적인 논의는 논문에서 찾을 수 있습니다.
공격 배포 실용성.
온디바이스 모델에 대한 적대적 공격은 배포 후에도 실현하기 어려운데, 이는 종종 모델 입력에 대한 제어, 적대적 섭동 삽입, 또는 전처리 코드 수정을 위한 앱 재패키징이 필요하기 때문입니다. 이러한 단계는 실제 최종 사용자 배포 환경에서 비현실적이거나 탐지 가능할 수 있습니다.
은밀한 모델 수정.
백도어 공격은 온디바이스 모델이 일반적으로 읽기 전용이고 추론 전용이기 때문에 표준 학습 시간 중독을 넘어 배포 후 진입점을 찾아야 합니다. 주요 과제는 모델 아티팩트에서 관찰 가능한 변화 없이 숨겨진 악의적 행동을 도입하는 것입니다.
정밀한 가중치 위치 파악.
적대적 가중치 공격은 매개변수 수준의 무결성 위험을 노출하지만, 실질적인 배포는 방대한 매개변수 탐색 공간에서 동작에 중요한 가중치를 찾는 데 달려 있습니다. 공격자는 종종 그래디언트 안내가 부족하고 선택된 매개변수만 수정하면서 정상적인 유용성을 보존해야 하기 때문에 이는 어렵습니다.
신뢰할 수 있는 모델 추출.
로컬 모델 저장소가 모델 도난을 간단하게 만들지는 않습니다. 실용적인 추출은 여전히 맞춤형 암호화 알고리즘, 비표준 AI 프레임워크, 런타임별 로딩 동작이 있는 상황에서 신뢰할 수 있는 모델 식별, 복호화, 재구성에 의존합니다.
하드웨어 이질성.
에너지-지연 시간 공격은 중독된 활성화 패턴이 장치별 실행 동작과 상호 작용하는 방식에 따라 달라집니다. 이는 희소성에 민감한 가속기에서 지연 시간과 에너지 소비를 증폭시킬 수 있지만, 희소성 의존 실행이 없는 하드웨어로는 전이되지 않을 수 있습니다.
실행 가능한 동등성.
모델 난독화는 여전히 인가된 추론 중에 원래 예측 함수를 보존해야 합니다. 이러한 실행 가능한 동등성은 의미론적, 구조적 또는 매개변수 복구를 가능하게 하는 복구 가능한 런타임 상태, 변환된 가중치, 연산자 의미론 또는 구조적 추적을 노출할 수 있습니다.
클라이언트 측 집행.
모델 인가는 올바른 추론을 자격 증명, 무결성 검사, 패킹된 가중치 복구에 바인딩합니다. 그러나 이러한 검사는 모바일 스택 내에서 실행되어야 하므로, 집행은 배포 후 리버스 엔지니어링, 재패키징, 후킹 또는 계측될 수 있는 클라이언트 측 코드에 의존하게 됩니다.
TEE 배포 가능성.
TEE 방어는 모델 형식, AI 프레임워크, 연산자 라이브러리, 델리게이트, 가속기, CPU/GPU/NPU 격리 인터페이스 전반에 걸친 조율된 지원이 필요합니다. 현재 모바일 생태계는 여전히 널리 채택되고 개발자에게 투명한 TEE 기반 추론 스택이 부족합니다.
워터마크 견고성.
모델 워터마킹은 배포 후 소유권 확인을 가능하게 하지만, 도난된 모델은 프레임워크 변환, 암호화, 또는 앱 수준의 입력-출력 중재를 통해 재배포될 수 있습니다. 이러한 변환은 확인에 사용되는 트리거 응답, 신뢰도 패턴 또는 출력 의미론을 방해하면서 정상적인 추론을 보존할 수 있습니다.
위의 아홉 가지 공개 문제 외에도, 본 SoK는 MoAI 보안이 다음에 확장될 가능성이 높은 세 가지 새로운 방향을 강조합니다. 이러한 방향은 정적이고 추론 전용인 온디바이스 모델에서 적응형, 생성형, 행동 지향형 MoAI 시스템으로 이동합니다. 여기서는 높은 수준으로 요약합니다. 동반 논문은 보다 자세한 동기, 위협 표면, 연구 과제를 제공합니다.
현재 MoAI 보안 연구는 주로 읽기 전용이고 추론 전용인 배포된 모델에 초점을 맞추고 있습니다. 온디바이스 학습은 모델이 로컬에서 업데이트될 수 있도록 허용하여 이 가정을 변경하며, 이는 학습 과정 중 그래디언트, 매개변수 업데이트, 사용자 데이터를 노출합니다. 이는 로컬 미세 조정, 업데이트 무결성, 학습 데이터 노출, 개인화 중독, 최종 사용자 장치에서 학습 시간 상태에 대한 방어에 관한 새로운 질문을 제기합니다.
기존 MoAI 보안 연구는 여전히 주로 이미지 분류와 같은 비전 기반 작업에 중심을 두고 있습니다. LLM과 생성 모델이 스마트폰으로 이동함에 따라 MoAI 보안은 프롬프트 기반 및 콘텐츠 생성 시스템으로 확장되어야 합니다. 중요한 과제로는 온디바이스 LLM에 대한 프롬프트 주입, 젤브레이크, 의도치 않은 정보 공개, 로컬 컨텍스트 유출이 있습니다.
MoAI 시스템은 수동적인 로컬 추론에서 모델을 센서, 개인 사용자 데이터, 앱 컨텍스트, OS 서비스, 크로스 앱 인터페이스와 연결하는 에이전트 워크플로우로 진화하고 있습니다. 이는 보안 초점을 모델 아티팩트 보호 단독에서 컨텍스트-행동 체인을 관리하는 것으로 전환합니다. 향후 연구는 모바일 컨텍스트에 대한 출처 추적, 신뢰할 수 있는 사용자 의도와 신뢰할 수 없는 환경 콘텐츠의 분리, 도구 및 API 사용에 대한 작업 범위 권한, 민감한 행동에 대한 확인 및 롤백, 에이전트 계획, 메모리, 행동에 대한 감사를 연구해야 합니다.
| MoAI 보안 기둥 | 보호 대상 | 대표적 공격 | 대표적 방어 |
|---|
| 사용자 제어 입력 무결성 | 모바일 데이터 수집부터 모델 입력 전달까지의 사용자 입력 종단간 무결성 | 적대적 공격, 백도어 공격, 에너지-지연 시간 공격 | - |
| 기기 내 모델 보안 | 배포된 모델 아티팩트 및 기기에서 모델이 저장, 로드, 변환, 구체화되는 모든 배포 후 형태 | 적대적 공격, 백도어 공격, 적대적 가중치 공격, 모델 도난 공격, 에너지-지연 시간 공격 | 모델 난독화, 모델 인가, TEE, 모델 워터마킹 |
| 기기 네이티브 환경 격리 | 모바일 OS, AI 런타임, 메모리 서브시스템 및 하드웨어 기반 실행 환경 전반의 민감한 추론 연산 및 런타임 상태 | 모델 도난 공격, 에너지-지연 시간 공격 | 모델 난독화, TEE |