모든 글

스마트폰에서 작은 언어 모델 테스트: 4K/8K 컨텍스트, 메모리, 라우팅 정확도

iPhone 15 Pro Max에서 5개의 소형 GGUF 언어 모델을 측정하고 4K/8K 메모리, 첫 토큰 지연, 96개 에이전트 라우팅 케이스를 비교했습니다.

온디바이스 AILLM모바일 추론벤치마크에이전트 라우팅
스마트폰에서 작은 언어 모델 테스트: 4K/8K 컨텍스트, 메모리, 라우팅 정확도

최근 우리는 한 가지 질문에 관심이 있었습니다. 작은 언어 모델이 이미 스마트폰에서 로컬로 실행되며 실용적인 에이전트형 작업을 맡을 수 있을 만큼 좋아졌을까요?

주관적인 느낌에만 의존하지 않기 위해, 인기 있는 GGUF 텍스트 모델 5개를 골라 4K와 8K 두 가지 컨텍스트 설정에서 비교했습니다. 리소스 측정은 iPhone 15 Pro Max 실제 기기에서 진행했고, 능력 측정은 모든 모델에 동일한 96개 결정적 에이전트 라우팅 케이스를 적용했습니다. 이 케이스들은 Skill 선택, Action 추출, Mode 분류, 필수 슬롯 보존, 간단한 planning 판단을 다룹니다.

이 글은 광범위한 학술 벤치마크가 아닙니다. 스마트폰 우선 관점의 엔지니어링 점검입니다. 모델이 로드되는지, 8K 컨텍스트가 메모리를 얼마나 더 쓰는지, 첫 토큰은 얼마나 빨리 나오는지, 그리고 작은 로컬 에이전트 런타임을 위해 안정적인 구조화 결정을 만들 수 있는지를 봅니다.

테스트한 모델

모델로컬 크기양자화상태
MiniCPM5-1B656.2 MiBQ4_K_M테스트 완료
Gemma-3-1B-IT768.7 MiBQ4_K_M테스트 완료
Qwen3.5-2B1221.5 MiBQ4_K_M테스트 완료
Qwen2.5-3B-Instruct2007.4 MiBQ4_K_M테스트 완료
Phi-4-mini-instruct2376.4 MiBQ4_K_M테스트 완료

Qwen3.8이 있는데 왜 Qwen3.5를 테스트했을까

Qwen의 최신 메인라인은 이미 3.5를 넘어섰습니다. 현재 공개된 Qwen3.8 제품군의 중심은 Qwen3.8-Max, Qwen3.8-2.4T-A95B, Qwen3.8-27B 같은 훨씬 큰 모델입니다. 이 모델들은 중요하지만, 1B-4B급 스마트폰 로컬 라우팅 모델과는 같은 배포 범주가 아닙니다.

이 테스트의 목적은 최신 클라우드 플래그십을 평가하는 것이 아닙니다. 실제로 스마트폰 런타임 안에 넣을 수 있는 모델을 찾는 것입니다. 기본 4K context, 어려운 작업에서만 8K, 예측 가능한 메모리 사용량, 안정적인 구조화 결정이 필요합니다. 이 제약에서는 Qwen3.5-2B가 여전히 Qwen 계열의 중요한 후보입니다. 더 최신인 Qwen3.6, Qwen3.7, Qwen3.8 라인에는 이 역할에 맞는 공식 1B/2B급 오픈 모델이 아직 명확하지 않습니다.

Qwen 라인공개된 스마트폰 로컬 소형 후보이 테스트에서의 판단
Qwen3.5있음: 0.8B, 2B, 4B급 모델스마트폰 로컬 라우팅과 관련 있음. 이번에는 2B를 테스트
Qwen3.6명확한 1B/2B/4B 오픈 후보는 아직 확인되지 않음공개 가중치는 주로 27B와 35B-A3B급
Qwen3.7명확한 1B/2B/4B 오픈 후보는 아직 확인되지 않음주로 API 측 Max/Plus/Flash 모델 라인
Qwen3.8스마트폰 크기의 공식 후보는 아직 없음공개 중심은 Max, 2.4T-A95B, 27B. 서드파티 GGUF도 데스크톱/워크스테이션 규모

커버리지와 아직 테스트하지 않은 후보

이 표는 "스마트폰에 적합한 모든 모델을 이미 다 테스트했다"는 뜻이 아닙니다. 로컬에 GGUF가 있었고, 동일한 스마트폰 리소스 측정과 동일한 96개 라우팅 프로토콜을 통과시킬 수 있었던 텍스트 모델을 다룬 것입니다.

또한 중국 모델만 비교한 것도 아닙니다. 현재 표에는 Qwen과 MiniCPM 같은 중국 계열 모델뿐 아니라 Google의 Gemma와 Microsoft의 Phi도 포함되어 있습니다. 실제 빈틈은 몇몇 해외 또는 커뮤니티 기반의 새 모바일 후보가 아직 이번 로컬 benchmark에 들어오지 않았다는 점입니다.

추가로 테스트할 가치가 있는 후보출처/생태계중요한 이유
LFM2.5-1.2B-InstructLiquid AI온디바이스 사용과 tool-style workload를 겨냥한 후보
LFM2.5-1.2B-ThinkingLiquid AI작은 reasoning 후보. 다만 thinking 출력의 지연을 제어해야 함
Llama 3.2 1B/3B InstructMeta최신은 아니지만 스마트폰 로컬의 중요한 기준선
SmolLM2/SmolLM3 small instruct modelsHugging Face ecosystem독립적인 경량 기준선으로 유용
Gemma 3n E2BGoogle모바일 지향 멀티모달 후보. 텍스트 라우팅뿐 아니라 VLM harness가 필요
MiniCPM-V-4.6OpenBMB ecosystem화면 이해, 이미지, OCR 작업을 볼 수 있는 소형 멀티모달 후보

다음 반복에서는 호환 가능한 로컬 artifact, 동일한 4K/8K 스마트폰 리소스 측정, 동일한 구조화 라우팅 또는 멀티모달 작업 프로토콜이 준비된 후보만 같은 비교표에 넣는 것이 맞습니다.

스마트폰 측 환경은 iPhone 15 Pro Max, A17 Pro, 8 GB 물리 메모리, iOS 26.6.1, SwiftLlama와 llama.cpp b8668, Metal 전체 레이어 오프로딩입니다. 각 모델과 context 조합마다 독립 실행을 3회 수행했습니다.

측정 흐름

Flow diagram Preparing diagram
View diagram source
flowchart LR
    A[GGUF 모델 선택] --> B[스마트폰 4K 및 8K 리소스 측정]
    B --> C[로드 시간, TTFT, 프로세스 메모리, Metal 메모리 기록]
    C --> D[동일한 96개 라우팅 케이스 실행]
    D --> E[Parse, Skill, Action, Mode, 슬롯, Planning 점수화]
    E --> F[스마트폰 우선 배포 게이트 적용]

스마트폰 리소스 측정은 짧은 중국어 프롬프트를 사용해 모델 로딩, 컨텍스트 할당, 짧은 프롬프트 TTFT, 기본 생성, 메모리 사용량을 확인했습니다. 완전한 4K/8K 긴 프롬프트 prefill 스트레스 테스트는 아닙니다.

96개 능력 측정은 동일한 모델 파일과 결정적 샘플링 설정을 사용했지만, 모든 모델 비교를 재현 가능하게 만들기 위해 데스크톱 Metal 평가 러너에서 실행했습니다. 이렇게 하면 스마트폰 리소스 가능성과 구조화 라우팅 품질을 분리해서 볼 수 있습니다.

iPhone 4K 및 8K 리소스 결과

5개 모델 모두 두 컨텍스트 크기에서 성공적으로 로드되었습니다.

모델ContextLoad P50TTFT P50로드 후 프로세스 메모리로드 후 Metal 메모리결과
MiniCPM5-1B4K0.172 s0.140 s175.7 MiB1008.8 MiB3/3 loaded
MiniCPM5-1B8K0.176 s0.136 s271.6 MiB1104.8 MiB3/3 loaded
Gemma-3-1B-IT4K0.621 s0.215 s197.3 MiB1381.2 MiB3/3 loaded
Gemma-3-1B-IT8K0.567 s0.200 s301.3 MiB1485.2 MiB3/3 loaded
Qwen3.5-2B4K0.323 s0.268 s201.4 MiB1767.8 MiB3/3 loaded
Qwen3.5-2B8K0.323 s0.274 s249.6 MiB1819.8 MiB3/3 loaded
Qwen2.5-3B-Instruct4K0.303 s0.445 s230.8 MiB2447.0 MiB3/3 loaded
Qwen2.5-3B-Instruct8K0.296 s0.442 s375.0 MiB2591.0 MiB3/3 loaded
Phi-4-mini-instruct4K0.431 s0.503 s614.0 MiB3291.8 MiB3/3 loaded
Phi-4-mini-instruct8K0.569 s0.511 s1126.4 MiB3795.8 MiB3/3 loaded

가장 중요한 리소스 결과는 4K에서 8K로 올렸을 때의 증가분입니다. 이 설정에서 Qwen3.5-2B는 Metal 메모리가 약 52 MiB만 증가했습니다. 반면 Phi-4-mini는 약 504 MiB 증가했습니다. 보통은 4K로 실행하고 어려운 작업에서만 8K로 올리는 스마트폰 런타임이라면, Qwen3.5-2B의 비용 곡선이 훨씬 다루기 쉽습니다.

96개 라우팅 능력 결과

이 능력 세트에는 중국어와 영어 에이전트형 요청 96개가 포함되어 있습니다. 모델이 유효한 구조화 결정을 출력할 수 있는지, 올바른 Skill과 Action을 고를 수 있는지, retrieve/act/clarify/answer 동작을 분류할 수 있는지, 필요한 슬롯을 보존할 수 있는지, planning이 필요한 케이스를 인식할 수 있는지 확인했습니다.

모델ContextParseSkillActionModeMissing slotsPlanningTTFT P50E2E P50
MiniCPM5-1B4K62.5%85.4%51.0%53.1%28.6%25.0%0.136 s0.622 s
MiniCPM5-1B8K62.5%85.4%51.0%53.1%28.6%25.0%0.138 s0.592 s
Gemma-3-1B-IT4K68.8%82.3%52.1%58.3%42.9%37.5%0.147 s0.976 s
Gemma-3-1B-IT8K68.8%82.3%52.1%58.3%42.9%37.5%0.148 s0.920 s
Qwen3.5-2B4K100.0%95.8%95.8%96.9%100.0%87.5%0.276 s1.098 s
Qwen3.5-2B8K100.0%95.8%95.8%96.9%100.0%87.5%0.273 s1.079 s
Qwen2.5-3B-Instruct4K94.8%80.2%71.9%79.2%66.7%37.5%0.522 s1.633 s
Qwen2.5-3B-Instruct8K94.8%80.2%71.9%79.2%66.7%37.5%0.529 s1.644 s
Phi-4-mini-instruct4K67.7%50.0%42.7%51.0%42.9%12.5%0.606 s2.220 s
Phi-4-mini-instruct8K63.5%55.2%34.4%42.7%42.9%25.0%0.620 s1.870 s

1B급 모델은 리소스 비용 면에서 매력적이지만, 구조화된 Action과 Mode 결정에서 실패가 너무 많았습니다. 알림, 이메일 초안, 메모리 업데이트 같은 쓰기 경로에 닿을 수 있는 로컬 어시스턴트라면, 이는 단순한 벤치마크 점수가 아니라 실제 제품 리스크입니다.

Qwen3.5-2B는 이 그룹에서 제안 배포 게이트를 통과한 유일한 모델이었습니다. Parse가 안정적이고, Skill과 Action이 90%를 넘었으며, Mode도 95%를 넘었습니다. 동시에 스마트폰 측 8K Metal 메모리는 2 GiB 미만이었습니다.

실용적 순위

순위모델가장 적합한 용도
1Qwen3.5-2B Q4_K_M기본 로컬 에이전트 라우팅 후보
2Qwen2.5-3B-Instruct Q4_K_M연구 기준선. 스마트폰 기본값으로는 최적이 아님
3MiniCPM5-1B Q4_K_M매우 낮은 리소스 fallback. 단순 분류에 적합
4Gemma-3-1B-IT Q4_K_M흥미로운 경량 기준선이지만 액션 결정은 불안정
5Phi-4-mini-instruct Q4_K_M이 스마트폰 우선 라우팅 용도에는 너무 무거움

이 결과가 말해 주는 것

스마트폰 로컬 에이전트에서 가장 좋은 모델이 항상 가장 작은 모델은 아닙니다. 가장 작은 모델들은 TTFT와 메모리에서는 이겼지만, 구조화 결정 품질이 크게 떨어졌습니다. 반대로 더 큰 모델이 자동으로 이기는 것도 아닙니다. Qwen2.5-3B와 Phi-4-mini는 Qwen3.5-2B보다 더 많은 메모리를 사용했지만, 이 라우팅 작업에서는 점수가 낮았습니다.

이번 테스트에서 유용한 중간 지점은 Qwen3.5-2B였습니다. 8K 메모리를 현실적인 범위에 유지하면서, 중국어와 영어 케이스 모두에서 JSON에 가까운 라우팅 결정을 안정적으로 출력했습니다. 다만 배터리와 발열을 고려하면 기본 context는 여전히 4K로 두고, 작업 복잡도가 실제로 필요할 때만 8K로 올리는 편이 좋습니다.

한계와 다음 테스트

이 숫자를 과도하게 일반화해서는 안 됩니다.

스마트폰 리소스 테스트는 짧은 프롬프트를 사용했습니다. 다음 단계는 약 3.5K와 7.5K prompt tokens의 긴 prefill 측정, 그리고 20턴 연속 세션에서 tokens/s, 열 상태, 배터리 감소, jetsam 리스크를 기록하는 것입니다.

능력 테스트는 텍스트 라우팅에 집중했습니다. Gemma 3n과 MiniCPM-V 같은 멀티모달 후보는 화면 이해, OCR, 사진 질문, 권한 제한이 있는 개인정보 시나리오를 포함하는 별도의 VLM harness로 평가해야 합니다.

다음에 테스트할 만한 온디바이스 후보로는 LFM2.5-1.2B-Instruct, LFM2.5-1.2B-Thinking, Llama 3.2 1B/3B, SmolLM 계열 small instruct models, Qwen3.5-4B, Gemma 3n E2B, MiniCPM-V-4.6이 있습니다. 이 모델들은 동일한 스마트폰 리소스 측정과 동일한 능력 프로토콜을 통과한 뒤에만 같은 비교 표에 넣는 것이 맞습니다.

MonoWare에서

App Store를 누르기 전에 신뢰를 쌓습니다.

제품 포트폴리오를 살펴보거나 향후 개인정보 및 제품 엔지니어링 노트를 구독하세요.

뉴스레터

개인정보와 제품 엔지니어링 노트를 가끔 보내드립니다.