최근 우리는 한 가지 질문에 관심이 있었습니다. 작은 언어 모델이 이미 스마트폰에서 로컬로 실행되며 실용적인 에이전트형 작업을 맡을 수 있을 만큼 좋아졌을까요?
주관적인 느낌에만 의존하지 않기 위해, 인기 있는 GGUF 텍스트 모델 5개를 골라 4K와 8K 두 가지 컨텍스트 설정에서 비교했습니다. 리소스 측정은 iPhone 15 Pro Max 실제 기기에서 진행했고, 능력 측정은 모든 모델에 동일한 96개 결정적 에이전트 라우팅 케이스를 적용했습니다. 이 케이스들은 Skill 선택, Action 추출, Mode 분류, 필수 슬롯 보존, 간단한 planning 판단을 다룹니다.
이 글은 광범위한 학술 벤치마크가 아닙니다. 스마트폰 우선 관점의 엔지니어링 점검입니다. 모델이 로드되는지, 8K 컨텍스트가 메모리를 얼마나 더 쓰는지, 첫 토큰은 얼마나 빨리 나오는지, 그리고 작은 로컬 에이전트 런타임을 위해 안정적인 구조화 결정을 만들 수 있는지를 봅니다.
테스트한 모델
| 모델 | 로컬 크기 | 양자화 | 상태 |
|---|---|---|---|
| MiniCPM5-1B | 656.2 MiB | Q4_K_M | 테스트 완료 |
| Gemma-3-1B-IT | 768.7 MiB | Q4_K_M | 테스트 완료 |
| Qwen3.5-2B | 1221.5 MiB | Q4_K_M | 테스트 완료 |
| Qwen2.5-3B-Instruct | 2007.4 MiB | Q4_K_M | 테스트 완료 |
| Phi-4-mini-instruct | 2376.4 MiB | Q4_K_M | 테스트 완료 |
Qwen3.8이 있는데 왜 Qwen3.5를 테스트했을까
Qwen의 최신 메인라인은 이미 3.5를 넘어섰습니다. 현재 공개된 Qwen3.8 제품군의 중심은 Qwen3.8-Max, Qwen3.8-2.4T-A95B, Qwen3.8-27B 같은 훨씬 큰 모델입니다. 이 모델들은 중요하지만, 1B-4B급 스마트폰 로컬 라우팅 모델과는 같은 배포 범주가 아닙니다.
이 테스트의 목적은 최신 클라우드 플래그십을 평가하는 것이 아닙니다. 실제로 스마트폰 런타임 안에 넣을 수 있는 모델을 찾는 것입니다. 기본 4K context, 어려운 작업에서만 8K, 예측 가능한 메모리 사용량, 안정적인 구조화 결정이 필요합니다. 이 제약에서는 Qwen3.5-2B가 여전히 Qwen 계열의 중요한 후보입니다. 더 최신인 Qwen3.6, Qwen3.7, Qwen3.8 라인에는 이 역할에 맞는 공식 1B/2B급 오픈 모델이 아직 명확하지 않습니다.
| Qwen 라인 | 공개된 스마트폰 로컬 소형 후보 | 이 테스트에서의 판단 |
|---|---|---|
| Qwen3.5 | 있음: 0.8B, 2B, 4B급 모델 | 스마트폰 로컬 라우팅과 관련 있음. 이번에는 2B를 테스트 |
| Qwen3.6 | 명확한 1B/2B/4B 오픈 후보는 아직 확인되지 않음 | 공개 가중치는 주로 27B와 35B-A3B급 |
| Qwen3.7 | 명확한 1B/2B/4B 오픈 후보는 아직 확인되지 않음 | 주로 API 측 Max/Plus/Flash 모델 라인 |
| Qwen3.8 | 스마트폰 크기의 공식 후보는 아직 없음 | 공개 중심은 Max, 2.4T-A95B, 27B. 서드파티 GGUF도 데스크톱/워크스테이션 규모 |
커버리지와 아직 테스트하지 않은 후보
이 표는 "스마트폰에 적합한 모든 모델을 이미 다 테스트했다"는 뜻이 아닙니다. 로컬에 GGUF가 있었고, 동일한 스마트폰 리소스 측정과 동일한 96개 라우팅 프로토콜을 통과시킬 수 있었던 텍스트 모델을 다룬 것입니다.
또한 중국 모델만 비교한 것도 아닙니다. 현재 표에는 Qwen과 MiniCPM 같은 중국 계열 모델뿐 아니라 Google의 Gemma와 Microsoft의 Phi도 포함되어 있습니다. 실제 빈틈은 몇몇 해외 또는 커뮤니티 기반의 새 모바일 후보가 아직 이번 로컬 benchmark에 들어오지 않았다는 점입니다.
| 추가로 테스트할 가치가 있는 후보 | 출처/생태계 | 중요한 이유 |
|---|---|---|
| LFM2.5-1.2B-Instruct | Liquid AI | 온디바이스 사용과 tool-style workload를 겨냥한 후보 |
| LFM2.5-1.2B-Thinking | Liquid AI | 작은 reasoning 후보. 다만 thinking 출력의 지연을 제어해야 함 |
| Llama 3.2 1B/3B Instruct | Meta | 최신은 아니지만 스마트폰 로컬의 중요한 기준선 |
| SmolLM2/SmolLM3 small instruct models | Hugging Face ecosystem | 독립적인 경량 기준선으로 유용 |
| Gemma 3n E2B | 모바일 지향 멀티모달 후보. 텍스트 라우팅뿐 아니라 VLM harness가 필요 | |
| MiniCPM-V-4.6 | OpenBMB ecosystem | 화면 이해, 이미지, OCR 작업을 볼 수 있는 소형 멀티모달 후보 |
다음 반복에서는 호환 가능한 로컬 artifact, 동일한 4K/8K 스마트폰 리소스 측정, 동일한 구조화 라우팅 또는 멀티모달 작업 프로토콜이 준비된 후보만 같은 비교표에 넣는 것이 맞습니다.
스마트폰 측 환경은 iPhone 15 Pro Max, A17 Pro, 8 GB 물리 메모리, iOS 26.6.1, SwiftLlama와 llama.cpp b8668, Metal 전체 레이어 오프로딩입니다. 각 모델과 context 조합마다 독립 실행을 3회 수행했습니다.
측정 흐름
This diagram could not be rendered. Its source is still available below.
View diagram source
flowchart LR
A[GGUF 모델 선택] --> B[스마트폰 4K 및 8K 리소스 측정]
B --> C[로드 시간, TTFT, 프로세스 메모리, Metal 메모리 기록]
C --> D[동일한 96개 라우팅 케이스 실행]
D --> E[Parse, Skill, Action, Mode, 슬롯, Planning 점수화]
E --> F[스마트폰 우선 배포 게이트 적용]
스마트폰 리소스 측정은 짧은 중국어 프롬프트를 사용해 모델 로딩, 컨텍스트 할당, 짧은 프롬프트 TTFT, 기본 생성, 메모리 사용량을 확인했습니다. 완전한 4K/8K 긴 프롬프트 prefill 스트레스 테스트는 아닙니다.
96개 능력 측정은 동일한 모델 파일과 결정적 샘플링 설정을 사용했지만, 모든 모델 비교를 재현 가능하게 만들기 위해 데스크톱 Metal 평가 러너에서 실행했습니다. 이렇게 하면 스마트폰 리소스 가능성과 구조화 라우팅 품질을 분리해서 볼 수 있습니다.
iPhone 4K 및 8K 리소스 결과
5개 모델 모두 두 컨텍스트 크기에서 성공적으로 로드되었습니다.
| 모델 | Context | Load P50 | TTFT P50 | 로드 후 프로세스 메모리 | 로드 후 Metal 메모리 | 결과 |
|---|---|---|---|---|---|---|
| MiniCPM5-1B | 4K | 0.172 s | 0.140 s | 175.7 MiB | 1008.8 MiB | 3/3 loaded |
| MiniCPM5-1B | 8K | 0.176 s | 0.136 s | 271.6 MiB | 1104.8 MiB | 3/3 loaded |
| Gemma-3-1B-IT | 4K | 0.621 s | 0.215 s | 197.3 MiB | 1381.2 MiB | 3/3 loaded |
| Gemma-3-1B-IT | 8K | 0.567 s | 0.200 s | 301.3 MiB | 1485.2 MiB | 3/3 loaded |
| Qwen3.5-2B | 4K | 0.323 s | 0.268 s | 201.4 MiB | 1767.8 MiB | 3/3 loaded |
| Qwen3.5-2B | 8K | 0.323 s | 0.274 s | 249.6 MiB | 1819.8 MiB | 3/3 loaded |
| Qwen2.5-3B-Instruct | 4K | 0.303 s | 0.445 s | 230.8 MiB | 2447.0 MiB | 3/3 loaded |
| Qwen2.5-3B-Instruct | 8K | 0.296 s | 0.442 s | 375.0 MiB | 2591.0 MiB | 3/3 loaded |
| Phi-4-mini-instruct | 4K | 0.431 s | 0.503 s | 614.0 MiB | 3291.8 MiB | 3/3 loaded |
| Phi-4-mini-instruct | 8K | 0.569 s | 0.511 s | 1126.4 MiB | 3795.8 MiB | 3/3 loaded |
가장 중요한 리소스 결과는 4K에서 8K로 올렸을 때의 증가분입니다. 이 설정에서 Qwen3.5-2B는 Metal 메모리가 약 52 MiB만 증가했습니다. 반면 Phi-4-mini는 약 504 MiB 증가했습니다. 보통은 4K로 실행하고 어려운 작업에서만 8K로 올리는 스마트폰 런타임이라면, Qwen3.5-2B의 비용 곡선이 훨씬 다루기 쉽습니다.
96개 라우팅 능력 결과
이 능력 세트에는 중국어와 영어 에이전트형 요청 96개가 포함되어 있습니다. 모델이 유효한 구조화 결정을 출력할 수 있는지, 올바른 Skill과 Action을 고를 수 있는지, retrieve/act/clarify/answer 동작을 분류할 수 있는지, 필요한 슬롯을 보존할 수 있는지, planning이 필요한 케이스를 인식할 수 있는지 확인했습니다.
| 모델 | Context | Parse | Skill | Action | Mode | Missing slots | Planning | TTFT P50 | E2E P50 |
|---|---|---|---|---|---|---|---|---|---|
| MiniCPM5-1B | 4K | 62.5% | 85.4% | 51.0% | 53.1% | 28.6% | 25.0% | 0.136 s | 0.622 s |
| MiniCPM5-1B | 8K | 62.5% | 85.4% | 51.0% | 53.1% | 28.6% | 25.0% | 0.138 s | 0.592 s |
| Gemma-3-1B-IT | 4K | 68.8% | 82.3% | 52.1% | 58.3% | 42.9% | 37.5% | 0.147 s | 0.976 s |
| Gemma-3-1B-IT | 8K | 68.8% | 82.3% | 52.1% | 58.3% | 42.9% | 37.5% | 0.148 s | 0.920 s |
| Qwen3.5-2B | 4K | 100.0% | 95.8% | 95.8% | 96.9% | 100.0% | 87.5% | 0.276 s | 1.098 s |
| Qwen3.5-2B | 8K | 100.0% | 95.8% | 95.8% | 96.9% | 100.0% | 87.5% | 0.273 s | 1.079 s |
| Qwen2.5-3B-Instruct | 4K | 94.8% | 80.2% | 71.9% | 79.2% | 66.7% | 37.5% | 0.522 s | 1.633 s |
| Qwen2.5-3B-Instruct | 8K | 94.8% | 80.2% | 71.9% | 79.2% | 66.7% | 37.5% | 0.529 s | 1.644 s |
| Phi-4-mini-instruct | 4K | 67.7% | 50.0% | 42.7% | 51.0% | 42.9% | 12.5% | 0.606 s | 2.220 s |
| Phi-4-mini-instruct | 8K | 63.5% | 55.2% | 34.4% | 42.7% | 42.9% | 25.0% | 0.620 s | 1.870 s |
1B급 모델은 리소스 비용 면에서 매력적이지만, 구조화된 Action과 Mode 결정에서 실패가 너무 많았습니다. 알림, 이메일 초안, 메모리 업데이트 같은 쓰기 경로에 닿을 수 있는 로컬 어시스턴트라면, 이는 단순한 벤치마크 점수가 아니라 실제 제품 리스크입니다.
Qwen3.5-2B는 이 그룹에서 제안 배포 게이트를 통과한 유일한 모델이었습니다. Parse가 안정적이고, Skill과 Action이 90%를 넘었으며, Mode도 95%를 넘었습니다. 동시에 스마트폰 측 8K Metal 메모리는 2 GiB 미만이었습니다.
실용적 순위
| 순위 | 모델 | 가장 적합한 용도 |
|---|---|---|
| 1 | Qwen3.5-2B Q4_K_M | 기본 로컬 에이전트 라우팅 후보 |
| 2 | Qwen2.5-3B-Instruct Q4_K_M | 연구 기준선. 스마트폰 기본값으로는 최적이 아님 |
| 3 | MiniCPM5-1B Q4_K_M | 매우 낮은 리소스 fallback. 단순 분류에 적합 |
| 4 | Gemma-3-1B-IT Q4_K_M | 흥미로운 경량 기준선이지만 액션 결정은 불안정 |
| 5 | Phi-4-mini-instruct Q4_K_M | 이 스마트폰 우선 라우팅 용도에는 너무 무거움 |
이 결과가 말해 주는 것
스마트폰 로컬 에이전트에서 가장 좋은 모델이 항상 가장 작은 모델은 아닙니다. 가장 작은 모델들은 TTFT와 메모리에서는 이겼지만, 구조화 결정 품질이 크게 떨어졌습니다. 반대로 더 큰 모델이 자동으로 이기는 것도 아닙니다. Qwen2.5-3B와 Phi-4-mini는 Qwen3.5-2B보다 더 많은 메모리를 사용했지만, 이 라우팅 작업에서는 점수가 낮았습니다.
이번 테스트에서 유용한 중간 지점은 Qwen3.5-2B였습니다. 8K 메모리를 현실적인 범위에 유지하면서, 중국어와 영어 케이스 모두에서 JSON에 가까운 라우팅 결정을 안정적으로 출력했습니다. 다만 배터리와 발열을 고려하면 기본 context는 여전히 4K로 두고, 작업 복잡도가 실제로 필요할 때만 8K로 올리는 편이 좋습니다.
한계와 다음 테스트
이 숫자를 과도하게 일반화해서는 안 됩니다.
스마트폰 리소스 테스트는 짧은 프롬프트를 사용했습니다. 다음 단계는 약 3.5K와 7.5K prompt tokens의 긴 prefill 측정, 그리고 20턴 연속 세션에서 tokens/s, 열 상태, 배터리 감소, jetsam 리스크를 기록하는 것입니다.
능력 테스트는 텍스트 라우팅에 집중했습니다. Gemma 3n과 MiniCPM-V 같은 멀티모달 후보는 화면 이해, OCR, 사진 질문, 권한 제한이 있는 개인정보 시나리오를 포함하는 별도의 VLM harness로 평가해야 합니다.
다음에 테스트할 만한 온디바이스 후보로는 LFM2.5-1.2B-Instruct, LFM2.5-1.2B-Thinking, Llama 3.2 1B/3B, SmolLM 계열 small instruct models, Qwen3.5-4B, Gemma 3n E2B, MiniCPM-V-4.6이 있습니다. 이 모델들은 동일한 스마트폰 리소스 측정과 동일한 능력 프로토콜을 통과한 뒤에만 같은 비교 표에 넣는 것이 맞습니다.