내용 업데이트: 2026년 9월 16일. 최초 발행일과 별도로 자료 확인 기준을 본문에 표시했습니다.

같은 ‘로컬 LLM용 맥미니’라도 원하는 모델에 따라 구매 판단은 달라집니다. Ollama에서 Llama 3.1의 8B 모델은 배포 파일이 4.9GB, 70B 모델은 43GB입니다. 둘 다 같은 Q4_K_M 양자화지만 크기는 크게 다릅니다. ‘몇 GB 맥을 살까’보다 ‘어느 모델로 무슨 일을 할까’를 먼저 정해야 하는 이유입니다.

이 글은 두 가지 선택 사례로 구매 후보를 좁히는 방법을 설명합니다. 모델 파일 크기는 2026년 9월 16일 공식 배포 페이지에서 확인했습니다. 제품 사양은 공식 문서 기준이며, 신형 Mac에서 측정한 속도나 실행 성공 기록은 아닙니다.

같은 계열, 다른 배포 파일 크기

Llama 3.1 · Q4_K_M · Ollama 표시 GB 기준

8B: 4.9GB

70B: 43GB

공식 배포 파일 크기 비교입니다. 실행 메모리·속도·남는 RAM을 뜻하지 않습니다. 출처: 본문의 Ollama 배포 링크, 2026-09-16 확인.

두 독자의 선택: 작은 모델로 시작할 때와 70B가 목표일 때

모바일에서는 표를 좌우로 밀어 전체 내용을 확인할 수 있습니다.

목표 확인한 사실 지금 내릴 수 있는 판단 아직 확인할 것
Llama 3.1 8B로 짧은 문서 요약을 시험하고 싶다 Q4_K_M 배포 파일 4.9GB 파일 크기만으로 48·64GB가 필수라는 근거는 없다. 기존 장비에서 목표 작업을 먼저 시험할 후보 원하는 답변 품질, 컨텍스트, 실제 사용 메모리와 시간
Llama 3.1 70B를 로컬에서 쓰고 싶다 Q4_K_M 배포 파일 43GB 32GB를 여유 있는 전량 적재 구성으로 기대하는 구매는 재검토. 48GB도 파일과의 차이만 보고 충분하다고 확정하지 않기 실행 방식, 추가 메모리, 같은 조건의 실행 기록

출처: 8B 배포 정보, 70B 배포 정보. 식별자는 각각 46e0c10c039e, 711a9e8463af입니다. 위 사례는 구매 판단을 설명하기 위한 상황이며 실제 사용 후기나 실행 결과가 아닙니다. 파일 크기와 실행 메모리는 같지 않고, 표의 용량은 ‘여유 RAM 계산’에 쓰는 수치가 아닙니다.

M6와 M5 Pro, 메모리 옵션부터 비교하기

제품 메모리 구성 확인할 조건
Mac mini M6 16·24·32GB 최대 32GB 범위에서 작업에 필요한 여유가 있는지
Mac mini M5 Pro 24·48·64GB 32GB보다 큰 구성이 필요한지
Mac Studio M5 Max 기본 36GB, 최대 128GB 128GB는 40코어 GPU 구성 조건 확인
Mac Studio M5 Ultra 기본 96GB, 최대 512GB 512GB는 80코어 GPU 구성 조건 확인

출처: Apple Mac mini 사양, Apple Mac Studio 사양. 최대 메모리 구성의 가격은 기본형 시작 가격과 다릅니다. 최종 가격은 같은 메모리·SSD 조건으로 견적을 내서 비교해야 합니다.

‘모델 파일이 들어간다’와 ‘작업을 끝낸다’는 다릅니다

구매 전 다음 세 가지를 나눠 적어보세요.

  1. 모델: 이름뿐 아니라 정확한 태그와 양자화 형식까지 기록합니다.
  2. 작업: 짧은 대화인지, 긴 문서 요약인지, 코드 저장소 분석인지 정합니다.
  3. 실행 조건: 런타임 버전, 컨텍스트 설정, 동시 요청 수를 기록합니다.

특히 컨텍스트를 늘리면 필요한 메모리도 증가합니다. 같은 모델이 짧은 질문에는 동작하더라도 긴 자료를 넣는 작업까지 보장하지는 않습니다. Ollama는 실행 중인 모델의 할당 컨텍스트를 ollama ps로 확인하도록 안내합니다. Ollama 컨텍스트 문서

‘32GB면 무조건 충분하다’는 답 대신 내가 쓰려는 모델과 작업을 같은 조건에서 실행한 기록이 있는가를 확인하는 편이 구매 판단에 도움이 됩니다.

구매 전에 이 한 줄을 채워보세요

나는 [모델 태그·양자화]로 [실제 작업]을 하고, [입력 길이]의 자료를 넣어 [허용 대기시간] 안에 [확인할 답변 품질]을 얻고 싶다.

예를 들어 ‘회의록에서 결정사항 세 개를 빠짐없이 뽑기’와 ‘저장소 전체를 읽고 오류를 고치기’는 다른 시험입니다. 첫 작업을 해냈다는 이유로 두 번째 작업까지 된다고 판단하면 구매 기준이 흔들립니다.

기기가 이미 있다면 평소 문서와 공개 가능한 짧은 시험 문서를 구분하고, 우선 시험 문서에서 답이 맞는지 확인하세요. 기기가 없다면 이 한 줄과 일치하는 측정 기록을 찾습니다. 모델명만 같고 입력 길이·양자화가 다른 후기는 구매 근거로 삼기 어렵습니다.

메모리 사양이 필요한 범위를 만족한 뒤에 같은 SSD 조건의 최종 견적과 응답 시간을 비교하세요. 대역폭 비율을 곧바로 토큰 생성 속도 비율로 바꾼 표는 실측표와 구분해야 합니다.

후기를 읽을 때 확인할 측정표

아래 항목이 빠진 ‘빠르다’는 평가는 자신의 작업과 비교하기 어렵습니다. 직접 시험한다면 빈칸을 실제 기록으로 채우면 됩니다.

기록 항목 적을 내용
기기 칩·GPU 구성·메모리·OS 버전
실행기 Ollama 또는 다른 런타임 이름·버전
모델 정확한 태그·양자화·파일 식별 정보
입력 같은 프롬프트·문서·컨텍스트 설정
결과 총 소요 시간·출력 토큰 수·오류·작업 답변의 정확성
반복 최초 실행과 모델 로딩 후 반복 실행을 구분

Ollama API는 생성 토큰 수와 생성 소요 시간 등의 항목을 제공합니다. 이를 기록할 수 있지만, 기기 간 비교에는 입력과 실행 조건도 맞아야 합니다. Ollama generate API

모델을 아직 정하지 못했다면

오늘은 최대 사양을 고르는 대신 위의 한 줄을 채워보세요. 작업 기준이 있어야 ‘더 큰 메모리가 필요하다’와 ‘더 큰 모델이 필요하지 않았다’를 구분할 수 있습니다.