정보
작은 gpu를 위한 tenrary모델
kamziki

Lv.1 kamziki (112.♡.3.91)

2026년 7월 21일 PM 06:42

조회 249 공감 0

Bonsai27b(https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf)라는 모델을 소개합니다. Qwen 3.6 27b모델을 삼항(ternary)모델로 변환한 모델인데 크기가 겨우 2 ~8 giga밖에 하지 않습니다. 그럼에도 불구하고 벤치마크 상으로는 성능이 꽤 괜찮네요.

다만, 이게 좀 스페셜한 llama.cpp가 필요합니다.

포맷

llama.cpp 버전

상태

1-bit (Q1_0)

업스트림 lama.cpp (최신)

✅ 일반 빌드로 동작

Ternary (Q2_0)

PrismML 포크 (prism 브랜치)

❌ 일반 빌드는 불가

Ternary를 돌리는 방법

# PrismML 포크의 prism 브랜치 사용
git clone -b prism https://github.com/PrismML-Eng/llama.cpp
cd llama.cpp
cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON  # 또는 -DGGML_METAL=ON
cmake --build build -j

왜 필요한가?

Ternary는 {-1, 0, +1} 3개 값을 Q2_0_g128 형식으로 인코딩하는데, 표준 llama.cpp에는 이 커널이 없습니다. PrismML이 커스텀 2-bit 하이브리드 어텐션 커널을 직접 작성해서 prism 브랜치에 넣었습니다.

바이너리도 제공

빌드 귀찮으면 PrismML llama.cpp 릴리스에서 macOS/Linux/Windows 사전 빌드를 받을 수 있어요.


Sources: llama.cpp Docs · Ternary-Bonsai-8B-gguf · Ternary-Bonsai-27B-gguf

댓글 (2)

  • YBman

    YBman Lv.1

    21:07 · 14.♡.247.164

    노트북 gpu에서도 20-30tps 정도 나온다는 얘기가 있네요. prefill은 500-700정도까지도 나온다고하고요.. 문제는 모델은 경량인데 kv 캐시는 어떻게 안되서 kv캐시가 발복을 잡는다고 하는데 한 번 경험해 보고는 싶습니다. 지식을 희상하고 코딩과 에이전틱 기능에 몰빵한 느낌입니다.

  • H

    hogar Lv.1

    21:49 · 1.♡.153.197

    써보니 한글 출력을 못하더라구요.

댓글을 작성하려면 이 필요합니다.