정보
작은 gpu를 위한 tenrary모델
K
kamziki (112.♡.3.91)
2026년 7월 21일 PM 06:42
조회 249 공감 0
Bonsai27b(https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf)라는 모델을 소개합니다. Qwen 3.6 27b모델을 삼항(ternary)모델로 변환한 모델인데 크기가 겨우 2 ~8 giga밖에 하지 않습니다. 그럼에도 불구하고 벤치마크 상으로는 성능이 꽤 괜찮네요.

다만, 이게 좀 스페셜한 llama.cpp가 필요합니다.
포맷 | llama.cpp 버전 | 상태 |
|---|---|---|
1-bit (Q1_0) | 업스트림 lama.cpp (최신) | ✅ 일반 빌드로 동작 |
Ternary (Q2_0) | PrismML 포크 ( | ❌ 일반 빌드는 불가 |
Ternary를 돌리는 방법
# PrismML 포크의 prism 브랜치 사용
git clone -b prism https://github.com/PrismML-Eng/llama.cpp
cd llama.cpp
cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON # 또는 -DGGML_METAL=ON
cmake --build build -j
왜 필요한가?
Ternary는 {-1, 0, +1} 3개 값을 Q2_0_g128 형식으로 인코딩하는데, 표준 llama.cpp에는 이 커널이 없습니다. PrismML이 커스텀 2-bit 하이브리드 어텐션 커널을 직접 작성해서 prism 브랜치에 넣었습니다.
바이너리도 제공
빌드 귀찮으면 PrismML llama.cpp 릴리스에서 macOS/Linux/Windows 사전 빌드를 받을 수 있어요.
Sources: llama.cpp Docs · Ternary-Bonsai-8B-gguf · Ternary-Bonsai-27B-gguf
최근 글
최근 댓글
- 4.5가 최근에도 출시되었네요. motif수준까지는 안되는것 같습니다. 어쨌든 한국에서 처음개발을 했다는건 의미가 있는 모델이고 이 모델연구 책
- 마이크로소프트 조차 신규 모델 개발 대신 qwen모델을 파인튜닝 하는 정도인데 ... 그만큼 비용이 엄청나게 들어서겠죠. 이 정도면 잘 따라가는
- 아직 API서비스는 안되고 있습니다만, chat은 가능한것 같더라구요.
- 테슬라 팔았으면 아무 문제 없었는데 즙을 짰군요. 아니지 즙짜면 이재명이 해결해주는데.. 그게 더 남는 장사긴 하네요 푸허하
- 이렇게 입장문을 냈는데.. 송영길이 "진짜 그렇게 말했어요"라고 다시 주장하면 엄청 웃기겠네요.
댓글 (2)
-
YYBman
21:07 · 14.♡.247.164
- H
hogar
21:49 · 1.♡.153.197
써보니 한글 출력을 못하더라구요.
댓글을 작성하려면 이 필요합니다.
노트북 gpu에서도 20-30tps 정도 나온다는 얘기가 있네요. prefill은 500-700정도까지도 나온다고하고요.. 문제는 모델은 경량인데 kv 캐시는 어떻게 안되서 kv캐시가 발복을 잡는다고 하는데 한 번 경험해 보고는 싶습니다. 지식을 희상하고 코딩과 에이전틱 기능에 몰빵한 느낌입니다.