플루 (221.♡.234.208)
2026년 7월 20일 PM 09:38 · 수정 3회(22:25)
최근에 일때문에, claude 를 맘껏 쓸수 있게 되는 바람에... 두어달 .llm 이 잠깐 손을 놓고 있었습니다.
그 사이에도 계속 llm 은 계속 발전 하고 있었더군요.
아래쪽에 qwen3.6 27b MTP 사용기를 보고, llamacpp 로
rtx3090 에 올려 봤는데... 220w 제한 걸고(풀로 돌리면, 팬소리가 시크러워서..),
30 tok/s 나오길래 ... 놀랐습니다. 30tok 정도면, 로컬로 잘써먹을만 하거든요.
하는김에... qwen3.6 27b DFlash 도 빌드해서 돌려봤는데.. 40-50tok/s 정도 나옵니다.
MTP 는 꾸준하게 평속 30tok 을 뽑는 반면,
Dflash 는 속도가 들쭉 날쭉 입니다. 대체로 , 코딩을 길게 뽑을 때는 50 tok/s 나오고 , 않좋을때는 20tok/s
정도 나옵니다.
기술이 좀더 안정화 되면, 좀더 속도가 나올지도 모르겠습니다.
관심있으신분은 DFlash 가 llamacpp 에 완전 병합된 상태가 아닌것 같아서,
아래 링크 따라 가면, 빌드 해서 테스트 가능합니다.
https://github.com/Anbeeld/beellama.cpp/blob/main/docs/quickstart-qwen36-dflash.md
좀있으면.. qwen3.8 이 나온다고 하죠? 로컬에서 맘껏 ai 사용할수 있는 날이 왔으면 좋겠네요.
최근 글
댓글 (7)
-
알알아야면장
07.20 · 217.♡.139.192
-
YYBman
07.20 · 14.♡.247.164
GPT에게 물어봤습니다.ㅎㅎㅎ
질문의 "Dfalsh"는 DFlash로 보고 조사했습니다.현재 환경에서는 Qwen3.6-27B의 MTP를 완전히 버리고 DFlash로 전환하는 것은 아직 권하지 않습니다.
제 판단을 수치로 표현하면 다음과 같습니다.
짧은 코딩 작업에서 DFlash가 현재 MTP보다 빠를 확률 65%
32K 전후 작업에서도 DFlash가 더 빠를 확률 45%
64K-128K 장문맥에서도 DFlash가 더 빠를 확률 25%
현재 llama.cpp 환경에서 안정성과 속도를 모두 포함해 DFlash가 우월할 확률 30%
지금 MTP를 완전히 제거한 뒤 후회하거나 롤백할 확률 65%
MTP를 유지하면서 DFlash를 시험해 볼 가치 85%
따라서 최종적인 전환 판단은 다음과 같습니다.
지금 즉시 MTP 폐기: 반대 70%, 찬성 30%
DFlash 병행 설치 후 A/B 시험: 찬성 85%==> 후회 할 확률도 구해줄 것이라고는 예상하지 못했습니다..ㅎㅎ
-
플플루
→ YBman 작성자
07.20 · 221.♡.234.208
ㅋㅋ 오타 감사. 아직은 D false 가 맞나 봅니다.
- R
rustacean
07.20 · 59.♡.65.234
제가 MTP랑 DFlash 둘 다 써봤는데 속도는 거기서 거기더군요. MTP는 업스트림 병합된상태라 저는 그걸로 쓰고 있습니다.
-
CCaTo
→ rustacean
07.21 · 106.♡.10.51
지금 dflash도 업스트림에 병합되었습니다
- R
rustacean
→ CaTo
07.21 · 59.♡.65.234
오 병합된줄 몰랐네요. 감사합니다.
-
CCaTo
07.21 · 106.♡.10.51
dflash가 디퓨전방식이라 일전에 gemma4 디퓨전 비슷한 느낌으로 결과가...
댓글을 작성하려면 이 필요합니다.
로컬에서 맘놓고 돌릴려면...램 256기가봅니다..ㅋㅋㅋ 2030년에나 가능하지 않을까 조심스레 뻘글 올립니다.