#Qwen #LocalLLM #AIEngineering Simon Willison은 노트북에 맞는 17GB 모델에서 하나의 프롬프트를 실행했습니다. 원의 SVG를 그립니다. 3,223개의 완성된 작업 토큰을 생성하는 데 **21분**과 **22,276개의 내부 추론 토큰**이 소요되었습니다. 그리고 돌아온 것은 동심 가이드, 눈금 표시 및 주변 동작이 포함된 "기하학적 원 연구"였습니다. 원이 아닙니다. 모델은 정말 훌륭합니다. 문제는 한 줄의 구성입니다. Qwen은 'reasoning_effort'를 **xhigh**로 설정하여 **Qwen 3.8 27B**를 출시합니다. 이 수준은 "철저한 분석이 필요한 복잡한 작업"을 위한 자체 문서 보유 수준으로 모든 정량화된 빌드의 모든 프롬프트에 적용됩니다. 그 선택에 대한 윌리슨의 평결은 한 단어입니다: 재미있습니다. 이 분류는 기본 비용과 지불할 가치가 있는 시기를 통해 작동합니다. - 산술: 모델이 응답하기 전에 소진한 LM Studio의 8,192개 토큰 기본 컨텍스트 창에 대한 22,276개의 추론 토큰 - 추론이 포함된 동일한 프롬프트 - 137초에 3,715개의 토큰, 21분에 2가 조금 넘게 감소 - 그리고 해당 속도 비용: 추론을 사용하면 그림에 올바른 프레임이 있고 양쪽에 다리가 있었습니다. 측면, 핸들 바의 날개. 이 기능을 끄면 프레임이 깨지고 발이 페달을 놓치게 됩니다. - 정말 강력한 부분: JSON 경계 상자가 깨끗하게 반환되어 새 위에 착지하고, 구문 분석 체조가 없습니다. **거의** 추론 없이 작동한 원샷 빌드 — 인터페이스는 견고하게 나왔고 상자는 잘못된 위치에 렌더링되었습니다. 이는 실수로 제공한 실패 모드입니다. Datasette 코드베이스에 대해 실제 코딩 에이전트를 구동하고 프롬프트되지 않은 Python 스크립트 작성 및 테스트 - 처리량 한도: 호스트된 모델의 경우 로컬에서 74개 및 184개의 토큰에 대해 로컬로 초당 15~30개 토큰, 그리고 밀도가 높은 모델이 메모리 대역폭 제한인 이유 - 멀티 토큰 예측, 이미 파일 내부에 있으며 하나의 서빙 플래그로 약 **72% 더 빠르게** 측정됨 유지 가치가 있는 규칙: **추론 노력은 작업별로 설정하는 예산이지 혼자 남겨두는 설정이 아닙니다.** 추출, 분류 및 경계 상자에 대해 낮게 실행하거나 해제하여 답변에 하나의 올바른 모양이 있고 생각으로는 아무 것도 얻지 못합니다. 일회성 빌드에 투자하고 잘못된 부분을 발견하는 데 비용이 많이 듭니다. 한 가지 주의할 점은 이 채널이 아닌 Willison에서 나온 것입니다. Qwen이 게시한 벤치마크는 자체 보고되었습니다. 아직 독립된 숫자가 존재하지 않습니다. ### 장 ``text 0:00 한 그림에 21분이 소요됩니다 0:36 기본 비용과 문제점 1:06 문서화된 세 가지 수준, 하나는 배송됨 1:43 컨텍스트 창을 먹었습니다 2:13 원을 요청하여 연구를 얻었습니다 2:48 추론: 21분이 2가 됩니다 3:21 끄는 데 드는 비용 3:51 매우 좋은 경우: 비전 4:23 프롬프트 하나, 작업 도구 4:52 그리고 그것 없이 동일한 도구가 고장났습니다 5:18 실제 코딩 에이전트 구동 5:49 실제 제약은 속도입니다 6:22 여기서 밀집 모델이 느린 이유 6:50 서빙 플래그의 72% 7:21 벤치마크는 자체 보고됩니다 7:50 작업별로 설정 8:19 누가 실행해야 하는지 8:46 올해 실제로 변경된 사항 ``` ### 주요 소스 - Simon Willison — Qwen 3.8 27B는 훌륭하지만 기본값은 지나치게 지나치게 생각하는 것입니다: https://simonwillison.net/2026/Aug/16/qwen-38-27b/ - Qwen3.8-27B 모델 카드(공급업체): https://huggingface.co/Qwen/Qwen3.8-27B 이 비디오의 모든 그림은 이 두 페이지에서 나온 것입니다. 이 채널에서는 아무것도 벤치마킹하지 않았으며 설명에 그렇게 나와 있습니다.