Qwen 3.8 27B 로컬 실행, reasoning effort를 low로 시작해야 하는 이유
Qwen 3.8 27B는 추론 강도가 가장 높은 xhigh를 기본으로 사용합니다.
같은 그림 요청이 xhigh에서는 21분, 무추론에서는 약 137초 걸린 제3자 실측이 나왔습니다.
개발자는 추론 강도를 로우로 낮춘 뒤 간단한 작업부터 돌려 보세요.
로컬 AI 모델을 고를 때는 보통 크기와 성능부터 봅니다. 막상 설치한 뒤 체감 속도를 좌우하는 것은 다른 곳에 있을 수 있습니다. 모델이 답을 내기 전 얼마나 오래 생각하게 둘지 정하는 추론 강도 설정입니다.
Qwen 3.8 27B가 그런 사례입니다. Simon Willison이 공개한 테스트에 따르면 이 모델은 reasoning effort, 즉 답변 전에 생각하는 강도를 xhigh로 두는 것이 기본입니다. 선택지는 medium과 low도 있지만 설정을 바꾸지 않으면 가장 깊은 추론으로 시작합니다. 복잡한 문제에는 도움이 될 수 있어도 가벼운 작업까지 같은 수준으로 처리하면 대기 시간이 크게 늘어납니다.
최고 설정이 항상 실용적인 것은 아니다
Willison은 같은 그림 생성 요청을 두 가지 설정으로 실행했습니다. xhigh에서는 21분이 걸렸고, 추론을 끈 경우에는 약 137초가 걸렸습니다. 결과물의 세부 품질에는 차이가 있었지만 단순한 요청에 스무 분 넘게 기다리는 흐름이 일반적인 기본값으로 적절한지는 별도 판단이 필요합니다.
속도만 보고 무추론을 고정하는 것도 답은 아닙니다. 다른 바운딩 박스 도구 테스트에서는 추론을 끈 결과가 거의 작동했지만 상자의 위치가 틀렸습니다. 생각을 줄이면 빨라질 수 있으나 난도가 있는 작업에서 정확도가 함께 떨어질 가능성을 보여 줍니다. 이 대목 때문에 판정은 무조건 끄기가 아니라 낮게 시작하기입니다.
어려울 때만 추론을 올린다
일반 직장인이 오늘 설정을 바꿀 소재는 아닙니다. 로컬 모델을 직접 운영하는 개발자에게만 해당합니다. 기본값이라는 이유로 xhigh를 그대로 두면 간단한 변환이나 초안 작업까지 과한 계산을 쓸 수 있습니다. 먼저 low로 결과와 시간을 보고 부족할 때 medium이나 xhigh로 올리는 순서가 비용과 기다림을 통제하기 쉽습니다.
큐웬 삼점팔 이십칠 비는 로컬에서 로우나 무추론으로 시작할 만합니다. 개발자는 추론 강도를 로우로 낮춘 뒤 간단한 작업부터 돌려 보세요. 속도가 충분하고 결과가 맞으면 그대로 두고, 복잡한 추론이 필요한 작업에서만 한 단계씩 올리면 됩니다. 좋은 모델을 쓰는 것과 모든 요청에 최고 추론을 쓰는 일은 같은 결정이 아닙니다.
이 테스트는 한 사용자가 공개한 제3자 실측입니다. 모든 하드웨어와 작업에서 같은 시간이 나온다고 확대해서는 안 됩니다. 다만 기본 설정을 그대로 믿기 전에 쉬운 작업 하나로 속도와 결과를 함께 확인해야 한다는 기준은 남습니다.
출처
- Simon Willison’s Weblog: https://simonwillison.net/2026/Aug/16/qwen-38-27b/
이 글은 자체 리서치 파이프라인의 자료 조사를 바탕으로 작성했습니다.