<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>Qwen3 - 태그 - lee's blog</title><link>https://ken-0913.github.io/myblog/tags/qwen3/</link><description>Qwen3 - 태그 - lee's blog</description><generator>Hugo -- gohugo.io</generator><language>ko-kr</language><managingEditor>hyeonjae0913@gmail.com (ken-0913)</managingEditor><webMaster>hyeonjae0913@gmail.com (ken-0913)</webMaster><lastBuildDate>Sat, 05 Sep 2026 13:00:00 +0900</lastBuildDate><atom:link href="https://ken-0913.github.io/myblog/tags/qwen3/" rel="self" type="application/rss+xml"/><item><title>LLM 스터디 5주차 - Terraform으로 AWS EKS에 vLLM Production Stack 배포하기 — Qwen3-8B와 LMCache CPU 오프로딩까지</title><link>https://ken-0913.github.io/myblog/posts/llm/llm-eks-cluster-exercise/</link><pubDate>Sat, 05 Sep 2026 13:00:00 +0900</pubDate><author><name>ken-0913</name></author><guid>https://ken-0913.github.io/myblog/posts/llm/llm-eks-cluster-exercise/</guid><description><![CDATA[<div class="featured-image">
                <img src="images/banners/llm-eks-cluster-exercise-bc591db1.png" referrerpolicy="no-referrer">
            </div><p><code>vllm-project/production-stack</code> 레포의 <a href="https://github.com/vllm-project/production-stack/tree/main/tutorials/terraform/eks" target="_blank" rel="noopener noreferrer"><code>tutorials/terraform/eks</code></a> 튜토리얼을 따라가며 AWS EKS에 Managed Kubernetes + GPU 노드그룹 + vLLM Production Stack을 Terraform으로 올리는 과정을 명령어 단위로 기록한다. 기본 예시는 TinyLlama-1.1B였지만, 이번엔 NVIDIA L4(g6.2xlarge)에 Qwen3-8B를 올리고, 나아가 LMCache로 KV 캐시 CPU 오프로딩까지 켜본다.</p>
<p><img class="tw:inline" loading="lazy" src='/myblog/posts/llm/llm-eks-cluster-exercise/orca-paste-1788590900221-ec29d81a-7eb4-4f91-a726-2e0fa7c8b6ef.png'    height="1908" width="2918"></p>
<h2 id="1-aws-eks-사전-점검-및-환경-구성" class="headerLink">
    <a href="#1-aws-eks-%ec%82%ac%ec%a0%84-%ec%a0%90%ea%b2%80-%eb%b0%8f-%ed%99%98%ea%b2%bd-%ea%b5%ac%ec%84%b1" class="header-mark"></a>1. AWS EKS 사전 점검 및 환경 구성</h2><p>클라우드 GPU 인프라는 리전별 쿼터, k8s 버전과 GPU 드라이버 호환성처럼 튜토리얼 문서만 봐서는 알 수 없는 제약이 많다. 그래서 <strong>인프라를 실제로 만들기 전에</strong> 같은 종류의 제약을 먼저 CLI로 확인하는 것부터 시작했다.</p>]]></description></item><item><title>LLM 스터디 5주차 - LLM 서빙 최적화 실전 — Qwen3-14B 벤치마크로 처리량 2.7배 끌어올리기</title><link>https://ken-0913.github.io/myblog/posts/llm/llm-optimization-in-practice/</link><pubDate>Fri, 28 Aug 2026 20:00:00 +0900</pubDate><author><name>ken-0913</name></author><guid>https://ken-0913.github.io/myblog/posts/llm/llm-optimization-in-practice/</guid><description><![CDATA[<div class="featured-image">
                <img src="images/banners/llm-optimization-in-practice-05d84900.png" referrerpolicy="no-referrer">
            </div><h1 id="qwen3-14b-vllm-서빙-최적화-정리" class="headerLink">
    <a href="#qwen3-14b-vllm-%ec%84%9c%eb%b9%99-%ec%b5%9c%ec%a0%81%ed%99%94-%ec%a0%95%eb%a6%ac" class="header-mark"></a>Qwen3-14B vLLM 서빙 최적화 정리</h1><h2 id="목표" class="headerLink">
    <a href="#%eb%aa%a9%ed%91%9c" class="header-mark"></a><strong>목표</strong></h2><ul>
<li>단일 GPU에서 Qwen3-14B를 vLLM으로 서빙할 때 처리량(throughput)과 지연시간(latency)을 체계적으로 측정하고 개선하는 7단계를 알아본다.</li>
</ul>
<h2 id="1단계--gpu-하드웨어-점검" class="headerLink">
    <a href="#1%eb%8b%a8%ea%b3%84--gpu-%ed%95%98%eb%93%9c%ec%9b%a8%ec%96%b4-%ec%a0%90%ea%b2%80" class="header-mark"></a>1단계 : GPU 하드웨어 점검</h2><p>먼저 <code>nvidia-smi</code>로 사전 점검을 진행한다.</p>
<ul>
<li>CUDA/드라이버 호환성</li>
<li>성능 상태(P8=유휴, P0/P1=고성능)</li>
<li>메모리 여유분(46GB 중 사용량)</li>
</ul>
<p>사용률이 낮은데 부하가 걸려 있으면 배칭 문제를, 전력은 높은데 처리량이 낮으면 메모리 병목을 의심한다. 이 기준으로 이후 벤치마크 결과의 원인을 구분한다.</p>
<br>
<p>아래와 같이 플래그를 사용하여 관심있는 항목만 출력해본다.</p>
<div class="term-code">
    <div class="term-code__bar">
        <span class="term-code__dot term-code__dot--red"></span>
        <span class="term-code__dot term-code__dot--yellow"></span>
        <span class="term-code__dot term-code__dot--green"></span>
        <span class="term-code__title">bash</span>
    </div>
    <div class="term-code__body"><div class="highlight"><pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"><code class="language-bash" data-lang="bash"><span style="display:flex;"><span>root@da1d46d42395:/# nvidia-smi --query-gpu<span style="color:#f92672">=</span>name,compute_cap,memory.free,memory.used,memory.total --format<span style="color:#f92672">=</span>csv
</span></span><span style="display:flex;"><span>name, compute_cap, memory.free <span style="color:#f92672">[</span>MiB<span style="color:#f92672">]</span>, memory.used <span style="color:#f92672">[</span>MiB<span style="color:#f92672">]</span>, memory.total <span style="color:#f92672">[</span>MiB<span style="color:#f92672">]</span>
</span></span><span style="display:flex;"><span>NVIDIA A40, 8.6, <span style="color:#ae81ff">45489</span> MiB, <span style="color:#ae81ff">0</span> MiB, <span style="color:#ae81ff">46068</span> MiB</span></span></code></pre></div></div>
</div>
<p><img class="tw:inline" loading="lazy" src='/myblog/posts/llm/llm-optimization-in-practice/orca-paste-1788532182924-f782b1ec-1f23-48d2-beda-a8bb2ff8ce13.png'    height="120" width="2190"></p>]]></description></item></channel></rss>