<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>Gradio - 태그 - lee's blog</title><link>https://ken-0913.github.io/myblog/tags/gradio/</link><description>Gradio - 태그 - lee's blog</description><generator>Hugo -- gohugo.io</generator><language>ko-kr</language><managingEditor>hyeonjae0913@gmail.com (ken-0913)</managingEditor><webMaster>hyeonjae0913@gmail.com (ken-0913)</webMaster><lastBuildDate>Tue, 18 Aug 2026 20:00:00 +0900</lastBuildDate><atom:link href="https://ken-0913.github.io/myblog/tags/gradio/" rel="self" type="application/rss+xml"/><item><title>LLM 스터디 3주차 - vLLM은 왜 빠른가 — PagedAttention과 연속 배칭 직접 재현하기</title><link>https://ken-0913.github.io/myblog/posts/llm/llm-vllm-lab/</link><pubDate>Tue, 18 Aug 2026 20:00:00 +0900</pubDate><author><name>ken-0913</name></author><guid>https://ken-0913.github.io/myblog/posts/llm/llm-vllm-lab/</guid><description><![CDATA[<div class="featured-image">
                <img src="images/banners/llm-vllm-lab-1a4d0866.png" referrerpolicy="no-referrer">
            </div><p><a href="../llm-serving-single-model-lab/" rel="">2주차 실습들</a>은 서빙 시스템을 <strong>어떻게 구성하는지</strong>를 다뤘다. 이번에는 질문이 안쪽으로 향한다. <strong>vLLM은 정확히 무엇 때문에 빠른가.</strong></p>
<p>CPU만 있는 4GB VM에서 SmolLM-135M을 8단계로 굴린다. HuggingFace 베이스라인을 재고, vLLM과 비교하고, KV 캐시가 낭비되는 과정을 숫자로 본 뒤 PagedAttention이 그것을 어떻게 되돌리는지 확인한다.</p>
<p><strong>결론부터 말하면 단일 요청에서 vLLM은 1.1배밖에 빠르지 않다.</strong> 진짜 차이는 동시 사용자가 붙을 때 나온다. 이 글의 8단계는 그 격차가 어디서 오는지를 따라가는 순서다.</p>
<h2 id="1-실습-환경" class="headerLink">
    <a href="#1-%ec%8b%a4%ec%8a%b5-%ed%99%98%ea%b2%bd" class="header-mark"></a>1. 실습 환경</h2><p>GPU가 없다. vLLM의 CPU 빌드를 쓰고, 4GB 메모리 제한 때문에 엔진을 in-process로 띄운다.</p>]]></description></item></channel></rss>