<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>Flow Control - 태그 - lee's blog</title><link>https://ken-0913.github.io/myblog/tags/flow-control/</link><description>Flow Control - 태그 - lee's blog</description><generator>Hugo -- gohugo.io</generator><language>ko-kr</language><managingEditor>hyeonjae0913@gmail.com (ken-0913)</managingEditor><webMaster>hyeonjae0913@gmail.com (ken-0913)</webMaster><lastBuildDate>Fri, 18 Sep 2026 00:30:00 +0900</lastBuildDate><atom:link href="https://ken-0913.github.io/myblog/tags/flow-control/" rel="self" type="application/rss+xml"/><item><title>LLM 스터디 7주차 - llm-d Flow Control 실측 — TTFT는 사라지지 않고 옮겨간다</title><link>https://ken-0913.github.io/myblog/posts/llm/llm-d-flow-control-lab/</link><pubDate>Fri, 18 Sep 2026 00:30:00 +0900</pubDate><author><name>ken-0913</name></author><guid>https://ken-0913.github.io/myblog/posts/llm/llm-d-flow-control-lab/</guid><description><![CDATA[<div class="featured-image">
                <img src="images/banners/llm-d-flow-control-lab-52da0947.png" referrerpolicy="no-referrer">
            </div><p><a href="../llm-d-architecture/" rel="">개념편</a>에서 EPP의 파이프라인을 정리하며 Flow Control을 문서 수준으로만 다뤘다. 이번에는 실제로 켜고 부하를 넣어 <strong>큐가 어디에 쌓이는지</strong> 를 눈으로 확인했다.</p>
<p>GPU는 RTX 3050 6GB 한 장, vLLM replica는 1개다. <strong>작은 GPU가 오히려 유리하다.</strong> Flow Control의 동작은 전부 &ldquo;풀이 포화됐을 때&rdquo; 나타나는데, GPU가 작을수록 포화를 만들기 쉽다.</p>
<p>가장 중요한 결과부터 적는다. <strong>Flow Control을 켜도 총 대기시간은 줄지 않는다. 기다리는 장소가 GPU에서 게이트웨이로 옮겨갈 뿐이다.</strong> 공식 문서도 같은 말을 한다 — <em>&ldquo;controlling where and for whom TTFT is accrued&rdquo;</em>.</p>]]></description></item></channel></rss>