<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>HBM - 태그 - lee's blog</title><link>https://ken-0913.github.io/myblog/tags/hbm/</link><description>HBM - 태그 - lee's blog</description><generator>Hugo -- gohugo.io</generator><language>ko-kr</language><managingEditor>hyeonjae0913@gmail.com (ken-0913)</managingEditor><webMaster>hyeonjae0913@gmail.com (ken-0913)</webMaster><lastBuildDate>Thu, 20 Aug 2026 21:00:00 +0900</lastBuildDate><atom:link href="https://ken-0913.github.io/myblog/tags/hbm/" rel="self" type="application/rss+xml"/><item><title>LLM 스터디 3주차 - LLM 서빙의 병목은 어디에 있는가 — GPU 사양부터 연산 강도까지</title><link>https://ken-0913.github.io/myblog/posts/llm/llm-challenges-when-serving-llm/</link><pubDate>Thu, 20 Aug 2026 21:00:00 +0900</pubDate><author><name>ken-0913</name></author><guid>https://ken-0913.github.io/myblog/posts/llm/llm-challenges-when-serving-llm/</guid><description><![CDATA[<div class="featured-image">
                <img src="images/banners/llm-challenges-when-serving-llm-a628df64.png" referrerpolicy="no-referrer">
            </div><h1 id="llm-서비스-최적화가-중요한-이유" class="headerLink">
    <a href="#llm-%ec%84%9c%eb%b9%84%ec%8a%a4-%ec%b5%9c%ec%a0%81%ed%99%94%ea%b0%80-%ec%a4%91%ec%9a%94%ed%95%9c-%ec%9d%b4%ec%9c%a0" class="header-mark"></a>LLM 서비스 최적화가 중요한 이유</h1><p>앞선 장들이 모델을 <strong>동작하게</strong> 만드는 이야기였다면 이번 챕터는 LLM을 <strong>빠르고 효율적으로 돌아가게</strong> 하기 위한 내용이다.</p>
<h2 id="고객-경험" class="headerLink">
    <a href="#%ea%b3%a0%ea%b0%9d-%ea%b2%bd%ed%97%98" class="header-mark"></a>고객 경험</h2><p>응답 지연은 만족도와 직결된다. 질문을 던지고 <strong>첫 토큰까지 20초를 기다린다면</strong> 대부분 이탈한다. 같은 하드웨어에서 그 20초를 1초로 줄이면 제품의 성공 확률을 높힐수 있다. 다만 <strong>빠를수록 무조건 좋은 것은 아니다.</strong></p>
<p><img class="tw:inline" loading="lazy" src='/myblog/posts/llm/llm-challenges-when-serving-llm/latency-vs-satisfaction.svg'   alt="지연과 고객 만족도 — 낮은 구간에서는 곡선이 평평해진다"  ></p>
<p>0.1초를 0.01초로 줄여봐야 사람은 그 차이를 느끼지 못한다. 곡선이 평평해지는 구간에서는 <strong>지연을 조금 내주고 처리량을 얻는 편이 낫다.</strong> 0.01초를 0.1초로 되돌리는 대신 동시 처리량을 올리면 비용 효율이 좋아진다.</p>]]></description></item></channel></rss>