<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>Tensor Parallelism - 태그 - lee's blog</title><link>https://ken-0913.github.io/myblog/tags/tensor-parallelism/</link><description>Tensor Parallelism - 태그 - lee's blog</description><generator>Hugo -- gohugo.io</generator><language>ko-kr</language><managingEditor>hyeonjae0913@gmail.com (ken-0913)</managingEditor><webMaster>hyeonjae0913@gmail.com (ken-0913)</webMaster><lastBuildDate>Mon, 24 Aug 2026 18:00:00 +0900</lastBuildDate><atom:link href="https://ken-0913.github.io/myblog/tags/tensor-parallelism/" rel="self" type="application/rss+xml"/><item><title>LLM 스터디 4주차 - TP/DP 멀티 GPU 서빙 실습 매뉴얼 — Runpod A100 4-GPU</title><link>https://ken-0913.github.io/myblog/posts/llm/llm-tp-dp-serving-lab/</link><pubDate>Mon, 24 Aug 2026 18:00:00 +0900</pubDate><author><name>ken-0913</name></author><guid>https://ken-0913.github.io/myblog/posts/llm/llm-tp-dp-serving-lab/</guid><description><![CDATA[<div class="featured-image">
                <img src="images/banners/llm-tp-dp-serving-lab-6a17448d.png" referrerpolicy="no-referrer">
            </div><p>단일 노드에 GPU 4개가 달린 환경(NVLink or PCIe)에서 <strong>TP=4</strong>, <strong>TP=2 × DP=2</strong>, <strong>DP=4</strong> 세 가지 구성으로 vLLM 서빙을 띄우고 속도를 비교하는 실습 순서를 정리한다. 원래는 TP=8까지 포함할 계획이었지만 Runpod 인벤토리 제약으로 현재 4-GPU가 상한이라 같은 4장 안에서 TP와 DP 비중만 조절하는 방식으로 실험을 재구성했다.</p>
<p><img class="tw:inline" loading="lazy" src='/myblog/posts/llm/llm-tp-dp-serving-lab/tp-vs-dp-overview.svg'   alt="GPU 4장을 나누는 세 가지 방법 — TP=4, TP=2×DP=2, DP=4 비교"  ></p>
<p>TP 비중이 높을수록(왼쪽) GPU끼리 주고받는 통신라인이 많아지고, DP 비중이 높을수록(오른쪽) 통신라인이 줄어들며 완전히 독립된 복제본으로 바뀐다.</p>]]></description></item></channel></rss>