dontech

dontech
전체 글
AllOperating SystemsData StructuresNetworkingDatabase19Linux
AllPython5FastAPI6TypeScriptNext.js
AllSystem Design1Software EngineeringDevOps5Cloud
GitHub
dontech
전체 글
AllOperating SystemsData StructuresNetworkingDatabase19Linux
AllPython5FastAPI6TypeScriptNext.js
AllSystem Design1Software EngineeringDevOps5Cloud
FastAPI

Dependency Injection 제대로 이해하기

의존성 주입(DI)의 개념과 원리를 이해하고, 실제 코드에 적용하는 방법을 알아봅니다.

DevOps

Airflow DAG Hash가 계속 바뀌는 문제: Variable.get()의 함정

Airflow DAG Hash가 30초마다 바뀌면서 Task가 실패하는 원인과, Variable.get()을 Task 실행 시점으로 옮겨 해결하는 방법을 정리합니다.

Statistics

조건부 확률과 베이즈 정리: 사전 정보를 업데이트하는 방법

조건부 확률의 정의부터 베이즈 정리까지, ML의 핵심 도구인 확률 업데이트 메커니즘을 Monty Hall 시뮬레이션과 의료 검사 예제로 완전 이해하는 가이드.

Machine Learning

XGBoost vs LightGBM: 실전 부스팅 모델, 어떤 걸 써야 할까

XGBoost의 정규화와 분할 알고리즘, LightGBM의 Leaf-wise 성장과 GOSS/EFB를 비교한다. CatBoost까지 포함한 실전 선택 기준.

Troubleshooting

Prisma P3006 에러 해결: PostgreSQL enum의 트랜잭션 제약과 Shadow DB 문제

prisma migrate dev의 P3006 에러 원인과, Shadow DB를 우회하는 수동 마이그레이션 해결법을 정리합니다.

Dependency Injection 제대로 이해하기
Airflow DAG Hash가 계속 바뀌는 문제: Variable.get()의 함정
조건부 확률과 베이즈 정리: 사전 정보를 업데이트하는 방법
XGBoost vs LightGBM: 실전 부스팅 모델, 어떤 걸 써야 할까
Prisma P3006 에러 해결: PostgreSQL enum의 트랜잭션 제약과 Shadow DB 문제
Quiz15문항읽고 넘긴 내용을 원리 단위로 다시 꺼내봅니다풀어보기 →
LLM2026.07.26.

LLM 서빙 성능 지표와 튜닝

TTFT, TPOT, ITL과 지연 목표(SLO)를 정의하고 대역폭과 KV 용량이라는 두 하드웨어 천장을 계산한 뒤, vllm bench로 측정한 지표를 근거로 서빙 인자를 조정하는 방법을 정리합니다.

LLM Serving
LLM 서빙 성능 지표와 튜닝
Issue2026.07.25.

Claude Opus 5 출시, 가격 그대로 성능은 Fable 5급?

2026년 7월 24일 출시된 Claude Opus 5의 벤치마크, 가격, Opus 4.8과 Fable 5 비교, 안전 분류기 변화와 커뮤니티 반응을 정리합니다.

Claude Opus 5 출시, 가격 그대로 성능은 Fable 5급?
LLM2026.07.23.

vLLM 실전 서빙 가이드

vLLM V1 엔진의 프로세스 구조부터 gpu_memory_utilization, max_model_len, CUDA graph, Structured Output, Tensor Parallelism까지 서빙 핵심 인자를 엔진 동작 원리로부터 설명합니다.

LLM Serving
vLLM 실전 서빙 가이드
LLM2026.07.21.

Speculative Decoding으로 LLM 추론 속도 높이기

작은 모델이 미리 그려놓은 토큰들을 큰 모델이 forward 한 번으로 검증하는 speculative decoding의 원리를 살펴봅니다. rejection sampling이 품질을 지키는 수학, draft를 구하는 네 가지 방법(draft 모델, n-gram, EAGLE, MTP), 배치 크기에 따라 이득이 달라지는 이유를 vLLM 설정 방법과 함께 정리합니다.

LLM Serving
Speculative Decoding으로 LLM 추론 속도 높이기
LLM2026.07.18.

서빙을 위한 양자화 가이드 FP8, AWQ, GPTQ

양자화가 서빙 성능을 올리는 경로를 메모리, 대역폭, 연산 정밀도 셋으로 나눠서 세우고, GPTQ와 AWQ, FP8이 각각 어느 경로에 효과가 있는지 원리부터 살펴봅니다. 배치 크기와 GPU 세대에 따라 무엇을 골라야 하는지, KV Cache 양자화와 QAT까지 정리합니다.

LLM Serving
서빙을 위한 양자화 가이드 FP8, AWQ, GPTQ
LLM2026.07.14.

Prefix Caching과 RadixAttention으로 보는 vLLM과 SGLang

끝난 요청의 KV Cache를 다음 요청이 재사용하는 prefix caching의 원리를 vLLM의 블록 해시 체인으로 파헤치고, SGLang의 RadixAttention과 비교합니다. 두 엔진이 사실상 같은 구조에 도달했다는 점과, 진짜 차이는 자료구조가 아니라 스케줄링에 있다는 점을 정리합니다.

LLM Serving
Prefix Caching과 RadixAttention으로 보는 vLLM과 SGLang
LLM2026.07.11.

Continuous Batching과 Chunked Prefill 완전 이해

static batching이 GPU를 놀리는 이유부터, vLLM V1이 continuous batching과 chunked prefill을 하나의 토큰 예산 스케줄러로 묶어 처리량과 응답 지연을 함께 잡는 원리를 정리합니다.

LLM Serving
Continuous Batching과 Chunked Prefill 완전 이해
LLM2026.07.09.

vLLM의 핵심 원리 PagedAttention 파헤치기

vLLM 이전의 서빙 시스템이 KV Cache 메모리의 60~80%를 낭비하던 이유와, PagedAttention이 운영체제의 페이징을 빌려 그 낭비를 4% 밑으로 줄인 원리를 파헤칩니다.

LLM Serving
vLLM의 핵심 원리 PagedAttention 파헤치기
LLM2026.07.07.

KV Cache가 LLM 서빙을 바꾸는 방식

KV Cache가 왜 필요하고 어떻게 동작하는지, 그리고 이것이 LLM 서빙을 매 요청이 상태를 들고 다니는 문제로 바꿔놓는 과정을 정리합니다.

LLM Serving
KV Cache가 LLM 서빙을 바꾸는 방식
LLM2026.07.06.

Prefill과 Decode로 이해하는 LLM 추론 과정

LLM이 토큰을 하나씩 생성하는 추론 과정을 Prefill과 Decode 두 단계로 나눠 살펴봅니다. compute-bound와 memory-bound의 비대칭이 왜 모든 서빙 최적화의 출발점이 되는지 정리합니다.

LLM Serving
Prefill과 Decode로 이해하는 LLM 추론 과정
...
Thank You for Visiting My Blog, Have a Good Day 😆