전체 글 79

EKS 위에 vLLM 으로 서빙하기

LLM 서빙을 위한 실습 환경 구성으로 EKS 위에서 vLLM 을 서빙하는 예제를 실습하겠습니다.본 내용은 RayServe와 vLLM을 사용한 LLM 배포참고하였습니다. AI on EKS 기반 서빙 시스템 구축 Ray Serve와 vLLM 백엔드를 사용하여 대규모 언어 모델(LLM)을 배포하는 방법을 살펴봅니다. mistralai/Mistral-7B-Instruct-v0.2 모델을 사용하여 패턴을 시연합니다. 환경 구성Terraform IaC(Infrastructure as Code) 템플릿을 사용하여 Amazon EKS 클러스터를 배포하고, RayServe YAML 구성을 사용하여 모델을 배포할 때 Karpenter를 사용하여 GPU 노드를 동적으로 스케일링합니다. 참고 사항g5.8xlarge ..

AI 2026.08.28

Essential LLM Optimization Techniques

CloudNet@ LLMSO 스터디 학습 내용을 정리합니다.학습 내용은, 책 Hands-On LLM Serving and Optimization Study 을 기반으로 진행합니다. Intro6장에서는 LLM 최적화 기술을 다룹니다.LLM serving의 핵심 최적화 4가지 기법 → GPU에 더 많은 일을 시키되, 불필요한 계산·메모리 사용·데이터 이동은 어떻게 줄일 것인가? 하드웨어 측면과 소프트웨어 측면도 중요함Batching and scheduling: GPU idle time을 줄이고 throughput을 높인다.Attention and kernel optimization: attention 계산과 memory movement를 줄인다. (KV Cache와 HBM↔SRAM 데이터 이동을 줄임)Mo..

AI 2026.08.22

Challenges When Serving LLMs

CloudNet@ LLMSO 스터디 학습 내용을 정리합니다.학습 내용은, 책 Hands-On LLM Serving and Optimization Study 을 기반으로 진행합니다. Intro5장에서는 LLM 서빙 최적화를 다룹니다.LLM 핵심 병목 3가지 (사용자 경험 병목, 비용 병목, 하드웨어 병목) LLM 영향 GPU Spec3+1 그룹 지표로 구분됩니다. 1. Compute지표의미언제 중요한지사례FLOPSGPU가 초당 수행 가능한 부동소수점 연산량Prefill처럼 긴 prompt를 한 번에 병렬 처리할 때(compute-bound 구간)A100 대비 H100은 FP16 FLOPS가 높아 긴 prompt의 prefill 속도가 더 빠름Tensor Core 성능행렬곱(matmul) 전용 가속 유..

AI 2026.08.22

Model Serving Best Practices

CloudNet@ LLMSO 스터디 학습 내용을 정리합니다.학습 내용은, 책 Hands-On LLM Serving and Optimization Study 을 기반으로 진행합니다. Intro4장에서는 모델 서빙 모범 사례를 다룹니다. 실제 프로덕션 LLM 애플리케이션 서빙 시스템을 다룰 예정입니다. 에이전트 모델 서빙에이전트는 목표만 주어지면, 그걸 달성할 방법을 스스로 판단하고, 필요한 도구를 스스로 선택해서 실행하며, 결과를 보고 스스로 다음 행동을 조정하는 자율적인 LLM 기반 시스템입니다. 대표적인 특징은 다음과 같습니다.모델이 제어 루프(control loop) 안에서 반복 호출됨하나의 최종 답변을 위해 정보 검색 → 중간 추론 → 도구 실행 → 출력 다듬기 과정을 여러 번 거침 구조적 복잡..

AI 2026.08.16

Model Serving System Design: A Deep Dive

CloudNet@ LLMSO 스터디 학습 내용을 정리합니다.학습 내용은, 책 Hands-On LLM Serving and Optimization Study 을 기반으로 진행합니다. Intro이번 3장에서는 모델 서빙 시스템을 직접 만들어보면서 원리를 파악하겠습니다.Single-model serving : 하나의 서비스가 하나의 모델 실행Multi-model serving : 하나의 서비스가 여러 모델을 필요할 때 로드하고 공유 자원에서 실행💡 모델 서빙은 단순히 모델의 함수를 호출하는 역할만 하는 것이 아니라, API 처리·요청 추적·배치·스트리밍·프로세스 격리·메모리 관리·라우팅·확장·장애 복구를 함께 설계하는 시스템 엔지니어링입니다. Single-model serving system Arch..

AI 2026.08.16

LLM 모델 서빙

CloudNet@ LLMSO(=Hands-On LLM Serving and Optimization Study) 스터디 학습 내용을 정리합니다. Model Serving 실습모델 서빙과 최적화를 위해 모델 동작과 환경 설정을 확인하겠습니다.이번 장에서 사용할 모델은 Qwen 2.5 입니다. 실습 1. Transformer 구성 확인실습 환경 → 구글 Colab 에서 진행https://github.com/orca3/llm-model-inference/blob/main/ch02/ch2_Batching.ipynb 모델 Config 확인from transformers import AutoModelForCausalLMfrom pprint import pprintmodel_name = "Qwen/Qwen2.5-..

AI 2026.08.09

LLM 기초 이해 - Transformer

CloudNet@ LLMSO(=Hands-On LLM Serving and Optimization Study) 스터디 학습 내용을 정리합니다. GPU 동작 원리출처 : [bRd 3D] GPU는 어떻게 작동할까? - Youtube CPU vs GPU 차이점CPU : 고성능 프로세서 몇 개로 구성되어 있으며, 복잡하고 순차적인 연산을 빠르게 처리하는 데 특화GPU : 상대적으로 성능이 낮지만 수천 개 이상의 수많은 코어를 탑재하여, 단순하지만 대량의 데이터를 동시에 병렬 처리하는 데 특화 GPU 사용처와 원리주로 그래픽 연산에 사용 : 모니터가 각 픽셀로 구성되어 있으며 프레임 단위로 계산이 필요 → 모든 과정이 독립적이고 대량으로 이루어지기 때문에 행렬 곱셈 형태의 병렬 연산에 활용SIMT (Singl..

AI 2026.08.09

[GitAIOps로 인프라 구성하기] 9. AI 에게 저장소 분석 시키기

앞으로 4주간 온라인 모각코를 통해 스터디한 내용을 업로드할 예정입니다.모각코란 모여서 각자 코딩의 준말로, CloudNet@ 가시다님과 함께 책 하나를 돌파하는 스터디입니다.이번 모각코는 책, AI 시대에 개발자가 알아야 할 인프라 구성 배포 with 클로드 코드 를 기반으로 진행합니다. 정리앞선 8장의 내용을 AI에게 분석시키고,쌓인 것들을 돌아보겠습니다. 깃 저장소 분석9장으로 넘어가자 지금까지 구성한 notiflex-platform 저장소 분석해줘 해당 질의 또한 저자의 지침을 통해 구성됩니다.# 9.1 AI에게 레포 분석 시키기## 실행 지침### 단계 1: 저장소 구조 분석notiflex-platform 저장소의 전체 구조를 분석한다:- 디렉터리 트리- 파일 개수- 코드 라인 수 (언어별..

AI 2026.07.27

[GitAIOps로 인프라 구성하기] 8. 고도화

앞으로 4주간 온라인 모각코를 통해 스터디한 내용을 업로드할 예정입니다.모각코란 모여서 각자 코딩의 준말로, CloudNet@ 가시다님과 함께 책 하나를 돌파하는 스터디입니다.이번 모각코는 책, AI 시대에 개발자가 알아야 할 인프라 구성 배포 with 클로드 코드 를 기반으로 진행합니다. 고도화요청이 급증하면서 문제 생겼습니다.응답이 느려지고, 타임아웃이 발생합니다. 또한, 장애가 생겼을 떄 어디서 막혔는지 어렵습니다. 그리고 일일 통계 집계나 미발송 알림 재처리를 매번 사람이 직접 실행해야 합니다.이에 카프라를 도입하여 비동기 메세지 처리를 도입하고, 템포로 분산 트레이싱을 추가하고, 크론잡을 통해 주기적으로 작업을 자동화 할 예정입니다. 카프카 구성클라이언트가 POST 요청을 보내면 API가 알..

AI 2026.07.27

[GitAIOps로 인프라 구성하기] 7.규모 확장

앞으로 4주간 온라인 모각코를 통해 스터디한 내용을 업로드할 예정입니다.모각코란 모여서 각자 코딩의 준말로, CloudNet@ 가시다님과 함께 책 하나를 돌파하는 스터디입니다.이번 모각코는 책, AI 시대에 개발자가 알아야 할 인프라 구성 배포 with 클로드 코드 를 기반으로 진행합니다. SMB 구조의 한계지금까지 구성한 환경을 확인하면 노드 2개에 모든 워크로드가 배포되어 있습니다.이러한 구조에서는 2가지 문제가 있습니다. 리소스 경합 : 하나의 워크로드에 대한 리소스 사용률 증가가 다른 워크로드에 영향을 줄 수 있습니다.격리 불가 : 애플리케이션 레벨에서 데이터가 다른 고객과 섞이면 안되는 경우 이에 대해 순차적으로 워크로드별로 규모를 확장합니다.멀티 노드 풀로 워크로드별 노드를 분리하고, Ap..

AI 2026.07.27