전체 글 83

AWS DevOps Agent 실습 내용 정리

개요26년 6월 좋은 기회가 되어 AWS 컨테이너 소모임에서 Strands Agents 기반 EKS 최적화 개발기 를 발표했습니다. 발표 내용은 Strands Agents로 에이전트를 만들고, EKS SKill로 클러스터 수명주기부터 네트워킹, 오토스케일링, 애드온 관리까지 10개 영역, 38개 항목을 GREEN/AMBER/RED로 판정해 HTML과 PPT로 뽑아내는 구조였는데요.발표 자료 (깃허브) : https://github.com/awskrug/container-group/blob/master/deck/260529-04.pdf 그런데 얼마 전 AWS DevOps Agent가 GA되면서 aws/tools-for-devops-agent 저장소가 공개됐습니다. 여기에 EKS Operation Revi..

AI 2026.09.20

vLLM과 AWS Tranium을 활용한 LLM 추론 확장 워크숍 (2)

AWS 워크샵 - AWS Trainium/Inferentia 인스턴스를 사용하는 Amazon EKS 기반 vLLM을 활용한 엔터프라이즈 규모의 대규모 언어 모델(LLM) 배포 사례를 실습한 내용을 정리합니다. 본 실습 환경을 제공해주신 ClouNet@ 가시다님 감사합니다.스터디 링크 : https://catalog.us-east-1.prod.workshops.aws/event/dashboard/en-US/workshop/vllm/architecture Workshop Studio catalog.us-east-1.prod.workshops.aws Trainium 하드웨어의 비용 효율성과 특화된 AI 기능을 활용하는 프로덕션 환경에 적합한 LLM 서비스 인프라를 구축하게 됩니다.이 실습에서는 vLLM과 Ne..

AI 2026.09.13

vLLM과 AWS Tranium을 활용한 LLM 추론 확장 워크숍 (1)

AWS 워크샵 - AWS Trainium/Inferentia 인스턴스를 사용하는 Amazon EKS 기반 vLLM을 활용한 엔터프라이즈 규모의 대규모 언어 모델(LLM) 배포 사례를 실습한 내용을 정리합니다. 본 실습 환경을 제공해주신 ClouNet@ 가시다님 감사합니다. 스터디 링크 : https://catalog.us-east-1.prod.workshops.aws/event/dashboard/en-US/workshop/vllm/architecture Workshop Studio catalog.us-east-1.prod.workshops.aws 워크샵 소개AWS Trainium/Inferentia 인스턴스를 사용하는 Amazon EKS 기반 vLLM을 활용한 엔터프라이즈 규모의 대규모 언어 모델(LL..

AI 2026.09.13

AI On EKS LLM 최적화 대시보드 구성하기

개요지난 글에서 구성한 인프라 환경에서 GPU 와 LLM 서빙 최적화 대시보드를 구성한 내용을 공유하겠습니다.LLM 서빙 최적화 대시보드는 책 Hands-On LLM Serving and Optimization Study 5장 학습 내용을 참고하여 구성하였습니다. 최적화 그라파나 대시보드대시보드 내용은 필자의 깃허브 Repo 에서 확인이 가능합니다.https://github.com/HanHoRang31/llm-gpu-bottleneck-dashboard 환경 구성# AWS 프로필 설정cat ~/.aws/credentialsexport AWS_PROFILE=".." # 프로필 설정git clone https://github.com/awslabs/ai-on-eks.gitcd ai-on-eks/infra/..

AI 2026.09.05

EKS 위에 vLLM 으로 서빙하기

LLM 서빙을 위한 실습 환경 구성으로 EKS 위에서 vLLM 을 서빙하는 예제를 실습하겠습니다.본 내용은 RayServe와 vLLM을 사용한 LLM 배포참고하였습니다. AI on EKS 기반 서빙 시스템 구축 Ray Serve와 vLLM 백엔드를 사용하여 대규모 언어 모델(LLM)을 배포하는 방법을 살펴봅니다. mistralai/Mistral-7B-Instruct-v0.2 모델을 사용하여 패턴을 시연합니다. 환경 구성Terraform IaC(Infrastructure as Code) 템플릿을 사용하여 Amazon EKS 클러스터를 배포하고, RayServe YAML 구성을 사용하여 모델을 배포할 때 Karpenter를 사용하여 GPU 노드를 동적으로 스케일링합니다. 참고 사항g5.8xlarge ..

AI 2026.08.28

Essential LLM Optimization Techniques

CloudNet@ LLMSO 스터디 학습 내용을 정리합니다.학습 내용은, 책 Hands-On LLM Serving and Optimization Study 을 기반으로 진행합니다. Intro6장에서는 LLM 최적화 기술을 다룹니다.LLM serving의 핵심 최적화 4가지 기법 → GPU에 더 많은 일을 시키되, 불필요한 계산·메모리 사용·데이터 이동은 어떻게 줄일 것인가? 하드웨어 측면과 소프트웨어 측면도 중요함Batching and scheduling: GPU idle time을 줄이고 throughput을 높인다.Attention and kernel optimization: attention 계산과 memory movement를 줄인다. (KV Cache와 HBM↔SRAM 데이터 이동을 줄임)Mo..

AI 2026.08.22

Challenges When Serving LLMs

CloudNet@ LLMSO 스터디 학습 내용을 정리합니다.학습 내용은, 책 Hands-On LLM Serving and Optimization Study 을 기반으로 진행합니다. Intro5장에서는 LLM 서빙 최적화를 다룹니다.LLM 핵심 병목 3가지 (사용자 경험 병목, 비용 병목, 하드웨어 병목) LLM 영향 GPU Spec3+1 그룹 지표로 구분됩니다. 1. Compute지표의미언제 중요한지사례FLOPSGPU가 초당 수행 가능한 부동소수점 연산량Prefill처럼 긴 prompt를 한 번에 병렬 처리할 때(compute-bound 구간)A100 대비 H100은 FP16 FLOPS가 높아 긴 prompt의 prefill 속도가 더 빠름Tensor Core 성능행렬곱(matmul) 전용 가속 유..

AI 2026.08.22

Model Serving Best Practices

CloudNet@ LLMSO 스터디 학습 내용을 정리합니다.학습 내용은, 책 Hands-On LLM Serving and Optimization Study 을 기반으로 진행합니다. Intro4장에서는 모델 서빙 모범 사례를 다룹니다. 실제 프로덕션 LLM 애플리케이션 서빙 시스템을 다룰 예정입니다. 에이전트 모델 서빙에이전트는 목표만 주어지면, 그걸 달성할 방법을 스스로 판단하고, 필요한 도구를 스스로 선택해서 실행하며, 결과를 보고 스스로 다음 행동을 조정하는 자율적인 LLM 기반 시스템입니다. 대표적인 특징은 다음과 같습니다.모델이 제어 루프(control loop) 안에서 반복 호출됨하나의 최종 답변을 위해 정보 검색 → 중간 추론 → 도구 실행 → 출력 다듬기 과정을 여러 번 거침 구조적 복잡..

AI 2026.08.16

Model Serving System Design: A Deep Dive

CloudNet@ LLMSO 스터디 학습 내용을 정리합니다.학습 내용은, 책 Hands-On LLM Serving and Optimization Study 을 기반으로 진행합니다. Intro이번 3장에서는 모델 서빙 시스템을 직접 만들어보면서 원리를 파악하겠습니다.Single-model serving : 하나의 서비스가 하나의 모델 실행Multi-model serving : 하나의 서비스가 여러 모델을 필요할 때 로드하고 공유 자원에서 실행💡 모델 서빙은 단순히 모델의 함수를 호출하는 역할만 하는 것이 아니라, API 처리·요청 추적·배치·스트리밍·프로세스 격리·메모리 관리·라우팅·확장·장애 복구를 함께 설계하는 시스템 엔지니어링입니다. Single-model serving system Arch..

AI 2026.08.16

LLM 모델 서빙

CloudNet@ LLMSO(=Hands-On LLM Serving and Optimization Study) 스터디 학습 내용을 정리합니다. Model Serving 실습모델 서빙과 최적화를 위해 모델 동작과 환경 설정을 확인하겠습니다.이번 장에서 사용할 모델은 Qwen 2.5 입니다. 실습 1. Transformer 구성 확인실습 환경 → 구글 Colab 에서 진행https://github.com/orca3/llm-model-inference/blob/main/ch02/ch2_Batching.ipynb 모델 Config 확인from transformers import AutoModelForCausalLMfrom pprint import pprintmodel_name = "Qwen/Qwen2.5-..

AI 2026.08.09