🎁 Before you apply, rehearse this interview. Create your free WorkMundi account and get an Interview Training on HelpsYouSpeak — no cost, no card. I want my training →
• LLM 추론 서비스 개발 및 운영 • LLM 구조·서빙 워크로드·GPU 특성을 프로파일링해 병목을 찾고, 서비스 요구사항에 맞는 LLM 추론 시스템을 설계·구현 • 추론 성능과 GPU 자원 사용 현황을 모니터링하고, 모델·엔진 변경 전후를 비교하는 회귀 테스트로 문제 조기 발견 • Kubernetes 환경에 추론 시스템을 배포·운영하고, 트래픽 변화에 맞춰 요청과 GPU 자원을 효율적 배분 • 모델 추론 최적화 • vLLM·SGLang 등을 기반으로 추론 서버를 구현하고, 서비스 환경에 맞게 구성·튜닝 • 모델 압축, KV 캐시 최적화, 요청 스케줄링(Request Scheduling), 다중 GPU 분산 추론(Distributed Inference)을 적용해 추론 성능을 높이고 모델 품질 저하 여부 확인 • Speculative Decoding, Prefill/Decode Disaggregation, Expert Parallelism 등 새로운 기법을 검토하고, 워크로드에 효과적인 기법을 구현·검증