
LLM Inference Engineer
LG AI Research1 month ago
Seoul, Korea, SouthSenior
Responsibilities
- LLM 추론 성능을 극대화하기 위한 개선 방안을 도출하고 설계에 참여합니다.
- 다양한 프레임워크에서 EXAONE 모델을 안정적으로 서빙하는 엔진을 개발합니다.
- vLLM, SGLang, Ollama 등 오픈소스 LLM 서빙 프레임워크의 기능 개선, 버그 수정, 성능 최적화에 기여합니다.
- chat_template을 활용해 다양한 언어와 환경에서 LLM이 올바르게 동작하도록 적용하고 개선합니다.
- NPU/GPU 기반 서빙 전략을 설계하고 모델 추론 가속화 알고리즘을 연구·구현합니다.
Requirements
- 모델 추론 가속화 알고리즘을 연구하고 구현한 경험이 필요합니다.
- Inference Backend 구현 및 모델 추론 성능 개선 경험이 필요합니다.
- NPU/GPU 기반 모델 서빙 전략을 설계하고 개발한 경험이 필요합니다.
- vLLM, SGLang, Ollama 등 오픈소스 LLM 서빙 프레임워크에 기여한 경험이 필요합니다.
- Python, C++, TensorFlow, PyTorch, ONNX, CUDA, NPU 등 AI·머신러닝 기술 숙련도가 우대됩니다.
- 머신러닝 모델 수명 주기와 Transformer 기반 모델 및 LLM의 구조·동작 원리에 대한 이해가 우대됩니다.
- Greedy Search, Beam Search, Top-k Sampling 등 LLM 디코딩 전략과 추론 기술 이해가 우대됩니다.
- chat_template을 설계하고 적용한 경험이 우대됩니다.