지원 자격
- 지원자격은 상세내역 참고
- 해외여행 및 건강상 결격사유가 없는 자
- 남성의 경우 병역필 또는 면제자
지원 방법
- 지원 방법 : LG Careers (careers.lg.com)을 통한 온라인 접수만 가능 (E-Mail 및 우편/방문접수 불가)
- 관련 문의 : LG Careers (careers.lg.com) 내 '채용문의' - '1:1질문하기'를 이용해주시기 바랍니다.
- 제출 기한 : 2026년 8월 2일(일) 23:00 까지
- 마감 시간 전 작성완료 후 제출하여야 정상적으로 지원이 됩니다.
기타 안내
- 국가보훈대상자 및 장애우는 관계법령에 의거 우대합니다. (면접 시 증빙제출)
- 입사지원서는 모든 사항을 정확히 입력해야 하며, 추후 입력사항이 허위로 판명될 경우 입사(합격)가 취소됩니다.
MLOps Engineer
MLOps개발팀은 AI 모델 개발 전 과정을 하나의 자동화된 흐름으로 연결하여, 더 빠르고 안정적으로 모델을 개발·배포·운영할 수 있는 플랫폼을 구축하고 있습니다.
데이터 수집과 관리, ML/LLM 학습 파이프라인, 모델 레지스트리, 배포 표준화, Observability, LLMOps 컴포넌트까지 AI 개발 생애주기 전반을 플랫폼화하며, 이를 기반으로 B2B 상품화가 가능한 MLOps/LLMOps 플랫폼으로 발전시키는 것을 목표로 합니다.
■ 우리팀에서 하고 있는 일(주요 R&R)
1. ML/LLM 파이프라인 구축 및 운영
- 학습, 평가, 릴리즈, 배포로 이어지는 ML/LLM 개발 파이프라인 설계 및 구현
- CI/CD 기반 모델 학습 및 배포 자동화 체계 구축
- 대규모 분산 학습 및 하이퍼파라미터 실험 환경 구성
- 실험 추적, 아티팩트 관리, 모델 재현성 확보를 위한 운영 체계 구축
2. 모델 서빙 및 배포 표준화
- 클라우드 및 온프레미스 환경을 고려한 모델 배포 표준 아키텍처 설계
- 실시간 엔드포인트 및 배치 Job 기반 모델 서빙 환경 구축
- Blue/Green, Canary 배포 및 자동 롤백 전략 적용
- 다양한 모델 유형을 안정적으로 배포하기 위한 템플릿 및 운영 자동화 구성
3. Model Registry 및 모델 거버넌스 운영
- 모델 중앙 등록, 버전 관리, 메타데이터 관리 체계 구축
- Staging에서 Production으로 이어지는 모델 승인 및 릴리즈 워크플로우 자동화
- 모델 변경 및 배포 이력 추적 체계 구현
4. Observability 및 플랫폼 운영 고도화
- 로그, 메트릭, 트레이스 기반 통합 모니터링 환경 구축
- GPU 리소스 사용량, 학습 Job 상태, 파이프라인 병목 구간 가시화
- SLA 기반 알림 및 이상 징후 조기 탐지 체계 구축
- 모델 학습 및 서빙 환경의 성능, 비용, 안정성 개선
5. LLMOps 컴포넌트 구축
- 프롬프트, 체인, 템플릿 버전 관리 체계 설계 및 구현
- 사용자 피드백 및 로그 기반 재학습 파이프라인 연계
- LLM 서비스 운영을 위한 평가, 추적, 개선 자동화 체계 구축
6. 데이터 및 플랫폼 연계
- 외부/내부 데이터 수집 파이프라인 자동화 연계
- 데이터셋 버전 관리, 검색 API, 품질 검증 체계와 ML 파이프라인 연동
■ 수행업무
- AWS 기반 MLOps/LLMOps 플랫폼 인프라 환경 구축 및 운영
- ML/LLM 학습·평가·배포 파이프라인 구축 및 운영
- 모델 서빙 및 배포 표준화 체계 구축
- Model Registry 및 모델 릴리즈 라이프사이클 관리
- Observability 기반 플랫폼 운영 고도화
- LLMOps 컴포넌트 구축 및 평가 자동화 체계 연계
- 데이터셋 관리 및 ML/LLM 파이프라인 연계
■ 업무경험
- AWS 기반 인프라 설계·운영 경험, Terraform 기반 IaC 구성 및 CI/CD와 연계한 인프라 배포 경험
- Kubernetes 기반 워크로드 운영, CI/CD 파이프라인 구축, Python 자동화/백엔드 개발, ML 학습·배포 파이프라인 구축 경험
- Docker, Kubernetes, Helm 기반 배포 경험, REST API 또는 모델 서빙 환경 구축 경험
- MLflow 등 모델 레지스트리 도구 활용, 모델 버전/아티팩트 관리, 배포 승인 프로세스 설계 경험
- Prometheus, Grafana, Datadog, OpenTelemetry 활용, Kubernetes 모니터링, 장애 대응 경험
- 프롬프트 관리, 모델 평가, LangChain/LangGraph 등 활용 경험
- 데이터 파이프라인 구축, Airflow 등 워크플로우 도구 활용, 데이터 버전/메타데이터 관리 경험
■ 필요역량
-플랫폼 실행 환경에 필요한 네트워크, 컴퓨팅, 스토리지, 권한, 컨테이너 인프라를 설계·구축하고, Terraform을 활용해 환경별 인프라를 재현 가능하게 관리할 수 있는 역량
- 모델 학습, 평가, 릴리즈, 배포 과정을 하나의 자동화된 흐름으로 설계하고 운영할 수 있는 플랫폼 엔지니어링 역량
- 실시간 엔드포인트, 배치 Job, API 기반 서빙 구조를 설계하고 배포 자동화와 운영 안정성을 함께 고려하는 역량
- 모델 메타데이터, 성능 지표, 배포 상태, 이력을 체계적으로 관리하고 Staging→Production 릴리즈 흐름을 자동화하는 역량
- 시스템 성능, 리소스 사용량, 비용, 장애 징후를 통합 분석하고 운영 지표 기반으로 개선 포인트를 도출하는 역량
- LLM 서비스 특성을 이해하고 평가, 피드백, 버전 관리, 개선 자동화를 플랫폼 기능으로 설계하는 역량
- 데이터셋 버전, 품질 검증 결과, 학습 이력을 모델 파이프라인과 연결하고 데이터 신뢰성과 재현성을 고려하는 역량