퓨리오사AI · 채용 중 49건
Algorithm - Serving System Engineer
Algorithm - Serving System Engineer
소프트웨어 엔지니어정규직전체 · 3년 이상
퓨리오사AI에서 NPU 기반 차세대 serving system을 연구하고 구현할 엔지니어를 찾습니다. LLM inference 원리에 대한 이해와 CUDA 또는 Triton을 활용한 가속기 프로그래밍 경험이 필수입니다. vLLM 등 추론 시스템 경험자를 우대하며, 실기기 검증을 통해 기술적 난제를 해결합니다. 불확실한 환경에서 새로운 가속 기법을 개척하고 제품화의 기반을 다지는 도전적인 역할입니다.
Seoul, South Korea
Hybrid
우리 팀은 NPU 기반 inference의 roofline 자체를 개선하는 방법을 연구합니다. 6개월~2년 뒤에 제품에 적용될 수 있는 도전적인 과제를 스스로 정의하고 탐색하며, POC와 prototyping까지 검증한 뒤 제품화 단계는 SW 조직과 협업하여 완성합니다.
AI datacenter는 지금 큰 전환점에 있습니다. 수십~수백 개의 칩을 연동하는 cluster-level serving, AFD(Attention-FFN Disaggregation), heterogeneous computing system 등 기존의 틀을 넘어서는 새로운 serving system이 빠르게 등장하고 있습니다. 그리고 Agentic AI 시대에 multi-turn session이 기본이 되면서, 다양한 memory hierarchy를 활용해 KV cache reuse와 compression을 극대화하려는 방법들이 활발하게 제안되고 있습니다.
이런 아이디어들은 이론적 분석과 simulation으로 유망성을 가릴 수 있지만, 그 가치는 실기기 위에서 POC로 증명되기 전까지 확정되지 않습니다. Serving System Engineer는 바로 그 증명을 담당하는 역할입니다. 차세대 serving system 개념을 자사 NPU 위에 직접 구현하고, 자체 kernel programming stack과 low-level programming interface를 활용해 하드웨어의 성능을 끌어내며, 무엇이 되고 무엇이 안 되는지를 실기기 위에서 확인합니다.
구현은 이 역할의 출발점이지 전부가 아닙니다. 우리 팀에서 구현은 다음 연구를 낳는 과정입니다. 실기기 위에서만 보이는 병목과 제약, 최적화 과정에서 얻은 lesson은 새로운 연구 과제와 아이디어의 가장 좋은 원천이며, 우리는 구현을 담당한 사람이 그 통찰로 다음 과제를 제안하는 것을 적극 장려합니다. 가설 수립부터 실기기 증명까지의 사이클 전체를 다루되, 무게중심이 구현과 검증에 있는 포지션입니다.
이 포지션이 잘 맞는지 판단하실 수 있도록, 우리 팀의 일하는 방식을 솔직하게 적습니다.