π μ°λ¦¬ νμ μκ°ν©λλ€.
XPU Enabler νμ NetsPressoμ μ€Β·μ₯κΈ° κΈ°μ κ²½μλ ₯μ ν보νκΈ° μν μ ν μ°κ΅¬(Advanced Research)λ₯Ό μνν©λλ€.
νΉν Edge AI νκ²½μμ μ΅μ AI λͺ¨λΈμ μ€μ λλ°μ΄μ€μμ μμ μ μΌλ‘ ꡬλνκΈ° μν λͺ¨λΈ ꡬ쑰 λΆμ, μ΅μ ν μ λ΅ μ립, HW μ ν©μ± κ²μ¦μ μ£Όμ λ―Έμ
μΌλ‘ μΌκ³ μμ΅λλ€.
κ΅κ° μ£Όλμ AI κΈ°μ κ³ λν νλ‘μ νΈ(K-AI νλ‘μ νΈ, μ λΆ R&D κ³Όμ λ±)μ μ°Έμ¬νμ¬ Edge AI λ° On-device AI λΆμΌμ κΈ°μ νμ€κ³Ό λ°©ν₯μ±μ ν¨κ» λ§λ€μ΄κ°κ³ μμ΅λλ€.
π ν΄λΉ ν¬μ§μ
μΌλ‘ ν©λ₯νμ λ€λ©΄
λΉμ¬λ λ
μ AI Foundation Model κ΅¬μΆ μ¬μ
μ μ
μ€ν
μ΄μ§ 컨μμμ μ°Έμ¬μ¬λ‘μ, 컨μμμμ ν΅ν΄ κ°λ°λλ λκ·λͺ¨ μΈμ΄ λͺ¨λΈ(LLM) λ° λΉμ -μΈμ΄ λͺ¨λΈ(VLM)μ κ²½λνμ μΆλ‘ μ΅μ νλ₯Ό λ΄λΉνκ³ μμ΅λλ€.
λ³Έ ν¬μ§μ
μ Foundation Model μ체μ μ¬μ νμ΅μ μ£Όλνλ μν μ΄ μλλΌ, κ°λ°λ LLM/VLMμ μ€μ νλμ¨μ΄ νκ²½μμ ν¨μ¨μ μΌλ‘ ꡬλν μ μλλ‘ λͺ¨λΈμ μ΅μ ννλ μν μ
λλ€.
λͺ¨λΈμ μ νλλ₯Ό μ΅λν μ μ§νλ©΄μ μμν, ν루λ λ° μΆλ‘ μ΅μ ν κΈ°μ μ μ μ©νκ³ , NVIDIA GPUλ₯Ό λΉλ‘―ν κ΅λ΄μΈ λ€μν NPUμ AI κ°μκΈ°μ λͺ¨λΈμ νμ¬νκΈ° μν μ°κ΅¬ λ° μννΈμ¨μ΄ κ°λ°μ μνν©λλ€.
νΉν Dense λͺ¨λΈλΏλ§ μλλΌ Mixture-of-Experts(MoE) λͺ¨λΈμ μμν, ν루λ λ° μΆλ‘ μ΅μ ν κΈ°μ μ μ€μ νλ‘μ νΈμ μ¦μ μ μ©ν μ μλ μ°κ΅¬μΒ·μμ§λμ΄λ₯Ό μ°Ύκ³ μμ΅λλ€.
β
μ£Όμ μ
무
- μ
μ€ν
μ΄μ§ 컨μμμμ ν΅ν΄ κ°λ°λλ LLM/VLM Foundation Modelμ κ²½λν λ° μΆλ‘ μ΅μ ν
- λκ·λͺ¨ MoE λͺ¨λΈμ μμν κΈ°μ μ°κ΅¬Β·κ°λ°
- Post-Training Quantization(PTQ)
- Quantization-Aware Training(QAT)
- ꡬ쑰μ Β·λΉκ΅¬μ‘°μ ν루λ λ° ν¬μν κΈ°μ μ°κ΅¬Β·κ°λ°
- μμνΒ·ν루λ κ³Όμ μμ λ°μνλ λͺ¨λΈ μ±λ₯ μ νλ₯Ό μ΅μννκΈ° μν Calibration, Reconstruction λ° Fine-tuning λ°©λ²λ‘ κ°λ°
- TensorRT-LLM, vLLM, SGLang, ONNX Runtime λ± μΆλ‘ νλ μμν¬ κΈ°λ° μ΅μ ν
- CUDA, Triton λλ NPU Vendor SDKλ₯Ό νμ©ν κ³ μ±λ₯ μ°μ°μμ 컀λ κ°λ°
- KV Cache μ΅μ ν, Continuous/Dynamic Batching, Speculative Decoding λ± μΆλ‘ κ°μ κΈ°μ κ°λ°
- LLM/VLMμ μ νλ, Latency, Throughput, Memory Footprint νκ°
- GPUΒ·NPU νμ¬ λ° μΆλ‘ μ΅μ ν
- μ΅μ νλ LLM/VLMμ NVIDIA GPU λ° λ€μν κ΅λ΄μΈ NPUΒ·AI κ°μκΈ°μ νμ¬
- κ° νλμ¨μ΄μ μ°μ° ꡬ쑰, μ§μ μ λ°λ λ° λ©λͺ¨λ¦¬ νΉμ±μ κ³ λ €ν Hardware-aware Model Optimization
- GPUμ NPUλ³ μ§μ μ°μ°μ λ° μμΉ μ λ°λμ λ§μΆ λͺ¨λΈ λ³ν λ° μ΅μ ν
- νλμ¨μ΄λ³ Quantization Scheme, Mixed Precision λ° κ·Έλν μ΅μ ν μ λ΅ κ°λ°
- λͺ¨λΈ λ³ν, μ»΄νμΌ, λ°νμ μ°λ λ° μ€μ λλ°μ΄μ€ μ±λ₯ κ²μ¦
- μ§μλμ§ μλ μ°μ°μμ λν λ체 μ°μ° μ€κ³ λ° Custom Operator κ°λ°
- λͺ¨λΈμ End-to-End Latency, Throughput, Memory Usage λ° μ λ ₯ ν¨μ¨ κ°μ
- μλ², μ¨λλ°μ΄μ€ λ° μ£μ§ νκ²½μ κ³ λ €ν LLM/VLM λ°°ν¬ μ΅μ ν
- μ°κ΅¬κ°λ°
- LLM/VLM λ° MoE λͺ¨λΈ κ²½λνΒ·μΆλ‘ μ΅μ ν κ΄λ ¨ μ΅μ μ°κ΅¬ λΆμ
- κΈ°μ‘΄ λ°©λ²λ‘ μ νκ³λ₯Ό ν΄κ²°νκΈ° μν μ κ· μμν, ν루λ λ° μΆλ‘ μ΅μ ν λ°©λ²λ‘ μ°κ΅¬
- μ°κ΅¬ κ²°κ³Όμ νΉν μΆμ, λ
Όλ¬Έ μμ± λ° κ΅λ΄μΈ νμ λν λ°ν
- κ°λ°λ μ°κ΅¬ λ°©λ²λ‘ μ μ€μ GPUΒ·NPU νκ²½μμ λμνλ μννΈμ¨μ΄λ‘ ꡬν
β
κΈ°λ μν
- 컨μμμμμ κ°λ°λλ LLM/VLM Foundation Modelμ μ€μ μλΉμ€μ νλμ¨μ΄ νκ²½μ μ μ©ν μ μλ μμ€μΌλ‘ μ΅μ ν
- λͺ¨λΈ μ±λ₯ μ νλ₯Ό μ΅μννλ©΄μ λͺ¨λΈ ν¬κΈ°, λ©λͺ¨λ¦¬ μ¬μ©λ λ° μ°μ° λΉμ© μ κ°
- NVIDIA GPUλΏ μλλΌ λ€μν NPUμμ λμ μΆλ‘ μ±λ₯μ ν보νκΈ° μν νλμ¨μ΄ μΈμ§ν μ΅μ ν κΈ°μ κ°λ°
- MoE λͺ¨λΈμ λν μ°¨μΈλ μμνΒ·ν루λ κΈ°μ μ°κ΅¬
- μ°κ΅¬ κ²°κ³Όλ₯Ό λ
Όλ¬Έμ΄λ νλ‘ν νμ
μ κ·ΈμΉμ§ μκ³ μ€μ NPUμμ μ€νλλ μννΈμ¨μ΄λ‘ ꡬν
- λ€μν νλμ¨μ΄λ₯Ό μ§μνλ λ²μ© LLM/VLM μ΅μ ν λ° λ°°ν¬ κΈ°μ μ²΄κ³ κ΅¬μΆ
β
μ격μ건
- μ»΄ν¨ν°κ³΅ν, μΈκ³΅μ§λ₯, μ κΈ°μ μ곡ν λλ κ΄λ ¨ λΆμΌμ μμ¬ μ΄μ νμ 보μ μ λλ μ΄μ μ€νλ μ°κ΅¬Β·κ°λ° μλμ 보μ ν λΆ
- LLM, VLM λλ Transformer κΈ°λ° λͺ¨λΈμ λν κΉμ μ΄ν΄λ₯Ό 보μ ν λΆ
- MoE λͺ¨λΈμ μμν, ν루λ, ν¬μν λλ μΆλ‘ μ΅μ ν κΈ°μ μ μ€μ νλ‘μ νΈμ μ¦μ μ μ©ν μ μλ λΆ
- λ€μ λΆμΌ μ€ νλ μ΄μμμ μ€μ§μ μΈ μ°κ΅¬ λλ κ°λ° κ²½νμ 보μ ν λΆ
- LLM/VLM Quantization
- Model Pruning λ° Sparsity
- MoE Compression λ° Routing Optimization
- Efficient Transformer
- LLM/VLM Inference Optimization
- λͺ¨λΈ μ νλλΏλ§ μλλΌ Latency, Throughput, Memory λ° μ°μ°λμ μ’
ν©μ μΌλ‘ λΆμν μ μλ λΆ
- μ°κ΅¬ λ°©λ²λ‘ μ μ€μ μΆλ‘ μμ€ν
κ³Ό νλμ¨μ΄ νκ²½μ ꡬνν μ μλ λΆ
- λ
립μ μΌλ‘ λ¬Έμ λ₯Ό μ μνκ³ μ€νμ μ€κ³Β·μνν μ μλ λΆ
- ν΄μΈ μΆμ₯ λ° μ¬νμ 결격 μ¬μ κ° μλ λΆ
β
μ°λμ¬ν
- NeurIPS, ICML, ICLR, ACL, EMNLP, NAACL, CVPR, ICCV, ECCV λ± μ΅μμ AIΒ·ML νμ λν λ
Όλ¬Έ κ²μ¬ κ²½ν
- LLM/VLM λλ MoE λͺ¨λΈμ μμνΒ·ν루λ κ΄λ ¨ λ
Όλ¬Έ, νΉν λλ μ€νμμ€ μ€μ
- GPTQ, AWQ, SmoothQuant, OmniQuant, AutoRound, SparseGPT λ± λͺ¨λΈ κ²½λν κΈ°μ μ ꡬν λλ νμ₯ κ²½ν
- TensorRT-LLM, vLLM, SGLang, DeepSpeed, Megatron-LM λ± λκ·λͺ¨ λͺ¨λΈ μΆλ‘ μμ€ν
κ°λ° κ²½ν
- CUDA λλ Triton κΈ°λ° GPU 컀λ μ΅μ ν κ²½ν
- κ΅λ΄μΈ NPU, ASIC λλ Edge AI κ°μκΈ° λμ λͺ¨λΈ ν¬ν
Β·μ΅μ ν κ²½ν
- NPU Vendor SDK, Compiler λλ Runtimeμ μ΄μ©ν λͺ¨λΈ λ³ν λ° λ°°ν¬ κ²½ν
- Custom Operator λλ Custom Kernel κ°λ° κ²½ν
- MoE λͺ¨λΈμ Expert Routing, Expert Load Balancing, Expert Parallelism λλ ν΅μ μ΅μ ν κ²½ν
β
μ±μ© μ μ°¨
- μλ₯ κ²ν β κ³Όμ β 1μ°¨ μΈν°λ·° β μ
μ¬ μΌμ νμ β μ΅μ’
μ λ°
(μ μ°¨ κ°μ μΆκ°μ μΈ κ³Όμ κ° μμ μ μμ΅λλ€.)
β
근무 κΈ°κ°
π€Β νμ λ©μΈμ§
μ°λ¦¬ νμ λ€μν NPU, GPU, AI κ°μκΈ° νκ²½μμ LLMκ³Ό Computer Vision λͺ¨λΈμ΄ μμ μ μΌλ‘ λμνλλ‘λͺ¨λΈ λ³νλΆν° κ·Έλν μ΅μ ν, λ²€λ μ»΄νμΌλ¬ μ°λ, λλ°μ΄μ€ λ°νμ ꡬμ±, λ°°ν¬κΉμ§ λͺ¨λΈμ μ 체 μλͺ
μ£ΌκΈ°λ₯Ό μ€κ³νκ³ κ΅¬ννλ μν μ λ§‘κ³ μμ΅λλ€. νλμ¨μ΄ μ μ‘°μ¬κ° μ 곡νμ§ μλ μμ, μλ₯Ό λ€λ©΄ Front λ° Middle End μ΅μ ν, Graph Surgery, μ°μ°μ μμ κ³Ό κ°μ λΆλΆμ λ
μμ μΌλ‘ ν΄κ²°νλ©° μ΄λ€ λͺ¨λΈμ΄λ , μ΄λ€ λλ°μ΄μ€ νκ²½μμλ λμ κ°λ₯νκ² λ§λλ κ²μ΄ νμ ν΅μ¬ λ―Έμ
μ
λλ€.
μ§μ μ , νμΈν΄μ£ΌμΈμ! π
- ν΄λΉ κ³΅κ³ λ μμ μ±μ©μΌλ‘, μ±μ© μλ£ μ μ‘°κΈ° λ§κ°λ μ μμ΅λλ€.
- μ΄λ ₯μ λ΄ μ°λ΄ μ 보 λ± λ―Όκ°ν κ°μΈ μ λ³΄κ° κΈ°μ¬λμ΄ μλ€λ©΄, ν΄λΉ μλ₯λ κ²ν λμ§ μμ μ μμ΅λλ€.
- μ μΆν΄ μ£Όμ λ΄μ© μ€ νμ μ¬μ€μ΄ μμ κ²½μ° μ±μ©μ΄ μ·¨μλ μ μμ΅λλ€.
- μ±μ© μ λ νΌλ°μ€ 체ν¬κ° μμμ μλ €λ립λλ€.
- μ΅μ’
μΈν°λ·° ν©κ²© μ λ³λλ‘ μ²μ°λ₯Ό νμν©λλ€.
- κ΅κ°λ³΄νλμμ λ° μ₯μ μΈμ κ΄λ ¨ λ²κ·μ μκ±°νμ¬ μ°λν©λλ€.
- μ₯μ μΈ κ³ μ© μ΄μ§μ μν νμ μ μ μ°¨ νμΈμ΄ νμν κ²½μ°, μ₯μ μΈ λ±λ‘μ¦ μ¬λ³Έμ κΈ°ν μλ₯ λμ μ νμ μΌλ‘ μ μΆνμ€ μ μμ΅λλ€. μ μΆ μ¬λΆλ μ ν νκ°μ μ΄λ ν μν₯λ λ―ΈμΉμ§ μμ΅λλ€.
π μ½μ΄λ³΄λ©΄ λμ λλ κ΄λ ¨ μλ£