www.engineering-korea.com

엔터프라이즈 AI 인프라 소프트웨어 통합 및 가속화

인텔은 상용 AI 시스템을 위한 이기종 디지털 인프라를 최적화하고자 제온(Xeon) 프로세서와 데이터센터 GPU를 오픈소스 프레임워크와 통합합니다.

  www.intel.com
엔터프라이즈 AI 인프라 소프트웨어 통합 및 가속화

엔터프라이즈 환경에서의 상용 AI 배포는 단순히 가속기의 원시 처리량에만 의존하기보다, 대규모 언어 모델을 복잡한 비동기식 워크플로에 통합하는 역량을 요구합니다. 인텔은 하드웨어 실행 환경을 업스트림 오픈소스 프레임워크 및 런타임 환경과 일치시켜, 고밀도 연산 수요와 엔터프라이즈 제어 플레인을 연결함으로써 이러한 운영상의 과제를 해결합니다.

시스템 레벨의 이기종 아키텍처
엔터프라이즈 에이전트 워크플로는 벡터 데이터베이스 검색, 접근 제어 적용, ERP 연동, 가드레일 검증을 결합합니다. 고밀도 모델 연산은 전용 가속기에서 실행되는 반면, 중앙 프로세서는 전반적인 운영 프레임워크를 제어합니다.

해당 아키텍처에서 인텔 제온 프로세서는 입력 데이터 준비, 비동기 요청 라우팅, 네트워크 지연 시간 관리, 비즈니스 로직 실행을 총괄합니다. 가속화된 워크플로의 경우, 인텔은 현재 아키텍처와 크레센트 아일랜드(Crescent Island)를 포함한 차세대 데이터센터 GPU를 지원하는 개방형 GPU 소프트웨어 스택을 개발하고 있습니다.

소프트웨어 업스트림 통합 및 프레임워크 표준
독점 툴킷을 요구하거나 벤더 전용 커널 재작성을 강제하는 대신, 이번 기술적 접근은 기존 오픈소스 프로젝트에 대한 업스트림 기여에 중점을 둡니다.
  • 프레임워크 통합: 새로 출시된 모델 아키텍처에 대해 즉각적인 사용(Day 0) 환경을 제공하도록 파이토치(PyTorch), SGLang, vLLM 내에서 직접 최적화 수행.
  • 워크로드 이식성: 핵심 애플리케이션 로직을 다시 작성하지 않고도 CPU, GPU, 특화 가속기에 걸쳐 작업을 유연하게 할당할 수 있는 단일 추상화 계층 제공.
  • 성능 프로파일링: 커널 파라미터 튜닝, 실행 그래프 컴파일, 런타임 배포를 단순화하는 인텔 GPU AI 스킬(Intel GPU AI Skills) 등의 도구 지원.
분리형 추론의 실용화
실제 상용 환경에서는 컨텍스트 프롬프트를 처리하는 사전 입력(Prefill) 단계와 순차적으로 토큰을 생성하는 디코딩(Decode) 단계를 아키텍처적으로 분리하는 작업이 필요합니다. 두 단계는 연산량 및 메모리 대역폭 요구 사항이 상이하므로, 분리형 추론(Disaggregated Inference)을 적용하면 클러스터 활용도를 극대화할 수 있습니다.

인텔은 네트워크 패브릭 전반의 KV 캐시 전송을 관리하고, 요청 경합을 완화하며, 다중 노드 실행을 스케줄링하기 위한 소프트웨어 수준의 조율 기능을 구현합니다. 인텔 추론 마이크로서비스(Intel Inference Microservices)를 통해 제공되는 모듈형 컨테이너화 런타임 계층은 상용 클러스터를 위한 쿠버네티스(Kubernetes) 기반 헬스 모니터링, 텔레메트리, 자동 확장을 지원합니다. 또한 레퍼런스 아키텍처와 엔터프라이즈 에이전트 툴킷을 통해 모델, ID 공급자, 검색 증강 생성(RAG) 파이프라인 간의 연결을 표준화합니다.

에브게니 릴로프가 편집했고,인듀포털스 미디어는 인공지능이 제작했습니다.

www.intel.co.kr

  에 관한 자세한 정보는 언제든지 문의하시기…

LinkedIn
Pinterest

155,000+ IMP 팔로워와 함께 하세요.