인텔과 AMD가 공동으로 발표한 x86용 ACE CPU 확장 기능은 기존 AVX10 레지스터를 활용하며 행렬 곱셈 전용 실리콘을 추가하여 AI 연산 효율을 높입니다. 이 규격은 동일한 입력 벡터 개수에서 AVX10 대비 16배 많은 연산을 수행할 수 있어 명령어 오버헤드와 램 대역폭 소모를 줄입니다. 또한 하드웨어 구현 방식에 구애받지 않도록 설계되어 파이토치나 텐서플로 같은 머신러닝 프레임워크에서 단일 코드 경로만으로 최적화가 가능합니다.
데이터 지원 측면에서 ACE는 INT8 INT32 FP8 FP16 FP32 BF16을 포함한 대부분의 머신러닝 데이터 유형을 기본 처리합니다. 이에 더해 AVX10에서 지원하지 않는 오픈 컴퓨트 프로젝트의 MX 블록 스케일링 형식까지 기본 지원 대상에 포함합니다. 개발자…
원문 보기 →