ARM64 NEON 인트린식으로 SIMD 벡터 연산 가속하기

ARM64 서버나 모바일 SoC에서 배열 연산이 많은 코드를 최적화할 때 "컴파일러가 알아서 벡터화해주겠지"라고 믿고 넘어가기 쉽다. 하지만 최적화 레벨이나 포인터 별칭(aliasing) 여부에 따라 auto-vectorization이 조용히 실패하고 스칼라 코드가 그대로 나오는…

Continue ReadingARM64 NEON 인트린식으로 SIMD 벡터 연산 가속하기