AMD는 지난 주 데스크탑 최초로 8코어 (eight-core, octa-core, 옥타코어)를 출시했으나 애플리케이션이나 게이밍 성능에서 만족스럽지 못한 결과를 보였는데 이에 대해 AMD의 전직 엔지니어는 이 성능 문제가 튜닝 부족에 의한 것이라고 밝혔다.
xbitlabs는 AMD의 전직 엔지니어인 Cliff A. Maier와의 인터뷰에서 32nm 공정과 새로운 아키텍처인 불도저 (Bulldozer)를 기반으로 한 FX CPU의 기대이하 성능은 자동화 툴에 의존하는데 따른 튜닝 부족의 문제를 지적했다고 전했다.
AMD는 크로스 엔지니어링 (Cross-Engineering) 즉, ATI 인수이후 AMD와 ATI 팀은 서로 협력하고 있으며, CPU와 GPU 디자인은 수작업을 멈추지 않고 있으나 SoC 디자인 스타일로 전환되고 있다. 이결과 높은 성능은 포기하는 대신 칩 면적과 효율 극대화에 더욱 집중하고 있다고 밝혔다.
인텔과 AMD 양사는 칩의 치명적인 부분을 최소화하기 위해 노력하고 있다. 이는 통합 툴 (Synthesis tools)과 노선과 장소 자동화 툴 등에 보다 의존하게 되었다는 것을 의미한다고 지적했다.
이런 자동화된 디자인 방법은 수작업 디자인과 비교해 20% 더 커지고 20% 더 느려지게 만드는 요인이며, 결과적으로 더 많은 트랜지스터와 다이 사이즈, 비용 증가, 그리고 비효율적인 전력을 소비하게 된다고 밝혔다.
AMD의 자동화 디자인 툴의 적용 범위에 대해서 확실하게 알려져 있지 않으나 이것으로 인해 불도저 아키텍처의 일부 비효율적인 디자인을 만들었다고 지적했다. 공식적으로 AMD는 Zambezi/ Orochi 프로세서는 약 20억개의 트랜지스터를 내장하고 있으며, 이 수치는 매우 높은 수준이다.
AMD 불도저 아키텍처의 듀얼코어 CPU 모듈은 L2 공유캐쉬 2MB가 2억 1천 3백만 트랜지스터 (213million)와 30.9mm^2를 차지하며, 이는 라노 (Llano, 11 layer 32nm SOI, K10.5+ 아키텍처) 프로세서 하나의 프로세싱 엔진 다이 사이즈인 9.69mm^2 (L2 캐쉬 제외)보다 더 크다. 따라서, AMD는 차후 이런 요소들의 최소화 및 최적화를 통해 더 작은 사이즈와 생산 비용을 줄일 수 있을 것이라고 지적했다.
4 CPU 모듈의 L2 캐쉬는 Zambezi/ Orochi 프로세서가 8억 5천 2백만 (852 million) 트랜지스터와 123.6mm^2의 다이 사이즈를 차지한다. L3 캐쉬 8MB (6bit per cell)는 4억 5백만 (405 million)개의 트랜지스터가 사용된다. 그리고 약 8억개 (800 million)의 트랜지스터는 입출력 인터페이스와 듀얼채널 DDR3 메모리 컨트롤러를 비롯한 다양한 로직 등에 사용된다.
인텔 코어i 시리즈인 샌디브릿지 (Sandy Bridge) 쿼드코어는 내장 그래픽을 포함하면서 9억 9천 5백만 개 (995 million)의 트랜지스터로 구성되는 것을 고려하면 I/O와 메모리, 로직 등이 사용되는 8백만 트랜지스터는 상당히 많은 다이 사이즈를 차지하는 것이다.
이처럼 AMD Zambezi/ Orochi 아키텍처의 수백만 개 트랜지스터 증가는 자동화 디자인 툴이 영향을 주고 있는 것이다.
비효율적인 디자인은 성능 저하에 영향을 주었으며, AMD는 8코어 FX 프로세서 (315mm^2 다이 사이즈)를 천 개 주문 당 245달러 ($245)에 판매하고 있다. 인텔은 샌디브릿지 쿼드코어 (216mm^2 다이 사이즈)를 1000개 주문 당 최대 317달러 ($317)에 판매하고 있어 가격 경쟁력면에서도 불리하게 된다.
두 프로세서는 같은 32nm 공정이 적용되나 인텔은 더 작은 다이 사이즈 등으로 AMD 프로세서보다 더 높은 마진을 얻고 있고 성능 역시 더 우수하다. |