|
TLB 패치 적용에 따른 성능 저하 확인 및 B3 스테핑과 비교!
이번에 발표된 쿼드 코어 페넘 X4 B3 스테핑 CPU들의
경우 기존 B2 스테핑이 가진 TLB 버그를 수정한 것이 B2 스테핑 CPU들과 가장 크게 달라진 부분이라고 볼 수 있다.
기존 B2 스테핑 CPU들의 경우 TLB 문제를 임시로 해결하기 위해 ATI OverDrive 프로그램이나 메인보드에서
TLB Patch를 적용할 수 있는 옵션을 별도로 제공하고 있다.
[B2 스테핑 9600 블랙에디션 장착, Patch AMD TLB Erratum 메뉴 활성]
B2 스테핑의 페넘 9600 블랙에디션을 테스트를 진행한 GIGABYTE
GA-MA790FX-DQ6 (F4 최신 바이오스) 메인보드에 장착하였을 때 자동으로 Patch AMD TLB Erratum
메뉴가 활성화되었으며, 이 부분을 Disabled 하면 패치 미적용, Enabled를 선택하면 Patch가 적용된다.
그러나, 함께 테스트에 사용한 B3 스테핑 페넘 X4 9850 블랙에디션의 경우 TLB 버그를 구성한 B3 스테핑
CPU이기 때문에 이 메뉴가 아예 나타나지 않는다.
여기에서는 B3 스테핑의 TLB 문제 해결에 따른 부분을
알아보고자 TLB 버그를 가진 B2 스테핑 제품에 TLB Patch를 적용하였을 때와 그렇지 않았을 때를 동일 클럭 설정을
통해 B3 스테핑 제품과의 성능을 비교하여 보았다. (실제로 B2 스테핑의 TLB 문제는 데스크탑 환경이 아닌
서버 환경에서 주로 나타나는 문제이기 때문에 TLB 패치 적용에 따른 성능 저하 부분만을 이번 성능 부분에서 확인하였다.)
테스트 시스템
테스트를 위해 아래와 같은 환경을 구성하였다.
|
CPU |
Intel Core2 Quad Q6600
(Quad-Core, FSB1066, 2.4GHz) AMD Phenom X4
9850 BE (Quad-Core, HT 4000, 2.50GHz) AMD Phenom 9600
BE (Quad-Core, HT 3600, 2.30GHz) |
|
MainBoard |
GIGABYTE GA-X38-DQ6/
GA-MA790FX-DQ6 |
|
Chipset |
Intel X38 Express + ICH9R/
AMD 790FX + SB600 |
|
RAM |
EKMemory PC2-8500
4GB (2GB X 2EA) Kingston
PC2-9200 2GB (KHX9200D2K2/2G, 1GB X 2EA |
|
VGA |
Radeon HD3870 512MB Ref.
(775/ 2250(1125)MHz) |
|
HDD |
Western Digital Raptor SATA 36GB 10000RPM
Hitachi Deskstar SATA 320GB
7200RPM |
|
ODD |
ASUS
DRW-1604P (DVD RW) |
|
OS |
Windows Vista
Ultimate K 32bit/ 64bit |
|
DirectX |
DirectX 9.0c |
|
Chipset Patch |
Intel inf 8.3.1.1009 |
|
VGA Driver |
AMD ATI Catalyst 8.3 |
|
- |
테스트 시스템은 인텔 하이엔드
칩셋인 X38을 사용한 GIGABYTE GA-X38-DQ6 메인보드를 사용하였으며, 메모리는 기본 성능 테스트를 위해
EKMemory PC2-8500 2GB 2개를 사용하여 4GB의 시스템 메모리를 구성하고 이를 제대로 활용할 수 있는
윈도우 비스타 64bit 운영체제에서 진행하였다. HDD는 SATA 방식 Hitachi Deskstar 320GB와 Raptor
36GB HDD 두 개를 사용하였다. 메모리 클럭은 AMD 네이티브 쿼드 코어 페넘 프로세서가 지원할 수 있는 최대의
클럭인 DDR2 1066MHz을
적용하고 FSB와 메모리 클럭은 Auto
설정 (CL5-7-7-21, 2T)을 이용하였다.
32bit 운영체제는 메모리를 기본 성능
테스트를 위해 Kingston PC2-9200 1GB 2개를 사용하여 시스템 메모리를 구성하고 메모리 클럭은 64bit 운영체제 테스트와 마찬가지로
페넘 프로세서가 제공하는 최대 지원 클럭인 DDR2 1066MHz를 기본으로 테스트를 진행하였다. FSB와 메모리 클럭
역시 동일한 Auto 설정 (CL5-7-7-21, 2T)을 사용하였다.
테스트는 페넘 X4 9850 블랙에디션의 기본 설정
(2.50GHz, HT 2GHz, NB Freq. 2GHz), 페넘 X4 9850 기본에서 HT 클럭을 1.8GHz로 설정
(2.50GHz, HT 1.8GHz, NB Freq. 2gHz), 그리고 페넘 9600 블랙에디션은 9850 블랙에디션과
동일한 클럭에 TLB 패치를 적용한 설정 (2.50GHz, HT 1.8GHz, NB Freq. 2GHz), TLB 패치
미적용 (2.50GHz, HT 1.8GHz, NB Freq. 2GHz), 그리고 비교 제품으로 경쟁상대가 될 것으로
예상되는 인텔 Core2 Quad Q6600 (2.40GHz, FSB1066MHz, L2 4MB x 2)를 사용하였다.
64bit는 페넘 X4 9850 블랙에디션과 동일한 클럭을 설정한 페넘 9600 블랙에디션과의
비교이지만, 9600 블랙에디션은 HT 클럭을 1.8GHz에서 더 이상 상승할 수 없었기 때문에 기본 1.8GHz를
적용하고 NB Frequency는 1.8GHz에서 페넘 X4 9850 블랙에디션과 동일한 2GHz 설정이 가능하여 2GHz로
테스트를 진행했다. 따라서, TLB 패치에 따른 성능 외에 HT 클럭 향상에 따른 성능도 확인해볼 수 있다. (편의상 페넘
X4 9850 블랙에디션은 9850BE, 페넘 9600 블랙에디션은 9600BE, 페넘 9600 블랙에디션 TLB 패치
적용은 9600BE TLB Ena., 페넘 9600 블랙에디션 TLB 패치 미적용은 9600BE TLB Dis.로
표기한다.)
32bit 테스트는 페넘 X4 9850 블랙에디션 기본 클럭과 페넘
9600 블랙에디션 기본 클럭, 페넘 9600 블랙에디션 TLB 패치 미적용과 HT 1.8GHz 클럭을 적용한 결과,
그리고 인텔 Core2 Quad Q6600을 비교 제품에 사용하였다. (편의상 페넘 X4 9850 블랙에디션은
9800BE, 페넘 9600 블랙에디션은 9600BE, 9600 블랙에디션에 TLB 패치 미적용은 9600BE TLB
Dis., 인텔 코어2 쿼드 Q6600은 Q6600으로 표기하였다.)
Sandra 2008 SP1 : 32bit와 64bit
Sandra 2008에서는 CPU 연산 능력과 멀티미디어, 그리고 메모리 대역폭을 살펴볼
수 있고 32bit와 64bit 운영체제를 모두 지원하여 이번 테스트는 윈도우 비스타 64bit 환경에서 진행되는 만큼
64bit로 Sandra 2008을 설치하여 테스트를 진행했다.
|
제품명 |
페넘 X4 9850 (HT 2.0GHz) |
페넘 X4 9850 (HT 1.8GHz) |
페넘 9600BE (TLB Patch
Disabled/ HT 1.8GHz) |
페넘 9600BE (TLB Patch
Enabled/ HT 1.8GHz) |
Q6600 |
|
CPU 연산 성능 및 메모리
대역폭 (64bit) |
|
Sandra CPU
Arithmetic |
ALU (MIPS) |
34521 |
34654 |
34652 |
34832 |
35330 |
|
iSSE3 (MFLOPS) |
28128 |
28170 |
28136 |
28161 |
29134 |
|
Sandra CPU
Multi-Media |
Int x8 iSSE3
(it/s) |
141635 |
141632 |
141626 |
141629 |
259053 |
|
Float x4 iSSE2
(it/s) |
182987 |
183112 |
183258 |
182945 |
200804 |
64bit
CPU 연산 능력은 동일한 클럭을 적용하였을 때 산술 논리 연산 부분과 iSSE3 모두에서 9600BE에 TLB 패치를
적용하거나 적용하지 않았을 때 모두 큰 차이는 발생하지 않는 것으로 나타났으며, CPU 멀티미디어 테스트 부분 역시 CPU
연산 부분과 크게 차이 없이 TLB 패치에 따른 연산 성능 저하는 나타나지 않고 있다.
CPU 연산과 멀티미디어 연산 부분은 인텔 CPU가 전반적으로 높게 나타났으며, 멀티미디어 연산 부분에서는 특히 정수 연산
부분에서 차이가 부동소수점 연산 부분보다 크게 나타났다. 클럭이 2.5GHz vs 2.4GHz 이지만, 기본 연산 성능은
인텔 Q6600이 전반적으로 우세하게 나타났다. 또, 2.0GHz vs 1.8GHz 적용에 따른 HT 클럭에 따른 성능
차이 역시 거의 나타나지는 않았다고 볼 수 있다.
|
제품명 |
페넘 X4 9850 |
페넘 9600BE TLB Patch
Disabled/ HT 1.8GHz |
페넘 9600 BE |
Q6600 |
|
CPU 연산 성능 및 메모리
대역폭 (32bit) |
|
Sandra CPU
Arithmetic |
ALU (MIPS) |
33495 |
33389 |
30775 |
40989 |
|
iSSE3 (MFLOPS) |
33259 |
32345 |
29752 |
30955 |
|
Sandra CPU
Multi-Media |
Int x8 iSSE3
(it/s) |
95001 |
95011 |
87274 |
265904 |
|
Float x4 iSSE2
(it/s) |
125556 |
124851 |
115109 |
144147 |
32bit
CPU 연산 부분에서의 성능은 9850BE는 HT 1.8GHz와 TLB 패치를 미적용하고 동일 클럭이 설정된 9600BE
TLB Dis.와 앞서의 64bit 운영체제에서처럼 거의 차이는 발생되지 않았다. 9600BE 기본 클럭보다 200MHz가
높아진 만큼 9850BE는 전반적인 연산 성능이 향상된 것을 확인할 수 있다. Q6600은 앞서처럼 CPU 연산과
멀티미디어 부분 모두에서 2.4GHz로 9850BE보다 100MHz가 낮지만, 전반적으로 높은 연산 능력을 가지고 있음을
확인할 수 있다.
[숫자가 높을수록 좋다. 64bit 비스타, 64bit Sandra 2008 SP1]
[숫자가 높을수록 좋다. 32bit 비스타, 32bit Sandra 2008 SP1]
Sandra 2008 SP1의 메모리 대역폭 테스트 결과는 앞서의 CPU 연산과
멀티미디어 부분과는 큰 차이를 나타냈다. 특히, TLB 패치를 적용한 9600BE TLB Ena.에서는 TLB 패치를
적용하지 않은 9600BE TLB Dis.와 9850BE에서의 결과와는 차이를 보여주고 있다. 즉, TLB 패치를 적용하게
되면 메모리 대역폭 성능이 크게 저하되어 메모리 대역폭을 많이 필요로 하는 프로그램 등에서 TLB 패치를 적용하지 않을
때보다 크게 나타날 수 있다. 또, HT 2.0GHz와 1.8GHz에 따른 메모리 대역폭 증가는 거의 이루어지지 않았다고
볼 수 있다.
32bit에서의
메모리 대여폭은 X38 메인보드의 최신 바이오스에서 낮게 측정되는 문제로 Q6600이 가장 낮게 측정되고 있다.
9850BE는 9600BE보다 연산에서처럼 대역폭 부분도 앞섰으며, 9600BE TLB Dis.와는 거의 차이없는 결과를
나타내 HT 1.8GHz와 2.0GHz의 차이가 64bit에서처럼 거의 차이가 나타나지는 못하였다.
TMPGEnc 4.0 Xpress : 32bit
[숫자가 낮을수록 성능이 좋다. 32bit 운영체제, 32bit TMPGEnc 4.0 Xpress]
이번에는 TMPGEnc 4.0 Xpress 인코딩 프로그램을 통해 WMV 포맷의 파일을 DivX 코덱을 이용하여 AVI
포맷의 파일로 변환을 진행하였다.
테스트 결과 9850BE는 Q6600보다 느리게 변환을 완료하였으며, 이는 DivX 코덱과 TMPGEnc 4.0
Xpress 프로그램이 인텔 CPU에 보다 최적화가 잘 되어 있는 결과로 볼 수 있다. 9850BE와 동일 클럭을 설정하고
HT를 1.8GHz 적용한 9600BE TLB Dis.는 9초 정도 9850BE보다 느린 결과를 보여주고 있다. HT 클럭
향상과 L3 캐쉬 레이턴시 감소에 따른 향상으로 볼 수도 있겠지만, 대부분의 결과에서 오차범위 수준의 성능을 보여준 만큼
그 차이는 9850BE와 Q6600의 결과보다는 크지 않다.
x264 BenchMar HD : 32bit
[숫자가 높을수록 성능이 좋다. 32bit 운영체제, 32bit x264 BenchMark HD]
x264 Benchmark HD는 Tech ARP에서 만든 벤치마크 프로그램으로 x264
BenchMark가 480p DVD 품질의
MPEG-2 비디오 영상을 x264 영상으로 2-Pass 인코딩한 것과 달리 720p의 MPEG-2 영상을 x264
영상으로 2-Pass 인코딩을 진행하게 되어 더 높은 CPU 처리 성능을 요구한다.
결과는 이전처럼 FPS로 표기되어 나타나는데 고클럭과 멀티 프로세서를 사용했을 때 더 높은 결과를 얻을 수 있으며, FPS가
높을수록 처리 능력이 빠른 것이다. Pass 1과 Pass 2 모두 5번의 테스트를 진행하여 결과를 내놓는데 여기서는
이들의 평균값을 사용하였다.
테스트 결과 Q6600 (2.40GHz)보다 클럭이 낮은 9600BE (2.3GHz)와
비교하여 Pass1에서는 약간 낮았으나 Pass2에서는 오히려 9850BE보다 더 높은 처리 능력을 보여주고 있다.
9850BE는 동일 설정에 HT만 1.8GHz 설정인 9600BE TLB Dis.와 비교하여 근소한 차이로 처리 성능이
높은 것으로 나타났다. x264 BenchMark HD의 경우 오픈소스를 기반으로 하는 만큼 다른 최적화된 코덱이나
프로그램을 사용하는 벤치와는 달리 CPU 클럭에 따른 성능 차이를 확인할 수 있다.
CineBench R10 : 64bit
[숫자가 낮을수록 성능이 좋다. 64bit 운영체제, 64bit CineBench R10]
|
제품명 |
페넘 X4 9850 (HT 2.0GHz) |
페넘 X4 9850 (HT 1.8GHz) |
페넘 9600BE (TLB Patch
Disabled/ HT 1.8GHz) |
페넘 9600 BE (TLB Patch
Enabled/ HT 1.8GHz) |
Q6600 |
|
Rendering CB-CPU |
|
Rendering 1CPU |
2736 |
2723 |
2700 |
2354 |
2760 |
|
Rendering xCPU |
9966 |
9958 |
9670 |
7676 |
9599 |
이번에는 CPU의 렌더링 성능을 확인해볼 수 있는 CineBench R10을 테스트에 이용하였으며, CineBench
R10 역시 Sandra 2008과 마찬가지로 32bit와 64bit 운영체제를 모두 지원하고 있다. Sandra 2008처럼
CineBench R10도 64bit에서 진행했다.
테스트 결과는 앞서의 Sandra 2008의 메모리 대역폭 부분에서 TLB 패치를 적용하였을 때 대역폭이 감소되었는데
렌더링을 진행하는 CineBench R10 64bit에서 역시 TLB 패치를 적용하였을 때 싱글과 멀티 CPU 사용
모두에서 가장 느린 시간에 렌더링이 진행되었고 실제 렌더링 처리 결과 부분에서도 TLB 패치를 적용하지 않을
때보다 처리 결과가 줄었음을 확인할 수 있다.
이번 역시 HT 2.0GHz vs 1.8GHz의 차이는 거의 나타나지 않았으며, 동일한 설정의 9600BE TLB Dis.
(TLB 패치 미적용 )보다 9850BE의 처리 능력이 앞서는 것도 확인할 수 있으나 그 차이는 크지 않았다. Q6600은
싱글 처리 부분에서는 9850BE를 앞섰지만, 멀티 처리에서는 네이티브로 처리 효율이 뛰어난 9850BE가 조금 더 빠르고
많은 처리가 가능한 것을 확인할 수 있다.
기본 성능을 확인할 수 있는 Sandra 2008과 렌더링 성능을 확인할 수 있는 CineBench R10의 테스트 결과를
통해 TLB 버그를 수정한 B3 9850BE는 TLB 패치에 따른 성능 저하를 걱정할 필요는 없다. HT 클럭의 향상은
Athlno64 X2의 1000MHz에서 Phenom X4의 1800/ 2000MHz로의 높은 향상과 비교하여 그 차이가
크지 않아서인지 HT 클럭 증가로 인한 성능 향상은 찾아보기 힘들었다. 또, 인텔의 Q6600보다 클럭이 100MHz 높은
상태였지만, CineBench R10의 멀티 처리 부분을 제외하면 기본 성능 부분은 Q6600이 조금 더 우세한 것으로
나타났다. 인코딩 부분이나 렌더링 부분은 인텔에 보다 최적화가 잘 이루어진
프로그램에서 Q6600이 우세하게 나타나고 있다.
|