jueves, 2 de febrero de 2017

Intel Z68, el futuro X79 y Sandy Bridge E. Actualizado – ProfessionalSAT

Tras el accidentado lanzamiento de los procesadores Core i3, i5 e i7 fabricados con la nueva micro arquitectura Sandy Bridge de 32 nm, Intel va a lanzar el chipset estrella de la gama, el Z68.

intel_z68_slideIntel Z68.

Realmente, la apuesta de Intel con sus gamas de chipset H67 y P67 es, a mi modo de ver, incomprensible. Ninguno de ellos es capaz de sacar el máximo de los nuevos procesadores, para eso llega Z68.

Será el sustituto de gama alta de P67, soportando la salida gráfica de la GPU integrada estas CPUs y lo que es más importante, el ultrarrápido hardware encoding y decoding de video. Obviamente mantendrá el sencillo control de overclock implementado en P67.

17574247

Sobre el SSD caching que Intel integra en este chipset, yo personalmente no le veo interés, ya que es mucho más rápido destinar un SSD como disco de arranque del sistema operativo. Quizás para usuarios con conocimientos bajos de hardware… aunque normalmente este tipo de usuarios no compran chipsets de estas gamas…

Quedará para más adelante la inclusión de PCI Express 3.0 y USB3. Este último será incorporado con chips procedentes de otros fabricantes, normalmente NEC.

La única duda que me queda en el fondo es ver cual es el price premium que Intel cargará sobre P67…

El futuro, Intel X79 y Sandy Bridge E

El chipset de gama alta de la época será X79, que soportara los procesadores Sandy Bridge de la serie E (entusiasta) para socket 2011. Serán procesadores quad y hexa core, incluso se rumores con variantes octal core derivadas de los nuevos Xeon sin GPU integrada en 32 nm.

x79 (2)Intel X79

El socket 2011 LGA (encapsulado de CPU de 52.5 mm x 45 mm) contará con 2011 pines para un quad channel DDR3 1600… el ancho de banda de memoria es simplemente ridículo, más de 51 GB/s (12.8 GB/s X 4 canales)… sin comentarios.

Intel_Sandy_Bridge_EEn la esquina inferior izquierda vemos la CPU LGA 2011.

Las cachés L1 y L2 permanecen invariadas por core, pero se rumorean 2.5 MB de L3 por core en lugar de los 2 MB actuales.

Serán procesadores de 4, 6 y 8 cores con hasta 16 threads por chip con Hyper Threading y Turbo Mode. La caché L3 unificada llegará hasta los 20 MB.

X79Roadmap de chipsets 2011 – 2012.

Por su parte el chipset X79 no incluirá todavía soporte para USB3 de forma nativa, para ello será necesario un chip en placa base como actualmente (la mayoría de las veces NEC). Contará con 10 puertos SATA3 mas 4 SATA2 y compatibilidad SAS en 8 de sus puertos SATA.

SAS

Por fin incluirá soporte para PCI Express 3.0, será el bus de conectividad de las nuevas GPU de AMD y nVidia. con el procesador. Habrá 32 lanes para gráficos y 4 más para aumentar el ancho de banda de los periféricos de almacenamiento.

Image1Ancho de banda de PCI Espress 3.0

A Sandy Bridge y SB-E les sustituirán a finales de este año los nuevos procesadores Ivy Bridge de 22 nm. Se esperan unas prestaciones un 20% superiores a Sandy bridge y un consumo y disipación térmica muy optimizados.

Estos nuevos procesadores, de los que en 2012 veremos variante octal core en la gama de escritorio serán compatibles con el X79. Seguramente a este le seguirán los H7X y P7X para gamas de precio más bajas.

Si consideras útil el contenido de este Blog, ayuda a mantenerlo ojeando algunas de las ofertas que consideres interesantes de nuestros anunciantes.

Carlos Yus Valero – informaticapremium      informaticapremium-logo-150px[3]

Intel Sandy Bridge Core i7 2600 K. Análisis X86 decoders y L0i micro op cache – ProfessionalSAT

Si vais siguiendo mis artículos, en particular este, conoceréis la nueva arquitectura de cachés que ha introducido Intel en sus nuevos procesadores Sandy Bridge. En particular, Intel ha aumentado de forma crítica el ancho de banda de las cachés L1 y L2 para alimentar correctamente a los potenciados núcleos de ejecución de enteros (INT ALU 64 bit, MMX ALU 64 bit y SSE 128 bit)  y de coma flotante (X87 FPU 64 bit, SSE 128 bit y AVX de 256 bit).

SB_uopcache2

El segundo cambio consiste en la creación de un nuevo nivel de caché de instrucciones previo a la L1i de 32 KB y 8 vías (8 ways associativity). Para ello Intel ha dotado a Sandy Bridge de una caché L0i de modesto tamaño (unas 1500 micro ops según Intel) con una tasa de aciertos efectiva sobre el 80%.

Ya traté en cierta extensión esta nueva caché L0i junto con un análisis pormenorizado de la caché L3 multibanco de 8 MB en el siguiente artículo de LowLevelHardware: Intel Core i7 2600 K. Análisis cachés L0i 6 KB y L3 unificada 8 MB – LowLevelHardware

Hay cuatro motivaciones principales para este profundo rediseño:

En primer lugar reducir el uso de los X86 decoders: y gracias a ello el consumo energético de estas gigantescas estructuras diseñadas para traducir las complejas instrucciones X86 a micro instrucciones al estilo RISC.

Como sabéis los X86 decoders tienen un gran tamaño  físico consumiendo un gran número de transistores y por ello una disipación térmica muy alta. Intel, al crear un nuevo nivel de caché de instrucciones previo al nivel 1, un nivel 0 en la práctica, se permite desactivar los decoders cuando se da un L0i hit (acierto de la micro op cache).

rmma_20110209_064736_0281Instruction cache: la L0i obtiene una increíble latencia de 2 ciclos (zona 0 – 4 KB).

Un segundo motivo es reducir la latencia media en peticiones a la caché L1i. La L0i micro op cache contiene instrucciones decodificadas, se encuentra tras los decoders y trabaja en paralelo con el resto de los pipelines de ejecución. En caso de que una secuencia de instrucciones se encuentre en la L0i (un L0i hit) Intel desactiva(obviamente según un algoritmo optimizado) la circuitería de decodificación X86 del procesador y además como beneficio obtenemos una latencia reducida como demostré en un artículo anterior.

SB_uopcache3

En tercer lugar aumentar el ancho de banda medio de fetching de instrucciones. La L1i no es capaz de transmitir 32 bytes por ciclo de modo sostenido, en cambio en caso de un L0i hit la micro op cache si lo consigue aumentando el uso de las unidades de ejecución:

SUB_rmma_20110211_124507_0187Intel Sandy Bridge SUB decode bandwidth.

SB_BranchLa micro op cache también mejora las latencias medias en caso de branch Misprediction.

Y por último reducir la longitud efectiva de los pipelines de ejecución. En caso de un L0i hit el pipeline empieza en la práctica desde la micro op cache reduciéndose en un número importante de etapas. Se consigue por ello una importante reducción en la penalización por Branch Misprediction (fallo de predicción de branches) en caso de darse un L0i hit.

Resultados de los tests. Bandwidth decode:

En este artículo presento resultados experimentales que avalan los hechos que acabo de detallar y ensalzan el excelente diseño conseguido por los ingenieros de Intel en esta gama de procesadores.

Todos los análisis se han realizado en un sistema Sandy bridge Core i7 2600K con Turbo Mode desactivado para evitar incorrecciones de medida y Windows XP Professional X64 SP2 con todas las actualizaciones al día y los últimos drivers para el chipset P67. Por cierto, las pruebas se han realizado en un stepping B1 del chipset y por ello libre del infame SATA2 bug.

Para aclarar conceptos, voy a mostrar un gráfico de ancho de banda de decodificación típico en un procesador convencional (sin micro op cache) por ejemplo un Intel Nehalem:

rmma_20081120_115543_0140Decode bandwidth en Intel Nehalem.

Esta gráfica la obtuve en Noviembre de 2008 probando los primeros Intel Core i7 920 stepping C0/C1 comerciales semanas antes de salir al mercado.

Observamos cuatro zonas con valores en bytes/ciclo claramente diferenciados:

  1. Zona 1: Caché L1i de 32 KB, desde los 1 – 32 KB.
  2. Zona 2: Caché L2 unificada de 256 KB, desde los 32 a los 256 KB.
  3. Zona 3: Caché L3 compartida de 8 MB, desde los 256 KB a los 8 MB.
  4. Zona 4: Memoria RAM, de los 8 MB en adelante. Tened en cuenta que entonces probé el sistema con un dual channel DDR3 1333 (no tenía a mi alcance 3 DIMM DDR3 con voltaje de sólo 1.65V).

Ahora veamos los resultados típicos de un core Sandy Bridge:

SUB_rmma_20110211_124507_0187

Observamos cinco zonas con valores en bytes/ciclo claramente diferenciados:

  1. Zona 1. Caché L0i micro op cache. En este caso su tamaño efectivo es de unos 2 KB. Es una caché inclusiva como es tradición en los diseños de Intel.
  2. Zona 2: Caché L1i de 32 KB, desde los 2 – 32 KB.
  3. Zona 3: Caché L2 unificada de 256 KB, desde los 32 a los 256 KB.
  4. Zona 4: Caché L3 compartida de 8 MB, desde los 256 KB a los 8 MB.
  5. Zona 5: Memoria RAM, de los 8 MB en adelante.

En primer lugar debo decir que he observado varias peculiaridades en el funcionamiento de este nuevo nivel de caché:

  • No todos los tipos de instrucciones son aparentemente cacheadas en la micro op cache. Por ejemplo, algunas instrucciones como Test son decodificadas cada vez que son encontradas en el flujo de instrucciones y las mediciones indican que son enviadas desde la L1i como en diseños anteriores:

TEST_rmma_20110211_124829_0953Intel Sandy Bridge: Test decode bandwidth.

Observamos que no hay ningún incremento de velocidad de decodificación en la zona de 1 – 6 KB, la micro op caché no cachea estas instrucciones.

  • En cambio, en otros casos muestra una asombrosa eficacia multiplicando por más de 2 los resultados en ancho de banda de la L1i:

PrefixedCPM1_rmma_20110211_125524_0437Intel Sandy Bridge: Prefixed CMP decode bandwidth.

Si os fijáis, el tamaño efectivo medido en estos tests sitúa a la L0i sobre los 2 – 2.5 KB. En otros tests en cambio podemos llegar hasta los 6 KB, que es el tamaño “publicitado” por Intel:

PrefixedCMP4_rmma_20110211_125938_0078Intel Sandy Bridge: Prefixed CMP4 decode bandwidth.

Con instrucciones ALU Prefixed CMP4 llegamos hasta un tamaño efectivo para la micro op cache de unos 6 – 7 KB.

Conclusiones:

El diseño de un procesador actual comprende numerosos equipos diferentes trabajando en aspectos separados del diseño final. El arquitecto jefe diseña el plan general y los objetivos que debe de cumplir el nuevo producto.

Uno de los factores limitantes para el diseño de cada unidad del procesador es la superficie que ocupa. A cada una unidad se le asignan unos milímetros cuadrados (o fracciones de mm2) e incluso una morfología determinada por necesidades espaciales de unidades adyacentes.

Otra limitación reside en el consumo en reposo (idle) conocido como leakage (filtrado de corriente con los transistores en off) y en carga típica (TDP) y máxima de cada unidad del diseño. También ahí se imponen graves y rígidas restricciones.

Este último factor ha motivado la inclusión de Register Files y también de la micro op caché en Sandy Bridge, ambos persiguen un solo objetivo: una importante reducción del consumo. Todo ello motivado por la inclusión en el die de la GPU integrada, el hardware de coding – decoding de video y las nuevas unidades de proceso FPU de 256 bit AVX.

Si te gusta la cosmología o la astronomía echa un vistazo a mi artículo sobre Estructura a gran escala del universo en IdeasYCiencia.

Si consideras útil el contenido de este Blog, ayuda a mantenerlo ojeando algunas de las ofertas que consideres interesantes de nuestros anunciantes.

Carlos Yus Valero – informaticapremium      informaticapremium-logo-150px[3]

Intel Sandy Bridge: Análisis de situación – ProfessionalSAT

Los nuevos procesadores Sandy Bridge están marcados desde hace escasos días por la desaparición de una plataforma estable sobre la que desplegar sus increíbles prestaciones fruto de una nueva evolución de la microarquitectura de procesadores X86 de Intel.

Actualización 13 febrero: Intel ha anunciado que mañana día 14 enviará los primeros chips B3 (corregidos) a sus partners: Intel Series 6 chipsets stepping B3 – ProfessionalSAT

Echa un vistazo a mi nuevo artículo sobre microarquitectura del procesador Sandy Bridge en LowLevelHardware: Intel Core i7 2600 K. Análisis cachés L0i 6 KB y L3 unificada 8 MB – LowLevelHardware

DSCF1075Chipset Intel P67 con el radiador retirado.

El bug en los chipsets de la Serie 6 va a costar a Intel al menos 1000 millones de dólares en gastos inmediatos, más el obligatorio desarrollo a marchas forzadas de un segundo stepping comercial posterior al defectuoso B2 y su puesta en el mercado en el tiempo mínimo imprescindible.

DSCF1070Asus P8P67 con el chipset descubierto.

Debo decir que Intel ha hecho lo que debía hacer después de conocerse la noticia aunque en mi opinión abogo por unos tests masivos de sistemas reales y con entornos software reales replicando utilizaciones típicas de usuarios finales aunque con cargas de trabajo más extremas, léase repetitivas.

Por ejemplo tests con trazas repetitivas continuas de acceso a disco en modos secuenciales y aleatorios utilizando por ejemplo el excelente Intel I/O Meter.

Sin duda con prueba similares a las apuntadas, en un periodo de tiempo razonable y con un número de sistemas reducido se puede validar con confiabilidad esta parte de la plataforma.

DSCF1071Perspectiva de la Asus P8P67 con el chipset P67 en primer plano.

Quizás se ha dado por echo que no podían haber errores en algo tan probado en generaciones anteriores de los chipset Intel como las controladoras SATA2 de 300 MB/s… un gran error.

Intel debe replantearse ahora su estrategia comercial, Sandy Bridge sigue siendo el mejor procesador actual en cualquier métrica, prestaciones absolutas o prestaciones per watt, pero necesita un nuevo lanzamiento comercial que borre la mancha que ha supuesto este fallo de diseño y el consiguiente retraso en 3 o 4 meses de su comercialización efectiva, un cuatrimestre completo.

Qué nos depara 2011

En Abril o principios de mayo estarán disponibles los chipsets corregidos de la serie 6, las gamas H67 y P67 junto con sus derivativas. Algo después surgirá el Z68, el representante de la alta gama para Sandy Bridge en socket LGA 1155.

IntelZ68El futuro Z68.

No sé si Intel decidirá mover ficha en el apartado económico y abaratar algo los procesadores o los chipsets para atraer clientes alarmados por el error en el stepping B2 del chipset. No sería nada descabellado.

Para finales de año y si no cambian los planes se esperan los procesadores hexa y octal core nativos (un solo die) sin GPU integrada y con hasta cuatro canales de 64 bit DDR3 con el nuevo socket LGA 2011. Será sin duda un procesador excepcional en todos los aspectos.

IvyBridge22nmIvy Bridge es el próximo Tick en la cadencia de Intel.

Igualmente, para finales de año espero Engineering Samples de Intel Ivi Bridge 22 nm, el sustituto de Sandy Bridge. Con un incremento en número de cores, algunas mejoras microarquitecturales menores y un aumento de caché L3.

AMD en 2011

El retraso de Sandy Bridge da un respiro a su rival, AMD, que está inmerso en la producción de dos nuevos diseños: Llano y Bulldozer, ambos fabricados en 32 nm SOI por Global Foundries.

AMD_Llano_coreDie de uno de los cores de Llano 32 nm.

Llano es una derivativa de los cores AMD K10.5 de los AMD Phenom II de 45 nm trasladada a 32 nm con bastantes mejoras en su microarquitectura e incluirá una GPU integrada de un diseño e implementación similar a la actual AMD 5650, aunque creo que el bloque UVD derivara de las Radeon 6000.

AMD_K10.6_32nmUno de los cores de 32 nm de llano junto con su L2 de 1 MB.

Lo más probable es que integre unos 400 SPs, que serán de la clásica arquitectura Vec5 de AMD / ATI. Estará dotado de dos canales DDR3 y espero una gran mejora en el terreno de la gestión de acceso a RAM, pues le va a hacer falta, sobretodo en frecuencia y load balancing.

Para un análisis más a fondo de Llano, os recomiendo mi artículo de LowLevelHardware de Julio de 2010.

Bulldozer_manipulado630Fotografía manipulada del die de AMD Orochi, el primer chip de arquitectura Bulldozer.

Sobre Bulldozer, largo y tendido he escrito sobre él en varios de mis Blogs, incluso he especulado extensamente sobre sus prestaciones:

La microarquitectura de AMD Bulldozer. Actualizado - LowLevelHardware
Intel Core i7 SMT vs. AMD Bulldozer CMT – LowLevelHardware

Cluster_multithreadingEl concepto original de CMT.

Algunos datos extra sobre AMD Bulldozer. Actualizado – ProfessionalSAT
Bulldoxer_4module_8int_cores_L3shared_630AMD octal core Zambezi 32 nm SOI.
AMD Bulldozer. Prestaciones estimadas – LowLevelHardware

slide3[1]Prestaciones estimadas en Abril de 2009 por AMD para Interlagos.

Microarquitectura AMD Bulldozer 2011. Actualizado – LowLevelHardware

Bulldozer_serverAMD Bulldozer, la próxima microarquitectura.

Previo AMD Bulldozer. Actualizado – LowLevelHardware

GloFo32nmEl proceso de 32 nm va a traer muchas novedades al portafolio de CPUs de AMD.

Novedades y expectativas 2010. Actualizado – LowLevelHardware

AMD_CPU_roadmap_2010Roadmap de AMD para 2011.

AMD Bulldozer – ProfessionalSAT

Modulo2Uno de los módulos de AMD Orochi, el primer integrante de la familia Bulldozer.

Conclusiones

2011 va a ser un año muy interesante pues van a legar al mercado varias microarquitecturas nuevas. En el caso de AMD, desde 2003 no nos sorprendía con un diseño de core radicalmente nuevo (desde el Athlon 64).

Ahora mismo estoy trabajando en el análisis microarquitectural de los cores de ejecución de Sandy Bridge y en su diseño de caches de datos e instrucciones.

Sobretodo me estoy centrando en la medición de latencia y anchos de banda por ciclo y en la misteriosa caché de microinstrucciones de la que ya he desentrañado algunos de sus secretos más llamativos.

Si consideras útil el contenido de este Blog, ayuda a mantenerlo ojeando algunas de las ofertas que consideres interesantes de nuestros anunciantes.

Carlos Yus Valero – informaticapremium      informaticapremium-logo-150px[3]

Cougar Point Intel 6 Series Chipset SATA2 bug. Actualizado – ProfessionalSAT

No debo negar mi absoluta sorpresa (ni los propios OEM lo han sabido hasta hace pocos días) al conocer el error de diseño en la circuitería de la controladora SATA2 integrada en todos los nuevos chipsets de la serie 6 de Intel (H67, P67 y sus derivados) destinados a albergar los nuevos procesadores Sandy Bridge (los stepping comerciales B2 son los afectados por el bug, no los previos A stepping que van de maravilla…)

DSCF1063Intel P67 chipset.

Efectivamente este hecho deja a Intel sin ninguna plataforma sobre la que montar sus nuevos procesadores.

Si somos poseedores de una de estas nuevas CPUs debemos intentar devolverla o reservarla hasta que, a finales de Abril o principios de Mayo, Intel tenga disponible una nueva revisión de silicio del chipset (la B3 o C) sobre la que la podamos montar.

Consideraciones personales a parte, debo resaltar que me parece extraño que un fallo de funcionamiento tan grave haya pasado desapercibido a los bien dimensionados y entrenados sistemas de validación en Intel Corp.

Esquema del chipset P67 Cougar Point.

Como antes he comentado son todas las placas base a la venta las afectadas por el bug y esto ha forzado a Intel y a todos sus partners (OEMs y fabricantes de placas base) a realizar un recall masivo de todos estos componentes.

A nadie se le escapa que todos estos acontecimientos son un balón de oxígeno inesperado para AMD, que está pasando ciertas dificultades en llevar a producción masiva sus dos nuevos diseños de 32 nm fabricados en Global Foundries, Llano y su nueva microarquitectura Bulldozer.

Todos recordamos el desafortunado TLB bug que lastró gravemente a AMD y retrasó la salida al mercado de los procesadores Phenom de 65 nm (core Barcelona) y que, por otra parte, le costó ingentes cantidades de dinero.

La explicación de Intel

Intel define el fallo como una degradación progresiva y continua de la tasa de errores de transmisión en las líneas SATA2 integradas en los chipsets de la serie 6.

imagehttp://www.intel.com/support/chipsets/sb/CS-032263.htm

Inicialmente esto se puede notar en un progresivo deterioro del rendimiento de las operaciones del sistema de archivos sobre los dispositivos conectados en los cuatro puertos SATA2 nativos de la placa base debido a una tasa de errores de bit elevada que inicialmente se soluciona mediante correcciones ECC.

Posteriormente llegará a una degradación tal que sea necesario retransmitir los datos, desde el disco a la controladora o viceversa al hallarse corrupción en los datos, con la consiguiente reducción de rendimiento en tiempos de acceso y en transferencia.

En un último estadio podemos llegar a perder una unidad de disco (su letra) en Windows durante el normal uso de nuestro PC dando lugar a errores de escritura demorada y finalmente incluso a la no detección del dispositivo durante las rutinas de arranque de la placa base (POST).

Debo agregar que en mi experiencia personal, cuando se dan frecuentes retransmisiones de datos (retries) debidas a errores de transmisión (corrupción de datos) se acorta claramente la vida del disco duro por trabajar fuera de especificación (no han sido diseñados para tal caso excepcional).

La explicación técnica oficial

Se trata de un mal diseño en una de las máscaras que se utilizan en las últimas etapas de litografía del wafer de silicio con tecnología de 65 nm. Posteriormente tras el corte de los chips formarán cada uno de ellos un chipset de la serie 6.

Es un típico caso de electromigración. Según Intel, han localizado un transistor perteneciente al árbol de distribución de reloj (clock tree) de la controladora SATA2 que tiene un espesor de gate demasiado bajo provocando un leakage excesivo. Sencillamente, se fugan electrones a través del transistor y conforme utilizamos la controladora SATA2 se deterioran sus características eléctricas más y más…

P67

Conclusiones y algunas consideraciones

No existe solución milagrosa para el problema (ni parches en BIOS ni nada), así que la única opción ha sido retirar todos los chipsets afectados del mercado e intentar, lo más rápido posible, fabricar un sustituto sin fallos. Esto será un hecho seguramente a finales de Abril o principios de mayo, hasta entonces no hay Sandy Bridge…

En resumen, a día de hoy no existe plataforma para los nuevos procesadores Sandy bridge, con lo que quedan dos opciones: los excelentes Core i7 de la serie 900 o los magníficos AMD Phenom II X6 de seis cores nativos.

Por suerte algunos afortunados gozan de early samples de chipsets P67 stepping A libres del error que funcionan a la perfección y con absoluta estabilidad… lo que yo me pregunto es como en un stepping posterior ha aparecido este fallo “de la nada”.

Como moraleja de la historia quizás deberíamos todos reflexionar acerca, valga la redundancia, de la calidad de los controles de calidad que se aplican en la actualidad en todos los ámbitos.

Fritz_2600K_NominalResultados como este desafortunadamente tendrán que esperar a Abril o Mayo…

Si consideras útil el contenido de este Blog, ayuda a mantenerlo ojeando algunas de las ofertas que consideres interesantes de nuestros anunciantes. Gracias de antemano.

El que tenga dudas o aportaciones tiene para ello la sección de comentarios, intentaré responder a todos y con la máxima claridad. Los Blogs deben de ser lugares de intercambio y agradezco vuestro feedback.

Bibliografía complementaria:

Datasheet: http://www.intel.com/Assets/PDF/datasheet/324645.pdf

Themal Design guide: http://www.intel.com/Assets/PDF/designguide/324647.pdf

Specification update: http://www.intel.com/Assets/PDF/specupdate/324646.pdf

Políticas de los fabricantes de placas base:

ASUS: http://event.asus.com/2011/SandyBridge/notice/

GigaByte: http://gigabytedaily.blogspot.com/2011/02/intel-6-series-chipset-issues-q.html

ASRock: http://www.asrock.com/news/events/201102ex/index.html

Carlos Yus Valero – informaticapremium      informaticapremium-logo-150px

Sandy Bridge fuera de especificación 4.0, 4.4 y 4.6 GHz. Actualizado. – ProfessionalSAT

En este artículo os ofrezco las prestaciones en CineBench R11.5 (Descarga la última versión) de tres Sistemas de Altas Prestaciones fuera de especificación. El primero un Core i7 930 D0 con un triple channel DDR3, el segundo un AMD Phenom II X6 a 4 GHz y por último el novísimo procesador Sandy Bridge Core i7 2600K. Estas dos últimas máquinas cuentan con un más convencional dual channel DDR3.

CBR11.5CineBench R11.5.

Para un análisis en profundidad de la microarquitectura subyacente en estos nuevos procesadores os recomiendo varios de mis artículos en LowLevelHardware, mi Blog más técnico:

- Microarquitectura Intel Sandy Bridge. Parte 1. Actualizado – LowLevelHardware
- Previo Intel Sandy Bridge. Actualizado – LowLevelHardware
- Intel Sandy Bridge versus Westmere die. Actualizado – LowLevelHardware
- Micrografía detallada de Intel Sandy Bridge – ProfessionalSAT
- Intel Sandy Bridge. Introducción – ProfessionalSAT

Actualización 19 de Enero 2011: Adición de resultados CineBench R11.5 multithreaded del AMD Phenom II X6 fuera de especificación a 4 GHz con NorthBridge y caché L3 de 6 MB ajustados a 2.82 GHz.

Actualización 21 de Enero 2011: Adición de la sección de escalado multithread y comentarios generales sobre microarquitectura del AMD Phenom II y futuras mejoras en AMD. Corrección de algunos errores gráficos.

Sistema Nehalem Core i7 930 D0 Quadcore

Sobre este procesador y sus hermanos de gama he basado durante ya más de dos años mis Sistemas de Altas prestaciones. Se trata de CPUs que desde los primeros steppings han mostrado un rendimiento IPC excelente además de un extremo potencial en frecuencia, llegando en los samples más afortunados a los ajustes que aquí se detallan.

El primer sistema consta de 3 módulos de 2 GB DDR3 configurados en triple channel a una frecuencia efectiva de 1451 MHz con latencias 7-7-7-14-1N.

SandyB_Nehalem_WestmereNehalem (izquierda) vs. Sandy Bridge (derecha).

La frecuencia de los cores es de 4 GHz con máxima carga de 8 threads y de hasta 4.2 GHz con carga de 1 thread (ambas frecuencias son sostenidas y estables en carga 100%).

Por su parte, el uncore (controladoras de memoria y otros buses internos) y la caché L3 de 8 MB están fijados a 3.439 GHz.

Sistema AMD Phenom II X6 Hexacore

El procesador Phenom II X6 está configurado a una frecuencia constante de 4 GHz (desde los 2.8 GHz nominales) mediante un bus de 282 MHz y un multiplicador X14. El Turbo Core permanece deshabilitado.

El North Bridge (que comprende la caché L3 de 6 MB y 48 vías y los buses y controladoras de memoria) está ajustado a 2.82 GHz (desde los 2 GHz nominales) mediante un multiplicador X10.

La memoria de esta máquina consta de 2 DIMM DDR3 1600 para un total de 8 GB ajustados a 1503 MHz con latencias 7-7-7-21 1T.

Sistema Sandy Bridge Core i7 2600K Quadcore HT

El subsistema de memoria consta de 2 DIMM de 4 GB DDR3 configurados a 1600 MHz con latencias 9-9-9-24 (nominales).

SB_Die_630Sandy Bridge quad core.

La frecuencia de los cores está fijada respectivamente a 4.0,  4.4 y 4.6 GHz. La caché LLC de 8 MB es síncrona a los cores, funciona a su misma frecuencia y está dividida en cuatro bancos de 2 MB y 16 vías de asociatividad.

Refrigeración de los procesadores

Debido a que utilizo los voltajes más bajos dentro de lo posible (siempre garantizando una total estabilidad de los equipos) la disipación térmica está realmente controlada.

Esto no supone un grave problema para los conjuntos ventilador – radiador utilizados, se trata de los famosos Scythe Mugen 2 B configurados con dos ventiladores Slip Stream de 12 cm en configuración push – pull.

Resultados CineBench R11.5

Designación Frecuencia 1 thread Multithreaded SpeedUp
Intel Core i7 2600K 3,4 / 3,8 GHz 3,4 / 3,8 GHz 1,55 6,96 4,49 X
Intel Core i7 2600K 4,0 GHz 4,0 GHz 1,62 7,82 4,82 X
Intel Core i7 2600K 4,4 GHz 4,4 GHz 1,76 8,61 4,89 X
Intel Core i7 2600K 4,6 GHz 4,6 GHz 1,86 8,91 4,83 X
Intel Core i7 930 D0 4,0 / 4,2 GHz 4,0 / 4.2 GHz 1,45 6,88 4,74 X
AMD Phenom II X6 1090T 4 GHz 4,0 GHz 1,25 7,07 5,66 X
Nehalem, Thuban y Sandy Bridge fuera de especificación.

Sobran los comentarios, el nuevo procesador Sandy Bridge supera en modo nominal al flamante Core i7 930 configurado fuera de especificación a 4 / 4.2 GHz (su límite práctico en frecuencia a voltajes pensados para utilización 24h).

El Phenom II X6 se defiende agresivamente gracias a sus 6 cores físicos y da un excelente resultado multithreaded que supera al Core i7 930 a 4 GHz con Hyper Threading y al nuevo Core i7 2600K “de serie” aunque se mantiene a una distancia respetable de los inalcanzables procesadores Sandy Bridge fuera de especificación.

imageCineBench R11.5. Resultados gráficos.

Tened en cuenta que el sistema i7 930 es ya de por sí sumamente rápido pero sin duda Sandy Bridge marca un hito prestacional y eclipsa definitivamente a Nehalem pese a contar solamente con un dual channel DDR3 1600 frente al triple channel 1451 MHz de Nehalem.

Además Nehalem cuenta en esta prueba con una frecuencia en su Uncore y caché L3 aumentada a 3.44 GHz desde los 2.66 nominales, lo que le ayuda en gran medida.

Escalado multicore / multithread

En esta sección analizo el incremento de velocidad de cálculo aumentando el número de threads desde 1 al máximo soportado por el procesador.

El AMD Phenom II X6 soporta seis threads, uno por core.

Tanto los Core i7 930 como los nuevos Core i7 2600K soportan 8 threads, dos threads por cada core físico (4 cores, 4 threads).

imageEscalado prestacional multihilo en CineBench R11.5.

Empezando por el procesador AMD Phenom II X6 constato un excelente escalado acercándose mucho al valor máximo teórico de 6X, quedando en 5.66X lo que dice mucho del excelente trabajo realizado por los ingenieros de AMD respecto al acceso concurrente de todos los cores hacia la caché L3 y los dos canales DDR3.

Sin duda AMD, con un SMT al estilo de Intel, superaría un factor de 6X y estaríamos rondando el 7.5X para un score multithreaded sobre los 9 puntos, rondando o superando la velocidad de cálculo del Core i7 2600K a 4.6 GHz.

De todos modos donde AMD debería poner énfasis es en su IPC por core, muy inferior al de Intel (sobre un 20 – 30 %) y especialmente en refinar su Branch Prediction y aumentar la asociatividad de sus cachés L1.

Respecto a los dos procesadores de Intel, señalar que gracias a Hyper Threading (el SMT de dos vías implementado en ellos) consiguen superar el factor de 4X (factor máximo para un quad core) y acercarse prácticamente a un escalado de 5X. También un remarcable resultado.

Poco más puede decir… se acabó la era Nehalem…

Si consideras útil el contenido de este Blog, ayuda a mantenerlo ojeando algunas de las ofertas que consideres interesantes de nuestros anunciantes.

Carlos Yus Valero – informaticapremium informaticapremium-logo-150px[3]