EdigE
← ЛЕНТА
TOOLS · 25.06.2026

LineShine: 2,188 EFLOPS на CPU-only ARMv9 и 13,79 млн ядер

2.198 EFLOPS FP64 Linpack при 42.22 MW показал LineShine, возглавив июньский TOP500. Система построена на 45 360 процессорах LX2 с 304 ядрами Armv9; GPU-ускорители в конфигурации отсутствуют. Публичные цифры раскрывают сильную локальную память процессора, но одновременно фиксируют заметный разрыв между HPL и HPCG.

Китайский суперкомпьютер LineShine занял первое место в июньском рейтинге TOP500 с результатом 2.19840 EFLOPS в HPL двойной точности. Пиковая паспортная производительность указана на уровне 2.73582 EFLOPS, поэтому эффективность Linpack составляет около 80.4%. В карточке TOP500 приведены 13 789 440 вычислительных ядер, 42.22 MW потребления и 52.07 GFLOPS/W. Это первый лидер рейтинга, преодолевший 2 EFLOPS sustained FP64 HPL на CPU-only архитектуре.

Машина использует 45 360 процессоров LingKun LX2 с частотой 1.55 GHz. Каждый LX2 содержит 304 ядра Armv9, организованные в два вычислительных кристалла по 152 ядра. В опубликованных технических описаниях кристаллы разделены на восемь 38-ядерных кластеров. Такая топология задаёт NUMA-границы и объясняет часто неверно цитируемую конфигурацию памяти: 4 GB HBM и 32 GB DDR относятся к одному кластеру, а не к полному процессору.

На уровне LX2 доступно 32 GB HBM с заявленной суммарной пропускной способностью 4 TB/s и 256 GB внешней DDR. Двухсокетный узел, описанный в работах с использованием LineShine, получает 64 GB HBM и 512 GB DDR. Для векторных и матричных вычислений применяются расширения SVE и SME. Важная особенность такой компоновки состоит в близости HBM к вычислительным кластерам: размещение массивов и обмен между NUMA-доменами становятся прямыми факторами производительности, особенно для разреженных операторов, stencil-кодов и задач с нерегулярным доступом.

Результат HPCG составляет 22.0049 PFLOPS, около 1.0% от HPL-показателя. Разница ожидаема для тестов, где возрастают доля памяти, синхронизаций и сетевых обменов, однако детальных данных о латентности и пропускной способности межсоединения LingQi в открытой карточке TOP500 нет. Исследовательские публикации, связанные с системой, указывают 1.6 Tb/s сетевой ввод-вывод на узел и двухплоскостную многорельсовую fat-tree-топологию, но независимые измерения bisection bandwidth, MPI collectives и инъекционной скорости пока не опубликованы.

В HPL-MxP LineShine достиг 7.92 EFLOPS и занял четвёртую позицию. Этот тест использует смешанную точность с последующей проверкой FP64 и лучше отражает сценарии плотной матричной обработки. Отставание от трёх систем с ускорителями показывает специализацию нынешней конфигурации на массовом FP64-вычислении, хотя LX2 располагает собственными матричными инструкциями SME.

Есть и несогласованность в публичных описаниях масштаба. Один из апрельских препринтов описывает 20 480 двухсокетных узлов, что даёт 40 960 LX2 и 12.452 млн ядер. Итоговая запись TOP500 содержит 13.789 млн ядер, соответствующих 45 360 процессорам. Вероятным объяснением остаётся расширение доступной партиции между прикладными запусками и рейтингом, однако точная конфигурация HPL-прогона не раскрыта. Для инженерной оценки платформы остаются критичными результаты STREAM, OSU, FFT, sparse и stencil-нагрузок вместе с методикой измерения 42.22 MW на уровне стоек и охлаждения.