跳转到主要内容

AMX 指令

Intel AMX 的 Tile 寄存器、TMUL、低精度输入与宽精度累加合同

· 约 1 分钟阅读

1. BF16

其结构如下图所示: BF16 的 sign、exponent 与 mantissa 位布局

2. AMX 的执行模型

AMX 的核心是把矩阵分块放进二维 Tile register,再由 TMUL 执行矩阵乘累加。第一代 AMX 包含 AMX-TILEAMX-INT8AMX-BF16;具体处理器支持哪些扩展,仍需通过 CPUID、操作系统和运行库核对。

  • Tile register file 包含 TMM0TMM7
  • 每个 Tile 最大为 16 行 × 64 byte = 1 KiB
  • AMX-INT8 使用 INT8 operand,并累加到 INT32。
  • AMX-BF16 使用 BF16 operand,并累加到 FP32。

这体现了低精度矩阵计算的通用合同:

窄精度输入
→ 专用 tile 矩阵乘
→ 更宽精度累加
→ 高精度或目标格式输出

它与 GPU Tensor Core 的数学结构相似,但并行规模、存储层次、数据布局和 Kernel 调度不同。面向 LLM 量化的完整对照见从 AVX/AMX 到 Tensor Core

参考资料

修改历史12 次提交