LLM推論初出 5/26 22:26
TLX Block Attention: 固定ブロック疎自己注意のためのWarp-Specialized Blackwell Kernel
TLX Block Attention: A Warp-Specialized Blackwell Kernel for Fixed-Block Sparse Self-Attention
https://pytorch.org/feed/2026/5/26
AI要約
NVIDIA Blackwell GPUに特化したTritonカーネルであるTLX Block Attentionの設計について解説。固定ブロック疎行列自己注意機構のコンパイル時知識を活用し、LLM推論の効率化を目指す。GitHubでコードも公開されている。