arXiv (ML)AI
TITLE_JA: テンソルカーネルの演算子対応混合精度許容度キャリブレーション
Operator-Aware Mixed-Precision Tolerance Calibration for Tensor Kernels
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
テンソルカーネルの正確性テストは、多くの場合、手作業で選定された絶対許容度と相対許容度を用いた固定形状の「allclose」スタイルのチェックに依存してきました。これらの閾値は複数のテストケースにコピーされ、ほとんど見直されることがありません。本研究は、クラウドGPUの実行環境から蓄積されたデータを分析し、より科学的なアプローチを提案しています。
研究チームはgpuemuコーパス(26個のエントリを含む)と2つのデータ型にわたる8,076行の結果を対象に、全テストケースの要素ごとの誤差分布を抽出しました。その後、重要な実証的問題を提起しました。すなわち、正しく実装されたカーネル自体が正当化できる絶対許容度はいくらか、というものです。
分析の結果、現在手作業で選定されている許容度よりもはるかに厳密な閾値が得られることが判明しました。特に、attention_triton fp16では、許容度を2,184倍も厳密にすることができました。LLMスタイルのバグを含む7つのバリアントに対して、演算子とデータ型ごとにキャリブレーションされた許容度を適用すると、バグ検出の再現率は73.2%(2,467中1,805件)から82.4%(2,467中2,034件)に向上し、絶対的には9.3ポイント、新たに229件のバグ検出が可能になりました。
一方、偽陽性の増加は抑制され、1,882個の正常コントロールケースのうち、0件から20件への増加(+1.1ポイント)に留まりました。この手法により、テンソル演算の信頼性向上と効率的なバグ検出が実現される可能性を示しています。