モデルに異なる重みを適用すると、推論パフォーマンスに影響するのはなぜですか?
コンテンツタイプ: トラブルシューティング | 記事 ID: 000088030 | 最終改訂日: 2026/03/09
同じモデル・アーキテクチャーを異なるウェイトファイルで実行すると、異なる推論スループットが観察されました。モデル構造は同じですが、推論パフォーマンスは重み、精度、および使用される表現によって大きく異なります。
モデルの重みと精度 (FP32、FP16、INT8) は推論パフォーマンスに影響します。
FP32 形式を使用すると、重量が完全に分散され、単精度浮動小数点と呼ばれます。
一方、FP16 形式と INT8 形式はどちらも圧縮ウェイト形式であり、サイズが小さくなるように圧迫されています。これらの圧縮のトレードオフは、量子化誤差とも呼ばれるモデルの精度です。
データを表すために割り当てられるビットが多いほど、表現できる範囲が広がり、モデルの精度が向上する可能性があります。しかし、データが大きくなればなるほど、ストレージ用のメモリースペースが大きくなり、データの転送に必要なメモリー帯域幅が大きくなり、コンピューティング・リソースと時間が消費されます。
インテル® ディストリビューションの OpenVINO™ ツールキットベンチマーク 結果 では、異なるウェイトフォーマットや精度間のパフォーマンスの明らかな違いが示されています。