メインコンテンツへスキップ
サポート・ナレッジベース

モデルに異なる重みを適用すると、推論パフォーマンスに影響するのはなぜですか?

コンテンツタイプ: トラブルシューティング   |   記事 ID: 000088030   |   最終改訂日: 2026/03/09

詳細

同じモデル・アーキテクチャーを異なるウェイトファイルで実行すると、異なる推論スループットが観察されました。モデル構造は同じですが、推論パフォーマンスは重み、精度、および使用される表現によって大きく異なります。

解決方法

モデルの重みと精度 (FP32、FP16、INT8) は推論パフォーマンスに影響します。

FP32 形式を使用すると、重量が完全に分散され、単精度浮動小数点と呼ばれます。

一方、FP16 形式と INT8 形式はどちらも圧縮ウェイト形式であり、サイズが小さくなるように圧迫されています。これらの圧縮のトレードオフは、量子化誤差とも呼ばれるモデルの精度です。
データを表すために割り当てられるビットが多いほど、表現できる範囲が広がり、モデルの精度が向上する可能性があります。しかし、データが大きくなればなるほど、ストレージ用のメモリースペースが大きくなり、データの転送に必要なメモリー帯域幅が大きくなり、コンピューティング・リソースと時間が消費されます。

インテル® ディストリビューションの OpenVINO™ ツールキットベンチマーク 結果 では、異なるウェイトフォーマットや精度間のパフォーマンスの明らかな違いが示されています。

関連製品

本記事は、1 製品に適用します。

免責条項

このページのコンテンツは、元の英語のコンテンツを人力翻訳および機械翻訳したものが混在しています。この内容は参考情報および一般的な情報を提供するためものであり、情報の正確さと完全性を保証するものではありません。インテルは不正確な翻訳があった場合でもいかなる責任を負いません。このページの英語版と翻訳の間に矛盾がある場合は、英語版に準拠します。 このページの英語版をご覧ください。