Intel Sandybridge ファミリ CPU のパイプラインのプログラムを逆最適化する
目標:インテル i7 Pipeline.
問題:
課題には、砥石プログラムまたはモンテカルロ プログラムの 2 つのオプションがありました。学生はモンテカルロ シミュレーション プログラムを選択しましたが、悲観的な取り組みによってコードの実行時間が 1 秒増加しただけです。
質問:
どうすれば学生はさらに悲観化できますかより重要なことを達成するためのコード
答え:
一般的な戦略:
- 予測ミスのペナルティを増やすために予測不可能な分岐を導入します。
- ループで運ばれる依存関係チェーンを長くして削減します命令レベルの並列処理。
- より遅い FP 演算と div、特に exp 関数と log 関数を使用します。
Uarch 固有のアイデア:
組み込み関数を使用する():
- movnti を使用してキャッシュからデータを削除します。
- バイパス遅延を引き起こすには、FP 演算の間に整数シャッフルを使用します。
- SSE 命令と AVX 命令を使用せずに混合することは避けてください。 vzeroupper.
with (インライン) asm:
- 強制的にアライメントの問題を発生させて uop キャッシュを破壊します。
- Use self-パイプラインをトリガーするようにコードを変更する
キャッシュミスとメモリ速度低下の誘発:
- ストア転送ストールを引き起こす狭いストアを実行します。
- 置換メモリを制御するための大きな構造体のメンバーを含むローカル変数レイアウト。
- キャッシュ ミスとページ分割ロードを増やすようにメモリ レイアウトを調整します。
- キャッシュラインまたはページの境界にまたがるには、位置合わせされていない変数を使用します。
- 非配列で配列をループします。 -連続した順序。
- 代わりにリンクされたリストの使用を検討してください。配列。
その他のテクニック:
- std::atomic を使用するアトミック操作を遅くするためのループ カウンタ。
- コード生成を強制的に遅くするには、-m32 または -march=i386 を指定してコンパイルします。
- さらに遅くするには、精度の低い Long Double 計算を強制します。
- 異なる CPU への CPU アフィニティを頻繁に設定します。
- 過剰なシステムを実装します。
最後のメモ:
- これらの手法はコードの速度を効果的に低下させますが、その「悪魔のような無能さ」のレベルは依存します。
- 課題の講師は、学生にパイプラインの危険性と依存関係について学ぶよう意図したのかもしれません。これらのテクニックを単に盲目的に適用するよりも優れています。
以上がIntel Sandybridge ファミリ CPU での実行速度を大幅に低下させるために、モンテカルロ シミュレーションをさらに最適化するにはどうすればよいでしょうか?の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。