flash-attn 编译

编译环境要求

1
2
Visual Studio
CUDA

前置

1
2
3
4
:: 强制启用多线程极速编译引擎
:: 安装编译所需的辅助库(必须包含 ninja)
pip install ninja build setuptools wheel
pip install ninja packaging setuptools

编译工具

1
2
x64 Native Tools Command Prompt for VS 2022
微软专门预先配置好 C++ 编译环境的专用终端

设置

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
::进入 sd-scripts 目录并激活虚拟环境
cd /d G:\lora\sd-scripts-0.11.1\sd-scripts-0.11.1
call venv\Scripts\activate

::设置 CUDA 路径与算力限制 (RTX 40 系显卡为 8.9)
set CUDA_HOME=C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v12.4
set TORCH_CUDA_ARCH_LIST=8.9
set FLASH_ATTENTION_FORCE_BUILD=TRUE

::告诉 PyTorch 已经在使用激活好的 Visual Studio SDK(解决本次报错的关键)
set DISTUTILS_USE_SDK=1

::限制编译线程数(防止内存溢出)
set MAX_JOBS=4

::开始编译安装
pip install flash-attn --no-build-isolation

flash-attn 编译
https://fu01.github.io/posts/baa81329/
作者
Fu01
发布于
2026年8月13日
许可协议