Commits · a1f49a2b92b6fa022379bbebafed9d7f5e96a675 · gaoqiong / flash-attention

25 Dec, 2022 1 commit
- Implement Tensor Parallel for transformer Block · a8cfe515
  Tri Dao authored Dec 25, 2022
  
  a8cfe515
13 Dec, 2022 1 commit
- [LayerNorm] Support taking subset of input or subset of output · 5db33051
  Tri Dao authored Dec 12, 2022
  
  5db33051
11 Dec, 2022 1 commit
- [LayerNorm] Fuse LayerScale · ae137ed1
  Tri Dao authored Dec 10, 2022
  
  ae137ed1
09 Dec, 2022 1 commit
- [LayerNorm] Support all dimensions up to 6k (if divisible by 8) · 8c6609ae
  Tri Dao authored Dec 08, 2022
  
  8c6609ae
29 Nov, 2022 1 commit
- Release training code · 0bf5e500
  Tri Dao authored Nov 28, 2022
  
  0bf5e500
17 Nov, 2022 1 commit
- [LayerNorm] Compile for both sm70 and sm80 · 39ed597b
  Tri Dao authored Nov 17, 2022
  
  39ed597b
15 Nov, 2022 2 commits
- Mention that some CUDA extensions have only been tested on A100s · 43ab0b52
  Tri Dao authored Nov 15, 2022
  
  43ab0b52
- [LayerNorm] Check cuda error after querying ctas_per_sm · e4d3013e
  Tri Dao authored Nov 15, 2022
  
  e4d3013e
14 Nov, 2022 2 commits
- Add GPT and ViT models · 2e33fc8e
  Tri Dao authored Nov 13, 2022
  
  2e33fc8e
- Add fused_dense and dropout_add_layernorm CUDA extensions · fa6d1ce4
  Tri Dao authored Nov 13, 2022
  
  fa6d1ce4