Skip to content
GitLab
Explore
Sign in
我发现用大脑思考不需要token
2026pra-qwen-infra
Repository
Branches
Overview
Active
Stale
All
submit/v3.0
default
11c7f446
·
perf(attention):为3D Decode固定BM16/T16/S256配置
·
Jul 14, 2026
workspace
ef818d29
·
提交文档2
·
Jul 14, 2026
submit/v2.9
97869b07
·
perf(rocm):优化Qwen3.5 GDN prefill路径
·
Jul 13, 2026
submit/v2.8
3a2d0601
·
perf(rocm):优化Qwen3.5 Prefill gate_up投影
·
Jul 13, 2026
submit/v2.7
f958b918
·
perf(prefill):为Qwen3.5引入连续KV镜像与混合FA路由
·
Jul 12, 2026
submit/v2.6
eb40282d
·
perf(rocm):优化Qwen3.5 LM head的decode GEMV路由
·
Jul 12, 2026
submit/v2.5
abba9729
·
perf(rocm):优化Qwen3.5 4096-token gate-up投影
·
Jul 11, 2026
submit/v2.4
be6637ec
·
perf(gemm):调参NUM_THREADS=5120
·
Jul 11, 2026
submit/v2.3
d0b1ce1f
·
perf(decode):调参MIN_LAUNCH_GRID_SIZE_2D = 128
·
Jul 11, 2026
submit/v2.1
ee1e0667
·
perf(decode):rows_per_block参数微调
·
Jul 08, 2026
submit/v2.2
4045de9f
·
perf(rocm): 添加 Qwen3.5 MLP 填充 rocBLAS GEMM
·
Jul 08, 2026
submit/v2.0
0a27664a
·
perf(prefill):使TILE_SIZE默认为16,增加环境变量
·
Jul 06, 2026
submit/v1.2
f7a8de62
·
perf(GEMM):调整LLMM1 kernel使down_proj走LLMM1路径
·
Jul 01, 2026
submit/v1.1
ab94c4b3
·
fix:取消注释 _rocm_C extension构建
·
Jun 30, 2026
submit/v1
9097a14f
·
perf(attention_ops): 调整triton unified attention中的BLOCK_M参数并增加相关编译变量
·
Jun 24, 2026
submit/baseline
protected
01d6aad6
·
chore: import SourceFind v0.18.1 snapshot
·
Jun 20, 2026