• laibao's avatar
    • feat(qwen3):新增 vLLM 内置 RMS+RoPE 融合算子,并支持 LightOp 后端切换 · 588538f5
    laibao authored
      - 在 vLLM _C 扩展中新增 rms_rotary_embedding_fuse(注册 op + CUDA kernel),减少对 LightOp 的硬依赖
      - 新增环境变量 VLLM_FUSED_RMS_ROPE_BACKEND=auto|vllm|lightop,auto 优先走 vLLM,缺失时回退 LightOp
      - 更新 Qwen3 / Qwen3-MoE 的 fused 路径按后端选择执行
      - 补充 tc_opt benchmark 结果解析脚本 benchmarks/tc_opt/test/parse_bench_results.py
    588538f5
torch_bindings.cpp 35.7 KB