Test no vllm custom allreduce (#4210)

2cadd51d · Lianmin Zheng · GitHub · 4a893d14 · 2cadd51d · 2cadd51d
Unverified Commit 2cadd51d authored Mar 08, 2025 by Lianmin Zheng Committed by GitHub Mar 08, 2025
Hide whitespace changes
Inline Side-by-side

Showing with 6 additions and 2 deletions

.github/workflows/pr-test.yml .github/workflows/pr-test.yml +2 -0

test/srt/test_bench_one_batch.py test/srt/test_bench_one_batch.py +4 -2

No files found.
--- a/.github/workflows/pr-test.yml
+++ b/.github/workflows/pr-test.yml
@@ -269,6 +269,8 @@ jobs:
          cd test/srt
          python3 -m unittest test_bench_one_batch.TestBenchOneBatch.test_moe_tp2_bs1

+          USE_VLLM_CUSTOM_ALLREDUCE=0 python3 -m unittest test_bench_one_batch.TestBenchOneBatch.test_moe_tp2_bs1
+
      - name: Benchmark single latency + torch.compile (TP=2)
        timeout-minutes: 10
        run: |

--- a/test/srt/test_bench_one_batch.py
+++ b/test/srt/test_bench_one_batch.py
@@ -11,7 +11,9 @@ from sglang.test.test_utils import (

 class TestBenchOneBatch(unittest.TestCase):
    def test_bs1(self):
-        output_throughput = run_bench_one_batch(DEFAULT_MODEL_NAME_FOR_TEST, [])
+        output_throughput = run_bench_one_batch(
+            DEFAULT_MODEL_NAME_FOR_TEST, ["--cuda-graph-max-bs", "2"]
+        )

        if is_in_ci():
            write_github_step_summary(
@@ -22,7 +24,7 @@ class TestBenchOneBatch(unittest.TestCase):

    def test_moe_tp2_bs1(self):
        output_throughput = run_bench_one_batch(
-            DEFAULT_MOE_MODEL_NAME_FOR_TEST, ["--tp", "2"]
+            DEFAULT_MOE_MODEL_NAME_FOR_TEST, ["--tp", "2", "--cuda-graph-max-bs", "2"]
        )

        if is_in_ci():