-
-
Notifications
You must be signed in to change notification settings - Fork 22.2k
All issues
Issue creation is restricted in this repository
Issues
is:issue state:open
is:issue state:open
Search results
[Bug]: Qwen/Qwen1.5-MoE-A2.7B-Chat produces degenerate output with torch.compile (VLLM_COMPILE) but correct output without it on vLLM 0.28.0 (H100, torch 2.13.0+cu130); CUDA graphs, compile cache and custom_ops make no difference
qwenRelated to Qwen modelsRelated to Qwen modelsStatus: Open.#56900 In vllm-project/vllm;- Status: Open.#56896 In vllm-project/vllm;
- Status: Open.#56894 In vllm-project/vllm;
[Bug/Perf] DeepSeek-V4.1-Flash on SM120 (RTX PRO 6000 Blackwell, 8xTP): extremely low decode throughput with --enforce-eager; CUDA graphs unusable — please prioritize SM120 graph capture fix
deepseekRelated to DeepSeek modelsRelated to DeepSeek modelsDSv4.1Related to DeepSeek-V4.1 modelsRelated to DeepSeek-V4.1 modelsStatus: Open.#56892 In vllm-project/vllm;[Bug]: HiSparseConnector produces incoherent outputs on GLM-5.2 DEP8
bugSomething isn't workingSomething isn't workingStatus: Open.#56889 In vllm-project/vllm;- Status: Open.#56887 In vllm-project/vllm;
- Status: Open.#56880 In vllm-project/vllm;
- Status: Open.#56871 In vllm-project/vllm;
[Bug]: GLM-5.3-Flash long-decode degeneration after accumulated reasoning decode
bugSomething isn't workingSomething isn't workingStatus: Open.#56868 In vllm-project/vllm;- Status: Open.#56860 In vllm-project/vllm;
- Status: Open.#56851 In vllm-project/vllm;
[Feature]: Add decode-priority prefill cadence for single-node decode ITL
feature requestNew feature or requestNew feature or requestStatus: Open.#56847 In vllm-project/vllm;