Lsglang
Lsglang is a special extension of sglang that fully utilizes CPU and GPU computing resources with an efficient GPU parallel + NUMA parallel architecture, suitable for MOE model hybrid inference.
파일 탐색기
최종 버전 다운로드 (.zip)파일 수가 많아 일부만 표시됩니다. 전체 파일은 위 다운로드 버튼으로 확인해 주세요.
- forward-batch-init-new-purity.md
- general-code-style.md
- modify-component-must-read.md
- no-dataclasses.md
- no-getattr-defensive.md
- schedule-batch-out-of-place-mutation.md
- unit-test-admission.md
- SKILL.md
- SKILL.md
- openai.yaml
- SKILL.md
- SKILL.md
- SKILL.md
- SKILL.md
- authoring-reference.md
- engine-axis.md
- mintlify-authoring.md
- vendor-logo.md
- benchmarks.jsx.tmpl
- config.jsx.tmpl
- page.mdx.tmpl
- SKILL.md
- dimension-mapping.md
- SKILL.md
- SKILL.md
- SKILL.md
- SKILL.md
- SKILL.md
- SKILL.md
- SKILL.md
- fuse-overlap-catalog.md
- heuristics.md
- overlap-catalog.md
- source-map.md
- vllm-torch-compile-fusions.md
- analyze_llm_torch_profile.py
- analyze_sglang_torch_profile.py
- make_trtllm_py_executor_override.py
- probe_llm_server.py
- profile_common.py
- render_triage_markdown_bundle.py
- run_llm_single_model_matrix_host.sh
- run_sglang_torch_profile_host.sh
- run_trtllm_pytorch_profile_host.sh
- run_vllm_torch_profile_host.sh
- triage_kernel_helpers.py
- triage_overlap_helpers.py
- SKILL.md
- conftest.py
- generator_testlib.py
- test_infer_extract_functions.py
- test_infer_extracts.py
- test_infer_imports.py
- test_infer_moves.py
- test_main_single_commit.py
- test_script_and_diff.py
- cli_testlib.py
- conftest.py
- test_classification.py
- test_proof_discovery.py
- test_report.py
- test_skip_passed.py
- test_verify_chain.py
- conftest.py
- reproduction_testlib.py
- test_add_imports.py
- test_call_sites.py
- test_delete_file.py
- test_extract_function.py
- test_extract_symbols_to_new_module.py
- test_extract_to_new_module.py
- test_infra_helpers.py
- test_move_assign.py
- test_move_symbol.py
- test_move_symbol_delegate.py
- test_remove_import.py
- test_remove_imported_name.py
- test_repath_import.py
- test_verify_and_run.py
- mechanical_refactor_proof_generator.py
- mechanical_refactor_reproduction_cli.py
- mechanical_refactor_reproduction_utils.py
- guide-construct-proof.md
- guide-modify-skill.md
- guide-split.md
- guide-verify-proof.md
- SKILL.md
- spec-reproduction-cli.md
- spec-reproduction-utils.md
- SKILL.md
- SKILL.md
- SKILL.md
- case-studies.md
- decision-tree.md
- endpoints-and-signals.md
- replay-trace-profile.md
- incident_artifact_tool.py
- replay_trusted_request_dump.py
- SKILL.md
- SKILL.md
- SKILL.md
- SKILL.md
- devcontainer.json
- Dockerfile
- action.yml
- action.yml
- action.yml
- action.yml
- action.yml
- 1-bug-report.yml
- 2-feature-request.yml
- 3-playground-verified-cell.yml
- lychee-ci.toml
- lychee.toml
- _docker-build-and-publish.yml
- _docker-cleanup-nightly.yml
- _npu-pr-test-stage.yml
- _npu-single-node-test-stage.yml
- _pr-test-check-changes.yml
- _pr-test-rust-ext-build.yml
- _pr-test-sgl-kernel-build.yml
- _pr-test-stage-cpu.yml
- _pr-test-stage.yml
- amd-aiter-scout.yml
- amd-ci-job-monitor.yml
- auto-tune.yml
- bot-bump-docs-version.yml
- bot-bump-flashinfer-version.yml
- bot-bump-kernel-version-to-sglang.yml
- bot-bump-kernel-version.yml
- bot-bump-sglang-version.yml
- bot-cherry-pick.yml
- cancel-pr-workflows-on-close.yml
- cancel-unfinished-pr-tests.yml
- ci-auto-bisect.yml
- ci-coverage-overview.yml
- ci-failure-monitor.yml
- ci-model-inventory.yml
- close-inactive-issues.yml
- close-stale-prs.yml
- diffusion-ci-gt-gen-npu.yml
- diffusion-ci-gt-gen.yml
- full-test-npu.yml
- labeler.yml
- lint.yml
- list-active-pr-runs.yml
- nightly-72-gpu-gb200.yml
- nightly-amd-mi355x-disagg.yml
- nightly-experimental-sgl-router-docker.yml
- nightly-link-check.yml
- nightly-release-gateway.yml
- nightly-test-amd-miles-rocm720.yml
- nightly-test-amd-rocm720.yml
- nightly-test-amd.yml
- nightly-test-intel.yml
- nightly-test-musa.yml
- nightly-test-npu-e2e-multi-node.yml
- nightly-test-npu-e2e-single-node.yml
- nightly-test-npu.yml
- nightly-test-nvidia.yml
- open-pr-copy-from-oss.yml
- open-pr-copy-to-oss.yml
- patch-docker-dev.yml
- pr-benchmark-rust.yml
- pr-gate.yml
- pr-states.yml
- pr-test-amd-extra.yml
- pr-test-amd-rocm720.yml
- pr-test-amd.yml
- pr-test-arm64.yml
- pr-test-extra.yml
- pr-test-jit-kernel.yml
- pr-test-mlx.yml
- pr-test-multimodal-gen.yml
- pr-test-musa.yml
- pr-test-npu.yml
- pr-test-rust-exts.yml
- pr-test-rust.yml
- pr-test-sgl-kernel.yml
- pr-test-sgl-router.yml
- pr-test-xeon.yml
- pr-test-xpu.yml
- pr-test.yml
- release-branch-cut.yml
- release-docker-amd-miles-rocm700-nightly.yml
- release-docker-amd-miles-rocm720-nightly.yml
- release-docker-amd-nightly.yml
- release-docker-amd-rocm720-nightly.yml
- release-docker-amd-rocm7_15-nightly.yml
- release-docker-amd.yml
- release-docker-dev.yml
- release-docker-gateway.yml
- release-docker-intel-xpu-nightly.yml
- release-docker-npu-nightly.yml
- release-docker-npu.yml
- release-docker-runtime.yml
- release-docker-xeon.yml
- release-docker.yml
- release-pypi-gateway.yml
- release-pypi-nightly.yml
- release-pypi-pr.yml
- release-pypi.yml
- release-tag.yml
- release-whl-deepep.yml
- release-whl-deepgemm.yml
- release-whl-kernel-xpu.yml
- release-whl-kernel.yml
- rerun-test.yml
- retag-docker.yml
- runner-utilization.yml
- seed-rust-ext-cache.yml
- slash-command-handler.yml
- stress-test.yml
- sync-lmsys-sglang-blogs.yml
- trivy-scan-dev.yml
- weekly-test-nvidia.yml
- weekly-update-est-time.yml
- xpu-ci-job-monitor.yml
- audit_permission.py
- CI_PERMISSIONS.json
- CODEOWNERS
- FOLDER_README.md
- labeler.yml
- MAINTAINER.md
- pull_request_template.md
- update_ci_permission.py
- client.sh
- install_rpd.sh
- loadTracer.sh
- PROFILING.md
- rpd.patch
- rpd_profile_server_enable.patch
- rpd_profile_server_enable_wCPU_activities.patch
- server.sh
- torch_profiler.patch
- benchmark_moe_rocm.py
- TUNING.md
- build_rocm.sh
- CMakeLists_rocm.txt
- rename_wheels_rocm.sh
- rocm_hipify.py
- pyproject.toml
- README.md
- logo.png
- logo.svg
- logo_square.png
- logo_square.svg
- bench_sglang.py
- README.md
- bench_attention_sink_triton.py
- bench_cutedsl_kda_decode.py
- bench_fused_gate_cumsum.py
- bench_gdn_decode.py
- bench_gdn_prefill.py
- bench_gdn_prefill_cutedsl.py
- bench_gdn_qkv_split.py
- bench_int8_checkpoint_reuse.py
- bench_kda_decode.py
- bench_kda_flashinfer_mtp.py
- bench_kda_prefill_cutedsl.py
- bench_segment_tracking.py
- benchmark_rope_index.py
- 405b_sglang.sh
- 405b_trt.sh
- 405b_vllm.sh
- config.md
- README.md
- bench_sglang.py
- convert_parquet_to_json.py
- parquet_to_json.sh
- README.md
- README.md
- benchmark_layernorm_gated.py
- bench_sglang.py
- README.md
- bench_sglang.py
- README.md
- bench.sh
- bench_client.py
- bench_storage.py
- bench_zerocopy.py
- bench_hicache_write_back.py
- bench_long_context.py
- bench_mix.py
- bench_mix.sh
- bench_multiturn.py
- bench_serving.py
- bench_warm_cache.py
- data_processing.py
- download.sh
- nextqa.py
- perf.py
- README.md
- bench_input_ids_validator.py
- benchmark_aiter.py
- benchmark_aiter.py
- benchmark_all_reduce.py
- benchmark_fused_ar_rms_amd.py
- benchmark_fused_ar_rms_quant_amd.py
- benchmark_mscclpp.py
- benchmark_torch_symm_mem.py
- README.md
- bench_flash_attention_fp8.py
- bench_gdn_replayssm_decode.py
- fa4_benchmark_utils.py
- sm90_config_search.py
- triton_flashinfer_cudnn.py
- deepep_utils.py
- tuning_deepep.py
- benchmark_cute_dsl_fp8_paged_mqa_logits.py
- benchmark_deepgemm_fp8_gemm.py
- benchmark_deepgemm_fp8_gemm_blackwell.py
- benchmark_deepgemm_fp8_group_gemm.py
- benchmark_q8kv8_kv_gather.py
- benchmark_q8kv8_q_prep.py
- README.md
- benchmark_concat_mla.py
- benchmark_fused_collective.py
- README.md
- benchmark_sglang_fused_moe_triton.py
- benchmark_torch_compile_fused_moe.py
- benchmark_vllm_vs_sglang_fused_moe_triton.py
- common_utils.py
- README.md
- tuning_client.py
- tuning_fused_moe_triton.py
- tuning_fused_moe_triton_sep.py
- tuning_text.json
- tune_lora_csgmv.py
- bench_int8_quant.py
- README.md
- tuning_block_wise_kernel.py
- benchmark_get_last_loc_triton.py
- benchmark_write_req_to_token_pool_triton.py
- bench_triton_swa_kernel.py
- bench_verify_splitkv.py
- bench_fused_gate_sigmoid_mul_add.py
- bench_fused_rmsnorm_fp8_quant.py
- bench_fused_sigmoid_mul.py
- bench_paged_mqa_metadata.py
- bench_hf_llava_bench.sh
- bench_hf_mme.sh
- bench_sglang.py
- bench_sglang_mme.sh
- download_images.py
- questions.jsonl
- README.md
- launch_server.py
- lora_bench.py
- bench_hf.py
- bench_sglang.py
- download_data.sh
- README.md
- bench_hf.py
- bench_sglang.py
- data_utils.py
- eval_utils.py
- prompt_format.yaml
- README.md
- bench_sglang.py
- eval_utils.py
- generate_report.py
- README.md
- bench_embeddings.py
- bench_score.py
- util.py
- bench_token_storage.py
- bench_adaptive_speculative.py
- .gitconfig
- .tmux.conf
- .vimrc
- .zshrc
- yank
- apply_deepep_k3_patch.sh
- kimi_k3_cu12.Dockerfile
- kimi_k3_cu13.Dockerfile
- arm64.Dockerfile
- compose.yaml
- Dockerfile
- gateway.Dockerfile
- k8s-sglang-distributed-sts.yaml
- k8s-sglang-service.yaml
- npu.Dockerfile
- rocm.Dockerfile
- sagemaker.Dockerfile
- serve
- sgl-deep-ep.Dockerfile
- sgl-deep-gemm.Dockerfile
- sgl-router.Dockerfile
- xeon.Dockerfile
- xpu.Dockerfile
- baidu.svg
- deepreinforce.png
- deepseek.png
- ernie.png
- fishaudio.png
- flashlabs.png
- flux.png
- glm.png
- google.png
- ideogram.png
- inclusionai.png
- internlm.png
- internvl.png
- jina.png
- joyai-echo.svg
- krea.png
- liquidai.png
- llama.png
- ltx.svg
- meituan.png
- meta.png
- minimax.png
- mistral.png
- moonshotai.png
- mova.png
- nvidia.png
- openai.png
- openbmb.png
- poolside.png
- qwen.png
- sana.png
- stepfun.png
- tencent.png
- thinkingmachines.png
- wan.png
- xiaomi.png
- zimage.png
- Autoregressive-benchmark-card.png
- Autoregressive-card.png
- Classification-card.png
- Diffusion-benchmark-card.png
- Diffusion-card.png
- dLLM-card.png
- Embedding-card.png
- LLM-card.png
- Omni-card.png
- Rerank-card.png
- Reward-card.png
- VLA-card.png
- VLM-card.png
- Unlimited-OCR.mdx
- Ornith-1.0.mdx
- DeepSeek-Math-V2.mdx
- DeepSeek-OCR-2.mdx
- DeepSeek-OCR.mdx
- DeepSeek-R1.mdx
- DeepSeek-V3.mdx
- DeepSeek-V3_1.mdx
- DeepSeek-V3_2.mdx
- DeepSeek-V4.mdx
- Ernie4.5-VL.mdx
- Ernie4.5.mdx
- Chroma1.0.mdx
- GLM-4.5.mdx
- GLM-4.5V.mdx
- GLM-4.6.mdx
- GLM-4.6V.mdx
- GLM-4.7-Flash.mdx
- GLM-4.7.mdx
- GLM-5.1.mdx
- GLM-5.2.mdx
- GLM-5.mdx
- GLM-Glyph.mdx
- GLM-OCR.mdx
- DiffusionGemma.mdx
- EmbeddingGemma.mdx
- Gemma4.mdx
- Ling-2.5-1T.mdx
- Ling-2.6.mdx
- Ling-3.0-flash.mdx
- Ling-3.0-tiny.mdx
- LLaDA-2.1.mdx
- Ring-2.5-1T.mdx
- Ring-2.6-1T.mdx
- Intern-S1.mdx
- Intern-S2-Mobius.mdx
- Intern-S2-Preview.mdx
- InternVL3.5.mdx
- Jina-reranker-m0.mdx
- LFM2.5.mdx
- LongCat-2.0.mdx
- Llama3.1.mdx
- Llama3.3-70B.mdx
- Llama4.mdx
- MuseGlimmer.mdx
- MiniMax-M2.5.mdx
- MiniMax-M2.7.mdx
- MiniMax-M2.mdx
- MiniMax-M3.mdx
- Devstral-2.mdx
- Ministral-3.mdx
- Mistral-Medium-3.5.mdx
- Mistral-Small-4.mdx
- Kimi-K2.5.mdx
- Kimi-K2.6.mdx
- Kimi-K2.7-Code.mdx
- Kimi-K2.mdx
- Kimi-K3.mdx
- Kimi-Linear.mdx
- Nemotron3-Nano-Omni.mdx
- Nemotron3-Nano.mdx
- Nemotron3-Super.mdx
- Nemotron3-Ultra.mdx
- Nemotron3.5-Lightning.mdx
- GPT-OSS.mdx
- MiniCPM-V-4_6.mdx
- Laguna-M.1.mdx
- Laguna-S-2.1.mdx
- Laguna-XS-2.1.mdx
- Laguna-XS.2.mdx
- Qwen2.5-VL.mdx
- Qwen3-Coder-Next.mdx
- Qwen3-Coder.mdx
- Qwen3-Next.mdx
- Qwen3-VL.mdx
- Qwen3.5.mdx
- Qwen3.6.mdx
- Qwen3.8-27B.mdx
- Qwen3.8.mdx
- Qwen3.mdx
- Dots3-Note.mdx
- Step-3.7-Flash.mdx
- Step3-VL-10B.mdx
- Step3.5.mdx
- Hunyuan3-Preview.mdx
- Hy3.mdx
- Inkling-Small.mdx
- Inkling.mdx
- MiMo-V2-Flash.mdx
- MiMo-V2.5.mdx
- intro.mdx
- autoregressive_model_benchmark.mdx
- diffusion_model_benchmark.mdx
- server_arguments.mdx
- Cosmos3.mdx
- Ernie-Image.mdx
- FLUX.mdx
- Ideogram4.mdx
- JoyEcho.mdx
- Krea-2.mdx
- LingBot-Video-MoE.mdx
- LingBot-World-2.0.mdx
- LingBot-World.mdx
- LongLive-2.0.mdx
- LTX2 & LTX2.3.mdx
- LTX2.5.mdx
- MiniMax-H3.mdx
- MOVA.mdx
- Qwen-Image-Edit.mdx
- Qwen-Image.mdx
- SANA-Video.mdx
- SANA-WM.mdx
- Wan2.1.mdx
- Wan2.2.mdx
- Z-Image-Turbo.mdx
- intro.mdx
- README.mdx
- S2-Pro.mdx
- intro.mdx
- specbundle_usage.mdx
- supported_models.mdx
- Pi0.5.mdx
- intro.mdx
- intro.mdx
- deepseek_v4_flash.ipynb
- adaptive_speculative_decoding.mdx
- attention_backend.mdx
- breakable_cuda_graph.mdx
- checkpoint_engine.mdx
- cuda_graph_for_multi_modal_encoder.mdx
- dcp.mdx
- deterministic_inference.mdx
- dp_dpa_smg_guide.mdx
- dp_for_multi_modal_encoder.mdx
- epd_disaggregation.mdx
- expert_parallelism.mdx
- forward_hooks.mdx
- hicache.mdx
- hicache_best_practices.mdx
- hicache_design.mdx
- hicache_storage_runtime_attach_detach.mdx
- hisparse_guide.mdx
- hyperparameter_tuning.mdx
- llm-d.mdx
- lora.mdx
- model_loading.mdx
- object_storage.mdx
- observability.mdx
- overview.mdx
- pd_disaggregation.mdx
- piecewise_cuda_graph.mdx
- pipeline_parallelism.mdx
- quantization.mdx
- quantized_kv_cache.mdx
- reasoning_aware_compression.mdx
- rfork.mdx
- separate_reasoning.mdx
- server_arguments.mdx
- session_radix_cache.mdx
- sgl_model_gateway.mdx
- sglang_for_rl.mdx
- speculative_decoding.mdx
- structured_outputs.mdx
- structured_outputs_for_reasoning_models.mdx
- tool_parser.mdx
- vlm_query.mdx
- anthropic_api.mdx
- aws_sagemaker.mdx
- native_api.mdx
- offline_engine_api.mdx
- ollama_api.mdx
- openai_api.mdx
- openai_api_completions.mdx
- openai_api_embeddings.mdx
- openai_api_vision.mdx
- overview.mdx
- sampling_params.mdx
- send_request.mdx
- bench_serving.mdx
- benchmark_and_profiling.mdx
- contribution_guide.mdx
- development_guide_using_docker.mdx
- development_jit_kernel_guide.mdx
- evaluating_new_models.mdx
- msprobe_debugging_guide.mdx
- overview.mdx
- quantization_contribution_guide.mdx
- release_process.mdx
- serve_backend_plugins.mdx
- setup_github_runner.mdx
- install.mdx
- quickstart.mdx
- contribution_guide.mdx
- operator_development.mdx
- operator_performance_optimizing.mdx
- support_new_models.mdx
- disaggregation.mdx
- accuracy_evaluation.mdx
- performance_testing.mdx
- installation.mdx
- quick_start.mdx
- deepseek_r1.mdx
- deepseek_v3_2.mdx
- glm_5_1.mdx
- kimi_k2_6.mdx
- mimo_v2_flash.mdx
- minimax_m2_5.mdx
- qwen3_235b_a22b.mdx
- qwen3_30b_a3b.mdx
- qwen3_32b.mdx
- qwen3_5_397b.mdx
- qwen3_6_27b.mdx
- qwen3_6_35b_a3b.mdx
- qwen3_8b.mdx
- qwen3_next_80b_a3b_instruct.mdx
- deepseek_r1.mdx
- deepseek_v3_2.mdx
- glm_5_1.mdx
- glm_5_2.mdx
- hy3.mdx
- kimi_k2_6.mdx
- mimo_v2_flash.mdx
- minimax_m2_5.mdx
- qwen3_235b_a22b.mdx
- qwen3_30b_a3b.mdx
- qwen3_32b.mdx
- qwen3_5_397b.mdx
- qwen3_6_27b.mdx
- qwen3_6_35b_a3b.mdx
- qwen3_8_max.mdx
- qwen3_8b.mdx
- qwen3_next_80b_a3b_instruct.mdx
- parameter_tuning.mdx
- profiling.mdx
- quantization.mdx
- ring_sp_performance.mdx
- environment_variables.mdx
- glossary.mdx
- support_features.mdx
- support_models.mdx
- faq.mdx
- mindspore_backend.mdx
- amd_gpu.mdx
- apple_metal.mdx
- cpu_server.mdx
- mthreads_gpu.mdx
- nvidia-gpus.mdx
- nvidia_jetson.mdx
- overview.mdx
- plugin.mdx
- tpu.mdx
- xpu.mdx
- choices_methods.mdx
- frontend_index.mdx
- frontend_tutorial.mdx
- lws_pd_deploy.mdx
- deepseekv32_pd.mdx
- deploy_on_k8s.mdx
- multi_node.mdx
- multi_node_index.mdx
- custom_chat_template.mdx
- environment_variables.mdx
- faq.mdx
- nightly_precision_regression.mdx
- overview.mdx
- post_training_integration.mdx
- production_metrics.mdx
- production_request_trace.mdx
- torch_compile_cache.mdx
- cli.mdx
- openai_api.mdx
- post_processing.mdx
- attention_backends.mdx
- cache_dit.mdx
- caching-acceleration.mdx
- ci_perf.mdx
- compatibility_matrix.mdx
- contributing.mdx
- deployment_cookbook.mdx
- disaggregation.mdx
- dynamic_batching.mdx
- encoder_parallel.mdx
- environment_variables.mdx
- index.mdx
- installation.mdx
- models_with_ar.mdx
- models_with_pe.mdx
- parallelism.mdx
- performance-optimization.mdx
- profiling.mdx
- progressive_resolution.mdx
- quantization.mdx
- realtime_models.mdx
- ring_sp_performance.mdx
- spectrum.mdx
- support_new_models.mdx
- teacache.mdx
- classify_models.mdx
- diffusion_language_models.mdx
- embedding_models.mdx
- generative_models.mdx
- mindspore_models.mdx
- modelscope.mdx
- multimodal_language_models.mdx
- rerank_models.mdx
- reward_models.mdx
- support_new_models.mdx
- transformers_fallback.mdx
- supported-models.mdx
- Approach-Medium.woff2
- Approach-Regular.woff2
- dpa.png
- logo.png
- check_cookbook_configs.mjs
- gen_redirects.py
- update_lmsys_sglang_blogs.py
- deepseek-math-v2-deployment.jsx
- deepseek-ocr-deployment.jsx
- deepseek-ocr-v2-deployment.jsx
- deepseek-r1-advanced-deployment.jsx
- deepseek-r1-basic-deployment.jsx
- deepseek-v3-deployment.jsx
- deepseek-v31-deployment.jsx
- deepseek-v32-deployment.jsx
- devstral-2-deployment.jsx
- ernie-45-deployment.jsx
- gemma4-deployment.jsx
- glm-45-deployment.jsx
- glm-45v-deployment.jsx
- glm-46-deployment.jsx
- glm-46v-deployment.jsx
- glm-47-deployment.jsx
- glm-47-flash-deployment.jsx
- glm-5-deployment.jsx
- glm-51-deployment.jsx
- glm-glyph-deployment.jsx
- glm-ocr-deployment.jsx
- gpt-oss-deployment.jsx
- hunyuan3-preview-deployment.jsx
- intern-s1-deployment.jsx
- intern-s2-preview-deployment.jsx
- kimi-k2-deployment.jsx
- kimi-k25-deployment.jsx
- kimi-k26-deployment.jsx
- kimi-k27-code-deployment.jsx
- kimi-linear-deployment.jsx
- laguna-xs2-deployment.jsx
- ling-25-1t-deployment.jsx
- ling-26-1t-deployment.jsx
- ling-26-flash-deployment.jsx
- llada-21-deployment.jsx
- llama31-deployment.jsx
- llama33-70b-deployment.jsx
- llama4-maverick-deployment.jsx
- llama4-scout-deployment.jsx
- mimo-v2-flash-deployment.jsx
- mimo-v25-deployment.jsx
- minicpm-v-4_6-deployment.jsx
- minimax-m2-deployment.jsx
- minimax-m25-deployment.jsx
- minimax-m27-deployment.jsx
- ministral-3-deployment.jsx
- mistral-medium-3-5-deployment.jsx
- mistral-small-4-deployment.jsx
- nemotron3-nano-deployment.jsx
- nemotron3-nano-omni-deployment.jsx
- nemotron3-super-deployment.jsx
- nemotron3-ultra-deployment.jsx
- qwen25-vl-deployment.jsx
- qwen3-coder-480b-a35b-deployment.jsx
- qwen3-coder-deployment.jsx
- qwen3-coder-next-deployment.jsx
- qwen3-deployment.jsx
- qwen3-next-deployment.jsx
- qwen3-vl-deployment.jsx
- qwen35-deployment.jsx
- qwen36-deployment.jsx
- ring-25-1t-deployment.jsx
- ring-26-1t-deployment.jsx
- step-35-deployment.jsx
- step-37-flash-deployment.jsx
- step-3vl-10b-deployment.jsx
- unlimited-ocr.jsx
- ornith-1.0.jsx
- deepseek-v4-benchmarks.jsx
- deepseek-v4.jsx
- ling-3.0-flash-benchmarks.jsx
- ling-3.0-flash.jsx
- ling-3.0-tiny-benchmarks.jsx
- ling-3.0-tiny.jsx
- intern-s2-mobius-benchmarks.jsx
- intern-s2-mobius.jsx
- lfm2.5-benchmarks.jsx
- lfm2.5.jsx
- longcat-2.0-benchmarks.jsx
- longcat-2.0.jsx
- muse-glimmer-benchmarks.jsx
- muse-glimmer.jsx
- minimax-h3.jsx
- minimax-m3-benchmarks.jsx
- minimax-m3.jsx
- kimi-k3-benchmarks.jsx
- kimi-k3.jsx
- nemotron-3.5-lightning-benchmarks.jsx
- nemotron-3.5-lightning.jsx
- laguna-m1-benchmarks.jsx
- laguna-m1.jsx
- laguna-s21-benchmarks.jsx
- laguna-s21.jsx
- laguna-xs21-benchmarks.jsx
- laguna-xs21.jsx
- qwen3.8-27b-benchmarks.jsx
- qwen3.8-27b.jsx
- qwen3.8-benchmarks.jsx
- qwen3.8.jsx
- dots3-note.jsx
- hy3-benchmarks.jsx
- hy3.jsx
- inkling-benchmarks.jsx
- inkling-small-benchmarks.jsx
- inkling-small.jsx
- inkling.jsx
- glm-5.2-benchmarks.jsx
- glm-5.2.jsx
- popular-models.jsx
- flux-deployment.jsx
- ltx-deployment.jsx
- ltx25-deployment.jsx
- model-tags.jsx
- mova-deployment.jsx
- qwen-image-deployment.jsx
- qwen-image-edit-deployment.jsx
- wan21-deployment.jsx
- wan22-deployment.jsx
- zimage-turbo-deployment.jsx
- specbundle-deployment.jsx
- _deployment.jsx
- _kimi_k3_mamba_ratio_calculator.jsx
- _playground.jsx
- _popular_models.jsx
- _qwen38_mamba_ratio_calculator.jsx
- .gitignore
- .mintignore
- AGENTS.md
- CONTRIBUTING.md
- custom.css
- docs.json
- favicon.png
- index.mdx
- LICENSE
- README.md
- .gitignore
- example_image.png
- qwen3_reranker.jinja
- qwen3_vl_reranker.jinja
- tool_chat_template_deepseekr1.jinja
- tool_chat_template_deepseekv3.jinja
- tool_chat_template_deepseekv31.jinja
- tool_chat_template_deepseekv32.jinja
- tool_chat_template_llama3.1_json.jinja
- tool_chat_template_llama4_pythonic.jinja
- vision_template_sarashina_vl.jinja
- update.py
- cat.jpeg
- dog.jpeg
- anthropic_example_chat.py
- anthropic_example_complete.py
- azure_openai_example_chat.py
- gemini_example_chat.py
- gemini_example_complete.py
- gemini_example_multimodal_chat.py
- local_example_chat.py
- local_example_complete.py
- local_example_llava_next.py
- openai_example_chat.py
- openai_example_complete.py
- openai_example_n.py
- openai_example_o1.py
- openrouter_example_chat.py
- orcarouter_example_chat.py
- together_example_chat.py
- together_example_complete.py
- srt_example_llava_v.py
- srt_example_llava_v.sh
- trace_and_evaluate_rag_using_parea.ipynb
- model.py
- config.pbtxt
- Dockerfile
- README.md
- chinese_regex.py
- choices_logprob.py
- cot_decoding.py
- json_decode.py
- json_logprobs.py
- openai_chat_speculative.py
- openai_speculative.py
- parallel_sample.py
- readme_examples.py
- sgl_gen_min_tokens.py
- streaming.py
- dashboard.yaml
- sglang-dashboard.json
- datasource.yaml
- docker-compose.yaml
- opentelemetry.yaml
- prometheus.yaml
- README.md
- tracing_compose.yaml
- gputrc2graph.py
- README.md
- sglang_engine_model.json
- custom_server.py
- embedding.py
- fastapi_engine_inference.py
- launch_engine.py
- offline_batch_inference.py
- offline_batch_inference_async.py
- offline_batch_inference_eagle.py
- offline_batch_inference_qwen_1m.py
- offline_batch_inference_vlm.py
- readme.md
- save_remote_state.py
- save_sharded_state.py
- hidden_states_engine.py
- hidden_states_server.py
- llama3_llava_server.py
- llava_onevision_server.py
- pixtral_server.py
- qwen_llava_server.py
- token_in_token_out_llm_engine.py
- token_in_token_out_llm_server.py
- token_in_token_out_vlm_engine.py
- token_in_token_out_vlm_server.py
- chain_of_verification.py
- lora.py
- multimodal_embedding.py
- openai_chat_with_response_prefill.py
- qwen3_vl_reranker.py
- README.md
- reward_model.py
- vertex_predict.py
- deploy_and_serve_endpoint.py
- rac_collect_traces.py
- rac_prune.py
- rac_serve_and_eval.py
- README.md
- modelopt_quantize_and_export.py
- policy_select.rs
- tree_lookup.rs
- grafana-dashboard.json
- README.md
- cli.rs
- mod.rs
- types.rs
- k8s.rs
- mod.rs
- static_urls.rs
- types.rs
- circuit_breaker.rs
- mod.rs
- block_size_oracle.rs
- discovery.rs
- hash.rs
- index.rs
- mod.rs
- subscriber.rs
- tree.rs
- wire.rs
- active_load.rs
- cache_aware_zmq.rs
- factory.rs
- load_based.rs
- mod.rs
- power_of_two.rs
- random.rs
- registry.rs
- round_robin.rs
- sticky.rs
- mod.rs
- sse.rs
- cache.rs
- chat.rs
- health.rs
- metrics.rs
- mod.rs
- models.rs
- tokenize.rs
- app.rs
- app_context.rs
- error.rs
- header_utils.rs
- metrics.rs
- mod.rs
- adapter.rs
- chat_template.rs
- dsv4.rs
- mod.rs
- introspect.rs
- manager.rs
- mod.rs
- registry.rs
- worker.rs
- lib.rs
- main.rs
- mod.rs
- static_urls.rs
- circuit_breaker.rs
- mod.rs
- cache_aware_zmq.rs
- kv_events_hash_parity.rs
- kv_events_tree_concurrent.rs
- kv_events_two_subscribers.rs
- mod.rs
- power_of_two.rs
- round_robin.rs
- zmq_helpers.rs
- mod.rs
- parity.rs
- concurrent_state.rs
- manager.rs
- mod.rs
- main.rs
- test_load_based_policy.py
- test_two_router_convergence.py
- test_validation.py
- __init__.py
- gateway.py
- model_pool.py
- model_specs.py
- namespace.yaml
- rbac-cluster-scoped.yaml
- rbac.yaml
- router-cluster-scoped.yaml
- router.yaml
- conftest.py
- Dockerfile.fake_worker
- Dockerfile.router
- fake_worker.py
- requirements.txt
- setup.sh
- test_cross_namespace.py
- test_discovery.py
- test_lifecycle.py
- test_reconciliation.py
- conftest.py
- pyproject.toml
- requirements.txt
- test_chat_smoke.py
- test_tokenize_smoke.py
- long.json
- multi_turn_with_tools.json
- short.json
- special_token_heavy.json
- long.json
- multi_turn_with_tools.json
- short.json
- special_token_heavy.json
- long.json
- multi_turn_with_tools.json
- short.json
- special_token_heavy.json
- kv_events_hash_parity.json
- tiny_tokenizer.json
- mock_worker.rs
- mod.rs
- streaming.rs
- cache_aware_input_ids.rs
- chat_routing.rs
- failover.rs
- graceful_shutdown.rs
- header_forwarding.rs
- main.rs
- pd_bootstrap_injection.rs
- pd_pool_isolation.rs
- roundrobin_input_ids.rs
- sticky_input_ids.rs
- sticky_routing.rs
- timeout.rs
- generate_kv_events_hash_parity.py
- generate_parity_fixtures.py
- .gitignore
- BENCHMARKS.md
- Cargo.toml
- deny.toml
- README.md
- rust-toolchain.toml
- sglang.proto
- __init__.py
- agentic_trace.py
- common.py
- custom.py
- generated_shared_prefix.py
- image.py
- longbench_v2.py
- mmmu.py
- mooncake.py
- openai_dataset.py
- random.py
- sharegpt.py
- speed_bench.py
- __init__.py
- bench_utils.py
- dspark_sps_profiler.py
- dspark_sts_fit.py
- endpoint.py
- offline_throughput.py
- one_batch.py
- one_batch_server.py
- serving.py
- utils.py
- __init__.py
- generate.py
- killall.py
- main.py
- serve.py
- serve_backends.py
- utils.py
- bench_activation.py
- bench_amd_deterministic_allreduce.py
- bench_awq_dequant.py
- bench_cutlass_mla.py
- bench_dsv4_norm_rope.py
- bench_es_fp8_blockwise_grouped_gemm.py
- bench_fp4_gemm.py
- bench_fp8_blockwise_group_gemm.py
- bench_fp8_gemm.py
- bench_fp8_gemm_swap_ab.py
- bench_int8_gemm.py
- bench_moe_align_block_size.py
- bench_moe_ep_post_reorder.py
- bench_moe_topk_sigmoid.py
- bench_moe_topk_softmax.py
- bench_mrope.py
- bench_per_tensor_quant_fp8.py
- bench_per_token_group_quant_8bit.py
- bench_rmsnorm.py
- bench_rotary_embedding.py
- bench_sum_scale.py
- bench_top_k_top_p_sampling.py
- flashmla.cmake
- utils.cmake
- custom_all_reduce.cu
- custom_all_reduce.cuh
- custom_all_reduce.hip
- custom_all_reduce_hip.cuh
- deterministic_all_reduce.hip
- quick_all_reduce.cu
- quick_all_reduce.cuh
- quick_all_reduce.h
- quick_all_reduce_base.h
- sm100_mla.hpp
- sm100_fmha_mla_reduction.hpp
- sm100_fmha_mla_tma_warpspecialized.hpp
- sm100_mla_tile_scheduler.hpp
- cutlass_mla_kernel.cu
- merge_attn_states.cu
- vertical_slash_index.cu
- gemm_int8.cpp
- moe.cpp
- op.h
- shm.h
- conv.cpp
- fla.cpp
- qwen3.cpp
- shm.h
- activation.cpp
- bmm.cpp
- CMakeLists.txt
- common.h
- conv3d.cpp
- decode.cpp
- extend.cpp
- flash_attn.cpp
- flash_attn.h
- gemm.cpp
- gemm.h
- gemm_fp8.cpp
- gemm_int4.cpp
- gemm_int8.cpp
- interface.cpp
- kvcache.cpp
- moe.cpp
- moe.h
- moe_fp8.cpp
- moe_int4.cpp
- moe_int8.cpp
- norm.cpp
- numa_utils.cpp
- preprocessor.cpp
- qkv_proj.cpp
- rope.cpp
- shm.cpp
- shm.h
- spec.cpp
- topk.cpp
- torch_extension_cpu.cpp
- vec.h
- vec_pack.h
- mixed_input_utils.hpp
- broadcast_load_epilogue_c3x.hpp
- epilogue_per_row_per_col_scale.h
- scaled_mm_epilogues_c3x.hpp
- sm90_gmma_builder_mixed_input.inl
- collective_builder_mixed_input.hpp
- collective_mma_array_mixed_input.hpp
- sm90_mma_array_tma_gmma_rs_warpspecialized_mixed_input_.hpp
- cutlass_gemm_caller.cuh
- fp8_gemm_sm90_dispatch.cuh
- gemm_universal_base_compat.h
- gemm_with_epilogue_visitor.h
- common.hpp
- activation.cu
- concat_mla.cu
- copy.cu
- deepseek_v4_topk.cu
- dsv4_norm_rope.cu
- fused_add_rms_norm_kernel.cu
- fused_add_rms_norm_kernel.mu
- pos_enc.cu
- topk.cu
- utils.cuh
- es_fp8_blockwise.cu
- es_fp8_blockwise_functor.cuh
- es_fp8_blockwise_launcher.cuh
- es_fp8_blockwise_traits.cuh
- es_sm100_mxfp8_blockscaled.cu
- es_sm100_mxfp8_blockscaled_functor.cuh
- es_sm100_mxfp8_blockscaled_group_quant.cu
- es_sm100_mxfp8_blockscaled_group_quant.cuh
- es_sm100_mxfp8_blockscaled_launcher.cuh
- es_sm100_mxfp8_blockscaled_traits.cuh
- compat.cuh
- gptq_kernel.cu
- matrix_view.cuh
- qdq_2.cuh
- qdq_3.cuh
- qdq_4.cuh
- qdq_8.cuh
- qdq_util.cuh
- awq_kernel.cu
- fp8_gemm_kernel.cu
- int8_gemm_kernel.cu
- math.hpp
- per_token_group_quant_8bit.cu
- per_token_group_quant_8bit_v2.cu
- per_token_quant_fp8.cu
- apply_token_bitmask_inplace_cuda.cu
- block_info.h
- dropout.h
- flash.h
- flash_blockmask.h
- flash_fwd_kernel.h
- flash_fwd_launch_template.h
- flash_fwd_split_hdim128_bf16_causal_sm80.cu
- flash_fwd_split_hdim128_bf16_sm80.cu
- flash_fwd_split_hdim64_bf16_causal_sm80.cu
- flash_fwd_split_hdim64_bf16_sm80.cu
- hardware_info.h
- kernel_traits.h
- mask.h
- philox.cuh
- philox_unpack.cuh
- rotary.h
- softmax.h
- static_switch.h
- utils.h
- flash_api.cpp
- flash_extension.cc
- max_pooling.cu
- transfer.cu
- causal_conv1d.cu
- causal_conv1d.h
- weak_ref_tensor.cpp
- README.md
- rope_pool_fused.cpp
- rope_pool_fused.metal
- scaled_mm_entry.cu
- w4a8_get_group_starts.cuh
- w4a8_grouped_mm_c3x.cu
- w4a8_grouped_mm_c3x.cuh
- w4a8_moe_data.cu
- cutlass_moe_helper.cu
- fp8_blockwise_moe_kernel.cu
- fused_qknorm_rope_kernel.cu
- moe_align_kernel.cu
- moe_sum.cu
- moe_sum_reduce.cu
- moe_topk_sigmoid_kernels.cu
- moe_topk_softmax_kernels.cu
- prepare_moe_input.cu
- common.muh
- dtype.muh
- moe_gemv_swiglu.mu
- pos_encoding_contiguous.mu
- ternary.mu
- top_k_top_p_sampling.mu
- dequantize.cuh
- ggml-common.h
- gguf_kernel.cu
- mmq.cuh
- mmvq.cuh
- moe.cuh
- moe_vec.cuh
- vecdotq.cuh
- cuda_utils.h
- greenctx_stream.cu
- greenctx_stream.h
- eagle_utils.cu
- ngram_utils.cu
- packbit.cu
- speculative_sampling.cu
- speculative_sampling.cuh
- common_extension.cc
- common_extension_musa.cc
- common_extension_rocm.cc
- flash_extension.cc
- flashmla_extension.cc
- spatial_extension.cc
- hip_vec_bf16_impl.h
- hip_vec_fp32_impl.h
- hip_vec_half_impl.h
- hip_act_and_mul.cuh
- hip_math_def.h
- hip_vec_dtypes.h
- dispatch_utils.h
- integer_subbyte.h
- pytorch_extension_utils_rocm.h
- scalar_type.hpp
- sgl_flash_kernel_ops.h
- sgl_kernel_musa_ops.h
- sgl_kernel_ops.h
- sgl_kernel_torch_shim.h
- utils.h
- __init__.py
- _loader.py
- attention.py
- max_pooling.py
- __init__.py
- gguf.py
- __init__.py
- rotary_embedding.py
- __init__.py
- allreduce.py
- attention.py
- cutlass_moe.py
- debug_utils.py
- elementwise.py
- expert_specialization.py
- flash_attn.py
- flash_mla.py
- gemm.py
- grammar.py
- kvcacheio.py
- load_utils.py
- mamba.py
- memory.py
- metal.py
- moe.py
- musa.py
- sampling.py
- scalar_type.py
- sparse_flash_attn.py
- spatial.py
- speculative.py
- test_utils.py
- top_k.py
- utils.py
- version.py
- test_greenctx_stream.py
- test_eagle_utils.py
- test_ngram_utils.py
- test_speculative_sampling.py
- conftest.py
- test_activation.py
- test_apply_token_bitmask_inplace.py
- test_awq_dequant.py
- test_copy.py
- test_custom_allreduce.py
- test_cutlass_mla.py
- test_cutlass_w4a8_moe_mm.py
- test_dsv4_norm_rope.py
- test_es_fp8_blockwise_moe.py
- test_es_mxfp8_blockscaled_moe.py
- test_flash_attention.py
- test_flash_attn_sparse.py
- test_flashmla.py
- test_fp8_blockwise_moe.py
- test_fp8_gemm.py
- test_fused_qk_norm_rope.py
- test_gguf.py
- test_gptq_kernel.py
- test_infllm_v2_attention.py
- test_infllm_v2_max_pooling.py
- test_int8_gemm.py
- test_kvcacheio.py
- test_merge_state_v2.py
- test_moe_align.py
- test_moe_topk_sigmoid.py
- test_moe_topk_softmax.py
- test_norm.py
- test_per_token_group_quant_8bit.py
- test_sampling.py
- test_topk.py
- test_torch_defaults_reset.py
- utils.py
- .clang-format
- analyze_whl_kernel_sizes.py
- build.sh
- CMakeLists.txt
- Dockerfile
- kernel-runner-setup.sh
- LICENSE
- Makefile
- pyproject.toml
- pyproject_cpu.toml
- pyproject_musa.toml
- pyproject_rocm.toml
- README.md
- rename_wheels.sh
- setup_metal.py
- setup_musa.py
- setup_rocm.py
- THIRDPARTYNOTICES.txt
- utils.py
- marker.py
- utils.py
- fixup_zero_kv.cuh
- fused_fp8_qkv_kv_cache.cuh
- kda_fused_decode.cuh
- kda_packed_decode.cuh
- kda_prefill.cu
- indexer_k.cuh
- c128.cuh
- c128_online.cuh
- c128_online_v2.cuh
- c128_v2.cuh
- c4.cuh
- c4_v2.cuh
- c_plan.cuh
- common.cuh
- fp8_wo_a_group_major_quant.cuh
- fused_norm_rope.cuh
- fused_norm_rope_v2.cuh
- hash_topk.cuh
- main_norm_rope.cuh
- mega_moe_pre_dispatch.cuh
- online_c128_mtp.cuh
- paged_mqa_metadata.cuh
- rope.cuh
- silu_and_mul_masked_post_quant.cuh
- store.cuh
- topk_v1.cuh
- topk_v2.cuh
- causal_conv3d_cat_pad.cuh
- ltx2_qknorm_split_rope.cuh
- modulate_scale_shift.cuh
- norm_scale_shift.cuh
- qknorm_rope.cuh
- residual_gate_add.cuh
- timestep_embedding.cuh
- usp_relayout.cuh
- communicator.cuh
- custom_all_reduce.cuh
- ipc.cuh
- tp_qknorm.cuh
- fused_store_index_cache.cuh
- activation.cuh
- add3.cuh
- clamp_position.cuh
- concat_mla.cuh
- fused_add_rmsnorm.cuh
- fused_eh_norm.cuh
- fused_metadata_copy.cuh
- fused_qknorm_rope.cuh
- kvcache.cuh
- pos_enc.cuh
- qknorm.cuh
- qknorm_across_heads.cuh
- rmsnorm.cuh
- rmsnorm_hf.cuh
- rope.cuh
- set_mla_kv_buffer.cuh
- set_mla_kv_concat_q.cuh
- code_gen.py
- fast_hadamard_transform.h
- fast_hadamard_transform_common.h
- fast_hadamard_transform_special.h
- hadamard_jit.cuh
- static_switch.h
- fp8_blockwise_scaled_mm_entry.cuh
- fp8_blockwise_scaled_mm_sm120.cuh
- awq_marlin_repack.cuh
- dequant.h
- gptq_marlin.cuh
- gptq_marlin_repack.cuh
- kernel.h
- marlin.cuh
- marlin_dtypes.cuh
- marlin_template.h
- kernel.h
- marlin_template.h
- moe_wna16_marlin.cuh
- awq_dequantize.cuh
- dsv3_fused_a_gemm.cuh
- dsv3_router_gemm.cuh
- per_tensor_quant_fp8.cuh
- per_token_group_quant.cuh
- per_token_group_quant_8bit_v2.cuh
- per_token_quant_fp8.cuh
- tiny_gemm.cuh
- causal_conv1d.cuh
- draft_extend_sconv.cuh
- fused_decode_update.cuh
- gather_scatter_sconv.cuh
- inkling_all_reduce.cuh
- inkling_ar_barrier.cuh
- inkling_ar_fused_decode.cuh
- inkling_ar_scattered_sconv.cuh
- inkling_attn_prologue_fused.cuh
- inkling_rel_proj.cuh
- inkling_row_scale.cuh
- update_sconv_cache.cuh
- fused_tma.cuh
- ar_fusion.cuh
- gemm_ag.cuh
- gemm_ar.cuh
- ptx_sys.cuh
- sp_collective.cuh
- mla_output_gate.cuh
- situ_and_mul.cuh
- canary_common.cuh
- canary_plan_entries.cuh
- canary_verify.cuh
- canary_write.cuh
- consts.cuh
- hicache.cuh
- relayout.cuh
- staged_write_back.cuh
- transfer_mamba.cuh
- moe_lora_align_kernel.cu
- dispatch_probability.cuh
- ipm.cuh
- lp_post.cuh
- lp_prep.cuh
- causal_conv1d.cuh
- fused_gemma_qknorm_rope.cuh
- fused_store_kv_index.cuh
- minimax_decode_topk.cuh
- per_token_quant_ue8m0.cuh
- es_sm100_mxfp8_blockscaled_group_quant.cuh
- es_sm100_mxfp8_blockscaled_moe_group_gemm.cuh
- es_sm100_mxfp8_blockscaled_moe_group_gemm_functor.cuh
- es_sm100_mxfp8_blockscaled_moe_group_gemm_traits.cuh
- align_single_token.cuh
- inkling_gate_topk_renorm.cuh
- moe_align_kernel.cu
- moe_finalize_fuse_shared.cu
- moe_fused_gate.cuh
- moe_permute_prepare.cu
- moe_topk_sigmoid.cuh
- moe_topk_softmax.cuh
- route_quant_fused.cuh
- route_radix.cuh
- topk_sum.cuh
- tvm_ffi_utils.h
- ngram.cpp
- ngram.h
- ngram_corpus_ffi.cpp
- param.h
- queue.h
- result.cpp
- result.h
- suffix_automaton.cpp
- suffix_automaton.h
- trie.cpp
- trie.h
- entry.cuh
- kernel.cuh
- params.h
- config.h
- defines.h
- dense_fp8_transpose_v.h
- dense_fp8_utils.h
- entry.cuh
- helpers.h
- kernel.cuh
- params.h
- kimi_k2_moe_fused_gate.cuh
- moe_lora_merged_align_kernel.cu
- topk_softmax_pack.cuh
- add_constant.cuh
- hisparse.cuh
- ngram_embedding.cuh
- compress.cuh
- compress_v2.cuh
- fp8_utils.cuh
- kvcacheio.cuh
- topk_impl.cuh
- communicator.cuh
- norm.cuh
- atomic.cuh
- cta.cuh
- ffi.h
- math.cuh
- mbarrier.cuh
- runtime.cuh
- scalar_type.hpp
- source_location.h
- tensor.h
- tile.cuh
- type.cuh
- utils.cuh
- utils.h
- vec.cuh
- warp.cuh
- __init__.py
- cache.py
- cpp_args.py
- loader.py
- ninja.py
- paths.py
- spec.py
- toolchain.py
- __init__.py
- arch.py
- common.py
- deps.py
- .clang-format
- __init__.py
- __main__.py
- __init__.py
- activation.py
- softcap.py
- __init__.py
- _tcgen05.py
- cvt.py
- __init__.py
- cp_split.py
- cutedsl_paged_mqa_logits.py
- dequant_k_cache.py
- index_buf_accessor.py
- paged_mqa_logits.py
- quant_k_cache.py
- tilelang_kernel.py
- transform_index.py
- triton_kernel.py
- triton_sparse_mla.py
- env_gate.py
- paged_decode.py
- paged_decode_indices.py
- paged_prefill.py
- runtime.py
- __init__.py
- attn.py
- c128_cleanup.py
- compress.py
- compress_old.py
- dequant_k_cache.py
- elementwise.py
- fp4_indexer.py
- fp8_wo_a.py
- fused_compress_triton.py
- gemm.py
- index_buf_accessor.py
- metadata_kernel.py
- moe.py
- online_c128_mtp.py
- quant_k_cache.py
- rms_normalize_hip.py
- sparse_prefill_kernels.py
- topk.py
- utils.py
- __init__.py
- dispatch.py
- flash_fwd.py
- flash_fwd_decode.py
- paged_kv.py
- policy.py
- runtime.py
- scheduler.py
- bench_gdn_replayssm_fold.py
- chunk.py
- chunk_delta_h.py
- chunk_fwd.py
- chunk_intra.py
- chunk_intra_token_parallel.py
- chunk_o.py
- cumsum.py
- fused_gdn_gating.py
- fused_norm_gate.py
- fused_recurrent.py
- fused_recurrent_linear_replayssm.py
- fused_sigmoid_gating_recurrent.py
- gdn_replayssm_spec_decode.py
- gdn_replayssm_spec_fold.py
- index.py
- kda.py
- kda_replayssm_spec_decode.py
- l2norm.py
- layernorm_gated.py
- op.py
- utils.py
- wy_fast.py
- .flake8
- __init__.py
- ampere_helpers.py
- AUTHORS
- batch_invariance.py
- blackwell_helpers.py
- block_info.py
- block_sparse_utils.py
- block_sparsity.py
- cache_utils.py
- copy_utils.py
- cu_blocks_kernels.py
- cute_dsl_ptxas.py
- cute_dsl_utils.py
- fa_logging.py
- fast_math.py
- flash_fwd.py
- flash_fwd_combine.py
- flash_fwd_mla_sm100.py
- flash_fwd_sm100.py
- flash_fwd_sm90.py
- interface.py
- LICENSE
- MANIFEST.in
- mask.py
- mma_sm100_desc.py
- named_barrier.py
- pack_gqa.py
- paged_kv.py
- pipeline.py
- pyproject.toml
- README.md
- seqlen_info.py
- shearing_bias.py
- sm100_hd256_2cta_fmha_forward.py
- softmax.py
- testing.py
- tile_scheduler.py
- topk_gather_kv.py
- utils.py
- __init__.py
- __init__.py
- kda_decode.py
- kda_prefill.py
- kda_replayssm.py
- __init__.py
- kernel_h.py
- kernel_kkt_inv_uw.py
- kernel_o.py
- __init__.py
- kernel_h.py
- kernel_kkt_inv_uw.py
- kernel_o.py
- prologue.py
- __init__.py
- Akk_inverse_lower_triangle_bf16.py
- chunk_fwd.py
- fuse_k4_only_persistent.py
- fuse_kernel123_persistent.py
- __init__.py
- __init__.py
- lightning_attn.py
- seg_la.py
- index.py
- utils.py
- flash_with_topk_idx.py
- topk_sparse.py
- flash_with_topk_idx.py
- topk_sparse.py
- __init__.py
- __init__.py
- triton_mla_kernels_decode_fused.py
- triton_mla_kernels_decode_optimized.py
- __init__.py
- clamp_position.py
- concat_mla.py
- cutedsl_fp8_paged_mqa_logits.py
- cutedsl_gdn.py
- cutedsl_gdn_mtp_ring.py
- cutedsl_kda.py
- dcp_kernels.py
- decode_attention.py
- deepseek_v4_rope.py
- dsa_metadata.py
- dsv4_attn_metadata_kernels.py
- extend_attention.py
- fixup_zero_kv.py
- flash_attention.py
- flash_attention_v3.py
- flash_attention_v4.py
- flash_attention_v4_sm120.py
- flash_mla_sm120.py
- flash_mla_sm120_triton.py
- fused_metadata_copy.py
- fused_qk_norm_rope_store.py
- fused_qk_rmsnorm_rope_gate.py
- fused_qknorm_rope.py
- fused_store_index_cache.py
- inkling_attn_prologue.py
- inkling_rel_proj.py
- inkling_row_scale.py
- kda_fused_decode.py
- kda_packed_decode.py
- log_scaling_tau.py
- merge_state.py
- metadata.py
- minimax_decode_topk.py
- minimax_m3_qk_norm_rope.py
- minimax_qknorm_rope.py
- mla_kv_pack_quantize_fp8.py
- mrope.py
- pa_page_table.py
- pad.py
- position.py
- prefill_attention.py
- qprep_bf16_fp8_sm90.py
- rocm_mla_decode_rope.py
- rope.py
- rotary_triton.py
- score_mod.py
- set_mla_kv_concat_q.py
- sparse_mla_q8kv8_prefill_sm90.py
- triton_gdn_fused_proj.py
- utils.py
- verify_mla.py
- verify_splitkv.py
- vision_rope.py
- __init__.py
- all_reduce.py
- inkling_all_reduce.py
- inkling_ar_fused.py
- inkling_ar_scattered_sconv.py
- mp.py
- norm_fusion.py
- reduce.py
- scale_residual_norm_scale_shift.py
- utils.py
- fused_residual_norm.py
- __init__.py
- rasterizer.cpp
- rasterizer.h
- rasterizer_gpu.cu
- __init__.py
- mesh_processor.cpp
- __init__.py
- causal_conv3d_pad.py
- group_norm_silu.py
- group_norm_silu_twopass.py
- hunyuan_qkv_pack.py
- indexed_modulation.py
- layernorm_modulate.py
- ltx2_ada_values.py
- ltx2_rotary.py
- mps_fallback.py
- native_bf16_rmsnorm.py
- norm.py
- npu_fallback.py
- numerics.py
- rmsnorm_onepass.py
- rmsnorm_scale_shift_bitexact.py
- rope_rotate_half_bitexact.py
- rotary.py
- sana_conv_post.py
- sana_wm_gdn.py
- sana_wm_gdn_chunkwise.py
- scale_shift.py
- silu_mul_bitexact.py
- torch_fallback.py
- ulysses_qkv.py
- varlen_pack_pad.py
- wan_causal_cache.py
- wan_rmsnorm_silu.py
- wan_temb_table_slices.py
- zimage_native_norm.py
- __init__.py
- bitexact_gate.py
- causal_conv3d_cat_pad.py
- fused_gate_rmsnorm.py
- fused_linear_gelu.py
- fused_ln_modulate.py
- group_norm_silu.py
- hunyuan_qknorm.py
- ltx2_qknorm_split_rope.py
- ltx2_rmsnorm_modulate.py
- modulate_scale_shift.py
- norm_scale_shift_native.py
- qknorm_rope.py
- quality_gate.py
- residual_gate_add.py
- sparse_linear_attn_kernels.py
- timestep_embedding.py
- usp_relayout.py
- __init__.py
- add3.py
- add_constant.py
- elementwise.py
- __init__.py
- vocab_parallel_embedding.py
- lora_expand,K=1024,R=64,S=1,device=NVIDIA_H200.json
- lora_expand,K=4096,R=64,S=3,device=NVIDIA_H200.json
- lora_expand,K=6144,R=64,S=2,device=NVIDIA_H200.json
- lora_shrink,K=1024,R=64,S=2,device=NVIDIA_H200.json
- lora_shrink,K=1024,R=64,S=3,device=NVIDIA_H200.json
- lora_shrink,K=2048,R=64,S=1,device=NVIDIA_H200.json
- lora_shrink,K=3072,R=64,S=1,device=NVIDIA_H200.json
- __init__.py
- gate_up_lora_b.py
- kernel_utils.py
- kv_b_lora_absorbed.py
- qkv_lora_b.py
- sgemm_lora_a.py
- sgemm_lora_b.py
- __init__.py
- chunked_embedding_lora_a.py
- chunked_sgmv_expand.py
- chunked_sgmv_shrink.py
- cutedsl_bf16_gemm.py
- cutedsl_dsv3_fused_a_gemm.py
- dsv3_fused_a_gemm.py
- dsv3_router_gemm.py
- embedding_lora_a.py
- fp8_blockwise_gemm.py
- fused_a_gemm.py
- gate_up_lora_b.py
- kernel_utils.py
- kv_b_lora_absorbed.py
- lora_tuning_config.py
- qkv_lora_b.py
- sgemm_lora_a.py
- sgemm_lora_b.py
- tiny_gemm.py
- __init__.py
- bitmask_ops.py
- token_filter_ops.py
- world=4,H=7168,device_name=NVIDIA_GB300.json
- world=8,H=7168,device_name=NVIDIA_GB300.json
- __init__.py
- activation.py
- all_reduce.py
- attn_res.py
- attn_res_hip.py
- gemm_ag.py
- gemm_ar.py
- kda_decode_mtp.py
- mla_output_gate.py
- moe.py
- sp_collective.py
- __init__.py
- api.py
- entries_kernel.py
- offsets_kernel.py
- utils.py
- __init__.py
- consts.py
- plan_ref.py
- scatter_req_token_ids.py
- verify.py
- verify_ref.py
- write.py
- write_ref.py
- __init__.py
- aiter_unified_attention.py
- cache_move.py
- cache_ops.py
- fused_fp8_qkv_kv_cache.py
- hicache.py
- hisparse.py
- kv_indices.py
- kvcache.py
- minimax_store_kv_index.py
- mla_buffer.py
- rope_cache.py
- set_mla_kv_buffer.py
- triton_store_cache.py
- trtllm_mha_graph_metadata.py
- trtllm_mha_page_table.py
- zero_pages.py
- __init__.py
- fused_eh_norm.py
- gemma4_fused_ops.py
- mhc.py
- mhc_head.py
- minimax_m3_rmsnorm.py
- norm.py
- rmsnorm_hf.py
- __init__.py
- cublasdx_solver.py
- cuda_solver.py
- shmem_budget.py
- torch_solver.py
- __init__.py
- mamba_ssm.py
- ssd_bmm.py
- ssd_chunk_scan.py
- ssd_chunk_state.py
- ssd_combined.py
- ssd_state_passing.py
- ssu_dispatch.py
- __init__.py
- causal_conv1d.py
- causal_conv1d_triton.py
- inkling_sconv.py
- mamba_state_indices_triton.py
- mamba_state_scatter_triton.py
- transfer_mamba.py
- __init__.py
- allocator.py
- common.py
- gpu_tensor_hash.py
- memcpy_triton.py
- virtual_slot.py
- __init__.py
- image.py
- __init__.py
- epilogue,E=896,topk=16,device_name=NVIDIA_GB300.json
- strategy,E=896,topk=16,device_name=NVIDIA_GB300.json
- trtllm_fused_moe_dev_kernel.cu
- fused_activation_quant.cuh
- fused_permute_quant.cuh
- trtllm_fused_moe_kernel_launcher.cu
- trtllm_fused_moe_runner.cu
- DevKernel.h
- runner.h
- __init__.py
- core.py
- jit.py
- kimi_k2_moe_fused_gate.py
- moe_lora_merged_align.py
- SOURCE.md
- topk_pack.py
- topk_softmax_pack.py
- virtual_experts.py
- __init__.py
- deepep_waterfill_kernels.py
- ep_moe_kernels.py
- fill_padded_rows.py
- fused_moe_lora_kernel.py
- fused_moe_triton_kernels.py
- gate_topk.py
- inkling_gate_topk_renorm.py
- inkling_moe.py
- minimax_m3_swiglu.py
- moe_align.py
- moe_align_single_token.py
- moe_align_small_numel.py
- moe_finalize_fuse_shared.py
- moe_front.py
- moe_fused_gate.py
- moe_fused_mul_sum.py
- moe_lora_align.py
- moe_permute_prepare.py
- moe_route_quant_fused.py
- moe_route_radix.py
- moe_topk_sigmoid.py
- moe_topk_softmax.py
- moe_topk_sum.py
- moe_wna16_marlin.py
- mxfp8_moe_amd_gfx95.py
- pack_topk_ids.py
- rocm_moe_utils.py
- router.py
- sigmoid_gate_topk_renorm.py
- triton_hash_topk.py
- triton_sigmoid_gate_mul.py
- virtual_experts.py
- N=1280,K=5120,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=1536,K=1536,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=1536,K=1536,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=1536,K=1536,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=1536,K=1536,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=1536,K=1536,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=1536,K=7168,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=1536,K=7168,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=1536,K=7168,device_name=AMD_Radeon_Graphics,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=1536,K=7168,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=1536,K=7168,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=1536,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=1536,K=7168,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=1536,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=1536,K=7168,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=2048,K=4096,device_name=NVIDIA_L40,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=2048,K=512,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=2048,K=512,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=2048,K=512,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=2048,K=512,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=2048,K=512,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=2048,K=512,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=2304,K=7168,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=2304,K=7168,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=2304,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=2304,K=7168,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=2304,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=2304,K=7168,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=24576,K=1536,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=24576,K=1536,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=24576,K=1536,device_name=AMD_Radeon_Graphics,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=24576,K=4096,device_name=NVIDIA_L40S,dtype=fp8_w8a8_channelwise.json
- N=24576,K=7168,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=24576,K=7168,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=24576,K=7168,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=24576,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=24576,K=7168,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=24576,K=7168,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128, 128].json
- N=24576,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=24576,K=7168,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=256,K=7168,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=256,K=7168,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=256,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=256,K=7168,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=256,K=7168,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=3072,K=1536,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=3072,K=1536,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=3072,K=1536,device_name=AMD_Radeon_Graphics,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=3072,K=1536,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=3072,K=1536,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128, 128].json
- N=3072,K=1536,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=3072,K=7168,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=3072,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=3072,K=7168,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128, 128].json
- N=3072,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=32768,K=512,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=32768,K=512,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=32768,K=512,device_name=AMD_Radeon_Graphics,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=32768,K=512,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=32768,K=512,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=32768,K=512,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=32768,K=512,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=32768,K=512,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=32768,K=512,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128, 128].json
- N=32768,K=512,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=32768,K=512,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=36864,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=36864,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=4096,K=12288,device_name=NVIDIA_L40S,dtype=fp8_w8a8_channelwise.json
- N=4096,K=4096,device_name=NVIDIA_L40S,dtype=fp8_w8a8_channelwise.json
- N=4096,K=512,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=4096,K=512,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=4096,K=512,device_name=AMD_Radeon_Graphics,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=4096,K=512,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=4096,K=512,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=4096,K=512,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128, 128].json
- N=4096,K=512,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=4608,K=7168,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=4608,K=7168,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=4608,K=7168,device_name=AMD_Radeon_Graphics,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=4608,K=7168,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=4608,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=4608,K=7168,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128, 128].json
- N=4608,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=512,K=7168,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=512,K=7168,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=512,K=7168,device_name=AMD_Radeon_Graphics,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=512,K=7168,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=512,K=7168,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128, 128].json
- N=512,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=5120,K=1024,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=5120,K=2048,device_name=NVIDIA_L40,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=5120,K=3200,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=576,K=7168,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=576,K=7168,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=576,K=7168,device_name=AMD_Radeon_Graphics,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=576,K=7168,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=576,K=7168,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=576,K=7168,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=576,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=576,K=7168,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=576,K=7168,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128, 128].json
- N=576,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=576,K=7168,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=6144,K=4096,device_name=NVIDIA_L40S,dtype=fp8_w8a8_channelwise.json
- N=6400,K=5120,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=1024,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=7168,K=1024,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=7168,K=1024,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=1024,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=1024,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=1024,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=1152,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=7168,K=1152,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=7168,K=1152,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=1152,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=1152,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=1152,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=128,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=7168,K=128,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=7168,K=128,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=128,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=128,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=16384,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=16384,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=16384,device_name=AMD_Radeon_Graphics,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=16384,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=7168,K=16384,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=7168,K=16384,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=16384,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=16384,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=16384,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128, 128].json
- N=7168,K=16384,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=16384,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=18432,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=7168,K=18432,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128, 128].json
- N=7168,K=18432,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=18432,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=18432,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=18432,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128, 128].json
- N=7168,K=18432,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=18432,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=2048,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=2048,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=2048,device_name=AMD_Radeon_Graphics,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=2048,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=2048,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=2048,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128, 128].json
- N=7168,K=2048,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=2304,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=2304,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=2304,device_name=AMD_Radeon_Graphics,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=2304,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=2304,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=2304,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128, 128].json
- N=7168,K=2304,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=256,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=256,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=256,device_name=AMD_Radeon_Graphics,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=256,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128, 128].json
- N=7168,K=256,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128, 128].json
- N=7168,K=256,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128, 128].json
- README.md
- __init__.py
- elementwise.py
- __init__.py
- awq_dequantize.py
- awq_marlin_repack.py
- awq_triton.py
- fp8_kernel.py
- fp8_quantize.py
- fp8_utils.py
- gptq_marlin.py
- gptq_marlin_repack.py
- hadamard.py
- int8_kernel.py
- minimax_quant_ue8m0.py
- mxfp8_amd_gfx95.py
- mxfp8_interleave_sf.py
- mxfp8_quant.py
- nvfp4_gemm_swiglu_nvfp4_quant.py
- per_tensor_quant_fp8.py
- per_token_group_quant.py
- per_token_group_quant_8bit_v2.py
- per_token_quant_fp8.py
- __init__.py
- murmur_hash.py
- renorm_triton.py
- top_p_renorm_triton.py
- __init__.py
- dispatch.py
- dspark_accept.py
- dspark_attn_metadata.py
- dspark_draft_model.py
- dspark_schedule.py
- dspark_verify_window.py
- fused_kv_write.py
- __init__.py
- cache_locs.py
- dflash.py
- eagle.py
- fused_kv_materialize.py
- gather_spec_extras.py
- multi_layer_eagle.py
- ngram_corpus.py
- ngram_embedding.py
- ragged_verify_kernels.py
- reject_sampling.py
- spec_tree.py
- topk1.py
- __init__.py
- __init__.py
- fused_op.py
- kernel_api_logging.py
- README.md
- registry.py
- selector.py
- spec.py
- anthropic.py
- base_backend.py
- crusoe.py
- litellm.py
- openai.py
- runtime_endpoint.py
- vertexai.py
- api.py
- chat_template.py
- choices.py
- global_config.py
- interpreter.py
- ir.py
- tracer.py
- testing-and-accuracy.md
- SKILL.md
- bench_diffusion_denoise.py
- diffusion_skill_env.py
- benchmark-and-profile.md
- existing-fast-paths.md
- SKILL.md
- SKILL.md
- SKILL.md
- CLAUDE.md
- __init__.py
- generator.py
- model_patcher.py
- server_api.py
- __init__.py
- base.py
- flux.py
- qwen_image.py
- zimage.py
- __init__.py
- README.md
- test_flux_pipeline.py
- test_qwen_image_edit_pipeline.py
- test_qwen_image_pipeline.py
- test_zimage_pipeline.py
- flux_sgld_sp.json
- qwen_image_sgld.json
- sgld_image2video.json
- sgld_text2img.json
- z-image_sgld.json
- __init__.py
- nodes.py
- README.md
- utils.py
- app.js
- decoder_worker.js
- index.html
- playback_controller.js
- playback_controller_test.js
- README.md
- styles.css
- __init__.py
- main.py
- README.md
- bench_offline_throughput.py
- bench_pi05_openpi.py
- bench_serving.py
- compare_perf.py
- datasets.py
- request_manifest.py
- wan_1.3B_77_448_832.json
- wan_1.3B_77_480_832.json
- base.py
- ltx_2_connector.py
- ltx_2_duration_head.py
- __init__.py
- mova_dual_tower.py
- __init__.py
- ltx_2_5_diffusion_decoder.py
- __init__.py
- base.py
- cosmos3video.py
- ernie_image.py
- flux.py
- glmimage.py
- helios.py
- hunyuan3d.py
- hunyuanvideo.py
- ideogram.py
- joy_echo.py
- joy_image.py
- krea2.py
- lingbot_video_moe.py
- lingbot_world.py
- longcat_image.py
- longlive2.py
- ltx_2.py
- ltx_2_5.py
- minimax_h3.py
- mova_audio.py
- mova_video.py
- qwenimage.py
- sana.py
- sana_video.py
- sana_wm.py
- sana_wm_refiner.py
- stablediffusion3.py
- wanvideo.py
- zimage.py
- __init__.py
- base.py
- clip.py
- flux_2.py
- gemma2.py
- gemma_3.py
- gemma_4_unified.py
- ideogram.py
- llama.py
- minimax_h3_qwen3vl.py
- mistral3.py
- qwen3.py
- qwen3vl.py
- qwen_image.py
- t5.py
- __init__.py
- base.py
- dac.py
- ernie_image.py
- flux.py
- glmimage.py
- hunyuan3d.py
- hunyuanvae.py
- longcat_image.py
- ltx_2_5_video.py
- ltx_audio.py
- ltx_video.py
- minimax_h3_audio.py
- minimax_h3_contract.py
- minimax_h3_video.py
- qwenimage.py
- sana.py
- stable_diffusion.py
- stablediffusion3.py
- wanvae.py
- __init__.py
- base.py
- ltx_vocoder.py
- __init__.py
- base.py
- fsdp.py
- __init__.py
- base.py
- cosmos3.py
- diffusers_generic.py
- ernie_image.py
- flux.py
- flux_finetuned.py
- glm_image.py
- helios.py
- hunyuan.py
- hunyuan3d.py
- ideogram.py
- joy_echo.py
- joy_image.py
- krea2.py
- lingbot_video_moe.py
- lingbot_world.py
- longcat_image.py
- longlive2.py
- ltx_2.py
- ltx_2_5.py
- minimax_h3.py
- __init__.py
- __init__.py
- README.md
- __init__.py
- _platform_stubs.py
- bench_offline_throughput.py
- bench_one_batch.py
- bench_one_batch_server.py
- bench_serving.py
- check_env.py
- compile_deep_gemm.py
- launch_server.py
- README.md
- MANIFEST.in
- pyproject.toml
- pyproject_cpu.toml
- pyproject_npu.toml
- pyproject_other.toml
- pyproject_xpu.toml
- setup.py
- .codespellrc
- .coveragerc
- .dockerignore
- .gitignore
- .isort.cfg
- .pre-commit-config.yaml
- CODE_OF_CONDUCT.md
- LICENSE
- README.md
- README_cn.md
// repository documentation
Was this content helpful?
(0 ratings)
