Skip to content

Rust LLM Serving Engine

聚焦核心路径的 Rust 推理引擎

Hetero-Paged-Infer 聚焦可落地的核心能力:分页式 KV Cache、连续批处理调度,以及 OpenAI 兼容 HTTP 接口。

Rust
语言

以内存安全和清晰接口组织系统代码。

分页 KV Cache
内存

基于块的分配与内存账本。

连续批处理
调度

Prefill/Decode 流程与 Decode 优先行为。

OpenAI 兼容
服务

提供 completions/chat 与运行探针接口。

文档导航

当前边界

  • 仓库已提供可本地运行的引擎、调度器、KV Cache 管理器与 HTTP 服务层。
  • 文档站仅保留当前实现所需的说明,移除了历史性、展示性和白皮书式内容。
  • 真实 CUDA Kernel 仍是后续工作,不被当作当前能力描述。