简体中文
Appearance
Rust LLM Serving Engine
Hetero-Paged-Infer 聚焦可落地的核心能力:分页式 KV Cache、连续批处理调度,以及 OpenAI 兼容 HTTP 接口。
以内存安全和清晰接口组织系统代码。
基于块的分配与内存账本。
Prefill/Decode 流程与 Decode 优先行为。
提供 completions/chat 与运行探针接口。
引擎结构、调度模型与内存管理设计。
安装、配置与本地使用。
核心类型与 HTTP API 参考。
Docker 与生产部署说明。
贡献流程与验证命令。