FlashInfer
文档 Slack 论文 Github

文章

  • 2025年10月21日

    FlashInfer-Bench:为人工智能驱动的LLM系统构建良性循环

  • 2025年3月10日

    用于LLM采样的无排序GPU内核

  • 2024年12月16日

    FlashInfer 0.2 - 用于LLM推理服务的_高效且可定制的内核

  • 2024年2月2日

    级联推理:内存带宽高效的共享前缀批处理解码

  • 2024年2月2日

    使用FlashInfer加速LLM服务的自注意力机制

通过RSS订阅 via RSS

FlashInfer

版权所有 © 2023-2026, FlashInfer team

  • flashinfer-ai

介绍加速大型语言模型部署的技术