文档
Slack
论文
Github
文章
2025年10月21日
FlashInfer-Bench:为人工智能驱动的LLM系统构建良性循环
2025年3月10日
用于LLM采样的无排序GPU内核
2024年12月16日
FlashInfer 0.2 - 用于LLM推理服务的_高效且可定制的内核
2024年2月2日
级联推理:内存带宽高效的共享前缀批处理解码
2024年2月2日
使用FlashInfer加速LLM服务的自注意力机制
通过RSS订阅
via RSS