推理优化
7 条- 01让Token生产更高效:异构混推的关键技术演进与创新实践
商汤大装置团队介绍异构混推技术在提升大模型推理效率方面的创新实践。
- 02Flash-dLLM:面向IO感知的KV缓存与并行解码,实现快速、内存高效的扩散型大语言模型
提出Flash-dLLM框架,通过IO感知KV缓存和并行解码提升扩散型LLM推理效率与内存利用率。
- 03Show HN:jevals——用带类型的 Jev 决策替代大语言模型评判器
开源工具 jevals 提出基于类型化决策逻辑的轻量级 LLM 输出评估框架,替代传统 LLM-as-a-judge 方法。
- 04APUS 开源国内首批 Jev 跨平台复现:国产模型实现秒级决策
APUS AI 实验室开源首批 Jev 模型跨平台复现,支持国产模型秒级推理决策。
- 05GLM 构建了自己的推理基础设施
GLM 团队自研 AI 推理底层设施,提升大模型部署效率与可控性。
- 06rMuscle:面向高效视觉-语言-动作模型推理的机器人肌肉记忆
提出rMuscle框架,利用工厂重复作业特征优化VLA模型推理延迟,提升机器人响应实时性与运动平滑性。
- 07DeepSeek v4.1 Flash 现已成为我们最佳的黑客模型
DeepSeek发布v4.1 Flash版本,专为代码安全分析与漏洞利用场景优化的轻量级推理模型。