书库 / Smaller, faster, safer: running Kimi and GLM at scale | The Cloudflare Blog
Smaller, faster, safer: running Kimi and GLM at scale | The Cloudflare Blog
作者:未知作者 · 语言:zh-CN
Workers AI 在靠近用户的 Cloudflare 数据中心的 GPU 上,为世界上一些最优秀的开放模型运行推理。其中两个能力最强、要求也最高的模型是 Moonshot 的 Kimi K 系列和 Z.ai 的 GLM。它们是大型、长上下文、混合专家模型,使用起来非常出色。但由于内存限制,它们也很难高效地提供服务。