Mistral 7B 开源:小模型的高效革命

Mistral 7B 采用分组查询注意力(GQA)与滑动窗口注意力(SWA),在推理速度和显存占用上大幅优化,7B 规模即超越同期的 Llama 2 13B 多项基准,且完全开放商用。

这个仅 20 余人团队的作品证明了'数据质量与架构创新可以对抗参数规模',带动了 Zephyr、OpenHermes 等微调生态,也让欧洲在开源大模型版图上占据一席之地。

阅读原文(Mistral AI)↗ ← 返回资讯列表