首页 > 快讯 > DeepSeek推出NSA,用于超快速的长上下文训练和推理
世链快讯  

DeepSeek推出NSA,用于超快速的长上下文训练和推理

2 月 18 日,DeepSeek 宣布推出 NSA,这是一种与硬件一致且本机可训练的稀疏注意力机制,用于超快速的长上下文训练和推理。

通过针对现代硬件的优化设计,NSA 加快了推理速度,同时降低了预训练成本,而不会影响性能。在一般基准测试、长上下文任务和基于指令的推理上,它的表现与完全注意力模型相当甚至更好。(金十)

Tags:
免责声明
世链财经作为开放的信息发布平台,所有资讯仅代表作者个人观点,与世链财经无关。如文章、图片、音频或视频出现侵权、违规及其他不当言论,请提供相关材料,发送到:2785592653@qq.com。
风险提示:本站所提供的资讯不代表任何投资暗示。投资有风险,入市须谨慎。
世链粉丝群:提供最新热点新闻,空投糖果、红包等福利,微信:juu3644。