发布于 6 天前
摘要
Meta Data 发表时间:2025-09-16 作者:Yuxuan Cai, Xiaozhuan Liang, Xinghua …
Meta Data 发表时间:2025-09-16 作者:Yuxuan Cai, Xiaozhuan Liang, Xinghua …
Meta Data 发表时间:2026-04-15(arXiv 首次提交);2026-04-16(公布) 作者:Heming Xi …
Meta Data 发表时间:2025-02-24;最新 arXiv 修订:2026-04-08 作者:Penghui Yang, …
Meta Data 发表时间 2025.04.23 作者:Fan Zhou, Siqiao Xue, Danrui Qi etc. …
概述 在强化学习(Reinforcement Learning,RL)中,On-Policy(同策略)和Off-Policy(异策 …
为什么要创建flash-attention? 原始self-attention的时间和空间复杂度是序列长度的二次方,当序列长度过长 …
摘要 我们推出DeepSeek-V3.2,该模型实现了高计算效率与卓越推理能力、智能体性能的协同统一。 其核心技术突破包括: De …
简介 Transformer的核心部分是Attention注意力机制,通过引入Attention机制,模型能够处理序列数据的时候有 …
近端策略优化算法PPO(Proximal Policy Optimization) PPO算法在openai的论文《Trainin …
引言 语言模型的发展历程 统计语言模型(Statistical Language Model,SLM)。统计语言模型使用马尔可夫假 …