「技术与文化」共找到 8143 篇相关文章
清华、快手提出AttnRL:让大模型用「注意力」探索
清华和快手团队提出新框架AttnRL,引入注意力机制提升过程监督强化学习效率与性能。它解决传统方法在分支位置选择和采样策略上的效率问题,实验显示在多基准测试中表现优异。
大模型首次直接理解代码图:不用Agent自动修bug,登顶SWE-Bench开源模型榜单
蚂蚁开源新模型CGM,首创将仓库代码图模态融入大模型,不依赖闭源模型和复杂Agent,仅需4步就能快速定位、生成补丁。它在多个测试基准中领先,技术论文等均已开源。
Reasoning新突破:SoftCoT++如何让LLM‘多想几条路’?
LLM推理依赖‘思维链’,传统方法在离散token空间生成步骤有信息丢失、多样性不足问题。SoftCoT++在连续空间生成‘软思维’,拆分‘思考’与‘推理’,用专用初始token和对比学习,实验中全面超越传统方法。
矩阵乘法可以算得更快了!港中文10页论文证明:能源、时间均可节省
香港中文大学10页论文提出新算法RXTX,用于计算矩阵与其转置的乘积XXᵗ。该算法结合机器学习搜索和组合优化技术,能源可节省5%-10%,时间节省5%,对多领域有深远影响。
AI最尴尬的短板,中国科学院出手了
7月24日,中科院计算所“知境”团队发布知境社会心智大模型技术体系,为现有大模型补社会心智短板。其建评测体系SoMBench,设计训练系统Zing,用部署架构Actio,在多评测超越GPT - 5.5等,应用前景广。
黑客已死!Claude 两周挖出 Firefox 22 个漏洞
Anthropic与Mozilla合作,让Claude Opus 4.6对Firefox代码库做漏洞挖掘,两周发现22个漏洞,14个高危。Claude发现漏洞能力强,但利用漏洞能力弱。还研究用LLM做「补丁Agent」,为AI辅助安全研究建规范。
从「知题」到「知人」:UserRL让智能体学会「以人为本」
大语言模型距成真正用户伙伴缺‘知人’能力。来自UIUC与Salesforce团队提出UserBench和UserRL方案。前者将‘用户特性’制度化,构建评测环境;后者搭建统一强化学习框架,探索奖励建模,二者让‘以用户为中心’落地。
首钢园“Link Point 融资时刻” | AI+医疗专场路演圆满收官
8月27日,首钢园“Link Point 融资时刻”首期AI+医疗专场路演在企服驿站举办,众多投资机构和企业代表参与。活动采用多种形式,多家企业展示成果。该活动推动AI与医疗融合,赋能行业升级,完善区域生态。
103K「硬核」题,让大模型突破数学推理瓶颈
现有大语言模型在数学推理训练时面临数据瓶颈,腾讯AI Lab与上海交大团队推出DeepMath - 103K数据集。它规模大、难度高、数据新颖、严格去污染,让DeepMath系列模型达SOTA,还能实现推理泛化。
阿里开源QwenLong-L1:首个以强化学习训练的长上下文推理大模型
LRMs扩展到长文本场景是挑战,阿里开源QwenLong-L1框架,是首个用强化学习训练用于长文本推理的模型。它含三个核心组件,QwenLong-L1-32B性能领先,与Claude-3.7-Sonnet-Thinking相当。