差分平均引导」共找到 533 篇相关文章

算法论文8

谷歌提出破局Self-Consistency计算瓶颈!LLM推理效率革命,推理加速不牺牲精度

Google Research等团队提出CISC,通过给推理路径赋予置信度权重,少量样本即可超越传统自洽性效果,平均减少40%计算成本,还提出WQD指标揭示模型自评估能力本质。

深度学习自然语言处理
产品应用8

松下发布多模态大模型,文本、图像、音频随意切换

多模态数据处理成热点,但现有模型处理复杂任务有挑战。松下开发多模态大模型OmniFlow,采用模块化设计、多模态引导机制,实验显示其在多任务中有卓越表现。

AIGC开放社区
算法论文8

省下1.25倍算力!Kimi这篇论文,可能改写所有大模型的训练方式

大模型层数增多时,残连接存在PreNorm稀释问题,导致后面层贡献被稀释。Kimi论文提出Attention Residuals方案,还给出工程解法Block AttnRes,实验显示能省算力且提升效果。

AI寒武纪
开源动态8

Transformer论文作者重造龙虾,Rust搓出钢铁版,告别OpenClaw裸奔漏洞

Transformer作者Illia Polosukhin重造安全版龙虾IronClaw。OpenClaw安全状况,IronClaw用Rust重写,建立四层防御,还能防提示注入。其背后是NEAR更大构想,目标是用户掌控数据和资产。

量子位
推荐文章7

技多不压身,那龙虾的 Skill 是越多越好吗?

作者结合学术研究和自身经验探讨小龙虾装Skill问题。研究表明Skill并非越多越好,装多效果变,还给出合适数量区间。同时分享用好Skill的经验,如按需安装、合理增减拆分等。

特工宇宙
算法论文8

Kimi新论文太硬核了!马斯克和Karpathy相继点赞~

马斯克和Karpathy点赞Kimi新论文《Attention Residuals》。该论文由杨植麟带队、苏剑林等参与,提出注意力残(AttnRes),解决深层网络信息稀释问题,还通过工程折中降低成本,实验效果良好。

PaperAgent
算法论文8

刷榜只是体力活!清华消费10万块,一周「肝」出105个SOTA

AutoSOTA通过多智能体协作,将AI研究中繁琐的性能优化过程自动化,使科研从「手工艺」转向「工业流水线」。在一周压力测试中,消耗约10.4万美元,发现105个SOTA模型,平均性能提升近10%。

新智元
开源动态8

腾讯开源全新动作迁移模型FlexiAct,人物 & 动物都支持

当前动作定制方法在应对多样化主体和场景时适应性,清华与腾讯提出FlexiAct模型。它引入RefAdapter和FAE,能在空间结构异大或跨域场景中精准适配动作,保持外观一致,表现优于其他方法。

带你学AI
开源动态8

8000行Python+Rust手搓ChatGPT,日收14.5k星!Karpathy:Agent只会帮倒忙

特斯拉前AI总监Andrej Karpathy发布开源项目nanochat,可搭建简易版ChatGPT复现模型。约8000行代码,成本低,功能多。卡帕西称手写代码,用Agent效果,项目受网友热赞。

InfoQ
新闻资讯8

ChatGPT「学习模式」火爆上线,一大波教育AI连夜被端!24小时导师免费用

OpenAI为ChatGPT上线苏格拉底「学习模式」,针对大学生,以交互式提示、分步解答等功能引导学习,可应对复杂学科难题。一经推出便受网友热捧,有人预言将端掉一波教育类AI。

新智元