「开源大模型」共找到 10302 篇相关文章

算法论文8

揭示隐藏联系:RLHF/DPO即对比学习!

大型语言模型输出符合人类价值观是挑战,主流技术RLHF复杂、昂贵且不稳定,DPO简化流程但有训练崩溃问题。论文揭示RLHF/DPO即对比学习,提出MIO算法解决DPO崩溃,实验验证其性能优势。

深度学习自然语言处理
推荐文章8

Astra 的 Computer Use 能力是如何实现的?

本文编译自Browserbase增长工程师Kyle Jeong的个人博客,对比了纯视觉路线Computer Use模型的缺陷,详细拆解Astra模型利用无障碍树结合Codex Harness实现能力的架构、训练方法,分析其优劣与行业价值。

海外独角兽
开源动态7

谷歌又来砸饭碗!免费AI Agent发布,程序员狂喜

昨天谷歌发布免费开源的AI Agent Gemini CLI,可在电脑终端运行。它定位为开源AI Agent,能理解任务、制定计划和调用工具。免费额度慷慨,能力不限于编码,上手简单,但刚发布存在不稳定情况。

探索AGI
算法论文7

姚顺雨入职腾讯50天后,发布了首篇署名论文:CL-Bench

2月3日姚顺雨加入腾讯50天后发布首篇署名论文《CL-bench: A Benchmark for Context Learning》。该论文做了新的benchmark,测试显示前沿模型平均分仅17.2%,指出模型在上下文学习尤其是归纳能力上的短板。

花叔
算法论文8

GPT-6 或有"生命"!MIT新作实现LLM自我进化,冻结权重时代终结

MIT新作《Self-Adapting Language Models》实现LLM自我进化,SEAL框架让模型自己生成“自编辑”微调自身。它能实时学新数据、修复知识、形成记忆。经两种场景验证,小模型也能超越GPT - 4.1等。

PaperAgent
新闻资讯7

永别了,人类冠军!AI横扫天文奥赛,GPT-5得分远超金牌选手2.7倍

国际天文与天体物理奥赛(IOAA)中,GPT - 5和Gemini 2.5 Pro完胜人类选手。俄亥俄州立大学团队考察五大顶尖LLM,发现它们大多达金牌水平,但在几何、时空推理等方面有困难。

新智元
算法论文8

一个标点就能迷惑LLM-as-a-Judge!

论文揭露惊人漏洞,一个标点或通用推理开场白就能欺骗最先进的LLM裁判,导致强化学习训练崩溃。研究通过实验验证漏洞,提出Master - RM模型,其FPR近乎0%且保持通用裁判能力。

深度学习自然语言处理
新闻资讯8

深圳SEO&GEO大会:搜索没死,只是竞争规则变了!

深圳SEO&GEO大会探讨搜索新形势,多位嘉宾分享见解。如Zac老师认为AI增长不代表搜索失价值,SEO应随搜索逻辑升级;Paul老师提出大品牌应将SEO目标转向争答案席位等。

白杨SEO优化教程
算法论文8

训练提速5倍,响应缩短50%:动态自感知能力,重塑高效LLM Reasoning范式

大型语言模型“思维链”技术有冗余,传统优化方案存在静态先验与动态能力错配问题。论文提出的DR.SAF框架赋予模型动态自感知能力,通过三模块协作,实现推理“精准瘦身”,解决根本冲突。

深度学习自然语言处理
新闻资讯8

AI不是比人聪明,是输得起!菲尔兹奖得主点破OpenAI十项成果

OpenAI发布内部版模型Astra的十项成果,引发数学界震动。菲尔兹奖得主Timothy Gowers分析其成果,指出AI优势在‘输得起’,还探讨找例方法、模型短板,给出训练建议与衡量跨越门槛的标准。

新智元