「加固镜像」共找到 572 篇相关文章
陈丹琦新作:大模型强化学习的第三条路,8B小模型超越GPT-4o
陈丹琦团队提出结合RLHF和RLVR优点的RLMT方法,支持在基础模型上直接使用,节省后训练成本。它让模型生成CoT,用奖励模型评价输出,使小模型超越大模型,推理更像人类。
AI正在偷走白领工作!OpenAI狂砸10亿教AI上班,你的完美继任者即将上岗
Anthropic、OpenAI等大厂计划每年投10亿美元,为AI提供强化学习环境、让其「偷师」专家,教会AI像人类一样工作。OpenAI高管预言未来经济或成「RL机器」,引发岗位替代担忧。
Nano-Banana 核心团队分享:文字渲染能力才是图像模型的关键指标
谷歌新发布的图像生成与编辑模型Gemini 2.5 Flash Image(Nano - Banana)热度超Grok视频生成。文章通过团队访谈,介绍其图像创作新方式、文字渲染代理指标、交错生成能力等,还对比了与Imagen差异,展望AI终极形态。
视频生成 vs 空间表征,世界模型该走哪条路?
随着生成模型和潜在表征技术发展,业界探讨世界模型技术路线。是像素级视频预测模拟未来场景可靠,还是潜在空间抽象表征高效?Goole DeepMind的Genie 3发布,再次引发讨论,分歧也从理论走向应用。
重塑浏览器!微软在Edge加入AI Agent,自动化搜索、预测、整合
今天凌晨微软官网宣布在浏览器Edge中加入Copilot模式,它像多层级混合智能体,能自动执行搜索、整合等操作,有标签筛选等创新功能,可提升效率,还保障隐私安全,已免费开放。
家用人形机器人,终于快要来了
作者认为除关注AI大模型进展,更期待家用机器人突破。如今具身智能已具备落地条件,像特斯拉、1X等公司在人形机器人领域有进展,作者乐观预计五年内人形机器人能成熟。
AI还不会独自问诊,o3准确率仅为51.12%,上交大×SII开源高难度复杂疾病诊断测评集
上海交大与SII团队开源高难度复杂疾病诊断测评集DiagnosisArena。测试显示,现有大模型在复杂临床诊断任务中表现不佳,o3准确率仅51.12%,且选择题设置无法反映其真实能力。
物理引擎 + 视频生成!输入一张图,让AI演给你看真实物理世界
WonderPlay将物理仿真与视频生成结合,从单张图像生成动态3D场景。它引入混合生成模拟器,形成物理求解器与视频生成器闭环。与其他方法对比,WonderPlay在多种场景和材质下表现更优。
会解题不等于懂人心,腾讯混元提出Sentient Agent,提高高阶社交认知能力
过去评判LLM像考核‘做题家’,但会解题不等于懂人心。腾讯团队提出SAGE框架,用会闹情绪的agent评委评估模型高阶社交认知能力。实验显示不同模型表现差异大,未来需懂人心的AI。
突发!OpenAI停止强化学习训练两周
OpenAI发文称暂停最新模型强化学习训练两周,加固研究环境、进行红队测试等。部分低风险训练已恢复,最大规模前沿模型训练仍暂停。此举源于Hugging Face安全事故及Astra模型潜在风险。