「多任务能力」共找到 7246 篇相关文章
GPT-5-Codex 一手实测
OpenAI推出新编程模型GPT - 5 Codex,Every团队实测显示其表现狂野。它能动态选思考时间,可在不同开发环境无缝切换,代码审查更优。但也存在对任务挑剔、环境设置麻烦等问题。
谷歌最新「0.27B」Gemma 3开源!身板小却猛如虎,开发者直呼救命稻草
大模型时代开发者算力焦虑严重,谷歌Gemma 3系列另辟蹊径。新成员Gemma 3 270M参数规模小但性能强,如在IFEval测试表现突出,有小体积强架构、省电等亮点,适用于多场景。
百度Qianfan-VL,发票/图表/合同等PDF识别94.75%刷新纪录!
当前主流视觉 - 语言模型在企业级应用有难点,百度千帆团队提出Qianfan - VL系列多模态大模型,在通用和企业级任务表现出色,基于自研芯片训练,还提供框架与管线降低成本。
听了Andrej Karpathy最新2小时访谈,我对Agent彻底祛魅了
Andrej Karpathy在播客中表示,Agent发展还需十年,离像实习生工作还差很远,要解决诸多能力问题;他认为强化学习糟糕但其他方法更糟,还提出AI应削减背书式记忆、未来强大AI或仅十亿参数等观点。
吴恩达Agentic AI新课:手把手教你搭建Agent工作流,GPT-3.5反杀GPT-4就顺手的事
吴恩达新课聚焦Agentic AI,将开发沉淀为反思、工具、规划与协作四大设计模式,强调评估与误差分析能力。课程介绍拆解任务、构建工作流方法,还分享实用技巧,让AI系统持续进化。
腾讯与中科院联合提出R-4B,一个能自动决定是否思考的多模态大模型
多模态大语言模型“始终思考”模式有缺陷,腾讯混元团队与中科院自动化所联合提出R - 4B,通过双模式退火训练和双模式策略优化实现自动思考,在多评测中达SoTA,省资源且效果好。
Meta超级智能实验室又发论文,模型混一混,性能直接SOTA
大语言模型训练依赖算力和时间,传统模型 Souping 多采用均匀平均。Meta 等研究者提出类专家 Soup(SoCE),利用基准测试类别构成选最优模型,非均匀加权平均,实验显示其提升了模型效果与稳健性,在排行榜获 SOTA 成绩。
迈向无缝共生:大模型GUI Agent的「屏幕图灵测试」与拟人化之路
多模态大模型使GUI Agent能模拟用户执行任务,但也引发与平台的利益冲突。论文提出“屏幕图灵测试”和AHB基准评估拟人化能力,探讨拟人化策略及权衡,为Agent在数字世界共生提供指南。
腾讯王者归来:混元图像3.0登顶LMArena!一手实测全球最强图像AI
LMArena最新榜单显示,腾讯「混元图像3.0」在文生图任务中夺冠,碾压谷歌Nano banana和字节Seedream 4。它9月28日开源,性能对标闭源模型,有强大推理、语义理解能力,支持中英文长文本渲染。
大型语言模型稳定强化学习的新路径:几何平均策略优化GMPO
本文介绍了大型语言模型稳定强化学习新路径——几何平均策略优化GMPO。它是GRPO稳定化版本,通过优化几何平均替代算术平均,解决GRPO训练不稳定问题,在多任务实验中显著优于GRPO。