「研究能力」共找到 4714 篇相关文章
GPT-5「全家桶」爆出本周上线!惊艳首测秒出网页,编程彻底起飞
传闻GPT - 5发布时间提前,本月底面世,它有4个版本。网友在LMArena实测,GPT - 5 - pro能一键生成网站,GPT - 5 - high表现出色。美国部分公司已拿到预览版,其新功能或改写编程局面。
14%论文都有AI代写?Nature:每7篇就有1篇藏有ChatGPT特征词
据Nature报道,研究发现在2024年PubMed上超20万篇生物医学研究摘要频繁出现LLM特征词。部分国家和学科中,AI辅助写作比例超五分之一且趋势上升,作者还会引导LLM规避痕迹。
条条电路通罗马:大模型可解释性的「唯一机制」可能从一开始就不存在
长期以来,机制可解释性领域默认模型对同一任务的能力对应唯一内部「电路」。但被ICML 2026接收的新论文指出,「唯一电路」可能不存在,同一任务可由多个结构不同但能力相当的电路完成。
8岁小孩哥「聊出」操作系统,一部手机、几句话,原生App直接生成
8岁小孩扑满借助秒哒做出「操作系统」雏形,百度2026 Create大会上秒哒3.0迎重要升级,从移动端、原生App、企业版、Agent能力四个维度重构,降低开发门槛,提升能力至生产级。
把 MiniMax M2.7 扔进真实业务里:它替我省了 BI 和程序员的钱
作者测试 MiniMax M2.7,用含复杂数据的 Excel 测试其办公能力,让其开发管理系统验证工程能力,还测试 MaxClaw 多步骤 Agent。结果显示它表现出色,但处理复杂事件仍待优化。
只会写代码没戏了!奥特曼最新面试题曝光:1人要干1个团队的活
OpenAI开年首场答疑会,奥特曼坐镇回应关切。他承认团队为追求ChatGPT编程能力,牺牲创意协作能力。还谈及软件工程未来变革、AI成本降低、Agent自主运行等问题,也对众多提问给出看法。
顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤
UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态大模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。
太卷了!专属Coding的新一代Arena榜单来了,有国产模型登上榜首
大模型编程竞争激烈,编码能力提升成军备竞赛。LMArena发布新世代大模型编码评估系统Code Arena,国产模型智谱GLM - 4.6登上榜首,其编码能力获认可,彰显国产大模型硬核实力。
给定"标价"的 LLM 智能体,能规划出"最优"路径吗?
在LLM智能体多轮工具使用中,评估成本是难题。来自多所高校的团队推出CostBench基准,围绕旅行规划构建评估环境。评估顶尖模型发现其规划与适应能力有短板,并分析失效根源,还指出下一代智能体演进方向。
为什么 AI 搞不定体力活——对话清华大学刘嘉:这才是生物智能最难攻克的“万里长征” | 万有引力
本文是对清华大学刘嘉教授的访谈。他回顾 AI 研究经历,谈 AI 寒冬、研究错误及第一性原理,还分析学术界与工业界差异、AI 现状与挑战,指出大模型缺创造力,人应与 AI 共进化。