「业绩表现」共找到 2294 篇相关文章
OpenAI女CEO太狠了!智商148,GPT-5才是真印钞机
GPT-5智商高达148,在多基准测试表现亮眼获英伟达认可。OpenAI借“路由器”为ChatGPT商业化铺路,它能分流降成本、让免费用户接触深度思考模型,还可变身广告分配器,实现AI广告变现。
谷歌深夜放出 IMO 金牌模型,多项测试力压 Grok 4、OpenAI o3!网友评论两极分化
昨夜谷歌向 Google AI Ultra 订阅用户推 Deep Think 功能,Gemini 2.5 Deep Think 模型获 IMO 金牌。它是多智能体模型,通过并行思维输出答案,在多领域及测试中表现佳,但网友评价不一。
“看懂”指令并做动作!Motion-R1结合COT让角色动起来
大语言模型为文本驱动动作生成带来新可能,但现有方法有局限。GigaAI提出Motion - R1框架,融合“思维链”机制,能分解指令、优化动作合成,虽有不足,但在测试中表现优于主流方法。
换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26
扩散策略成机器人控制热门路线,但真实世界动力学多变,策略易失灵。UC Berkeley等联合提出DADP,训练统一策略,在零样本跨域控制任务表现强,尤其在OOD场景优势明显,还给出工程补充结果。
清华校友出手,8B硬刚GPT-4o!单一模型无限工具调用,终结多智能体
MIT等机构推出TIM和TIMRUN组合拳,突破模型token天花板。TIM将推理建模为任务树,TIMRUN优化内存管理。二者结合支持长程推理,实现单模型高效推理,简化智能体构建,在多方面表现出色。
大模型转行土木工程!首个「打灰人」评估基准:检验读、改工程图纸能力
首个工程自动化任务评估基准DrafterBench,可测试大模型在土木工程图纸修改任务中的表现。它模拟真实工程命令,考察模型四方面能力。评测发现主流大模型有一定能力,但未达工程一线要求。
MIT发布自适应语言模型!新任务,自生成远超「GPT-4.1合成训练数据」
麻省理工学院提出自适应语言模型框架SEAL,让大模型生成微调数据和更新指令适应新任务。实验显示,其生成的合成数据微调效果超GPT - 4.1,在少样本学习和知识整合任务表现优异。
具身智能稀缺的数据,可能藏在这个游戏手柄里?
游戏录屏平台Medal掌握的玩家操作记录成机器人模型训练核心数据。其创始人皮姆创办General Intuition获高额融资,该公司用游戏录像预训练动作模型,但也面临数据多元性、任务表现及合作模式等问题。
Pipeline MinerU真快不行了
文章聚焦Infinity-Parser,指出它把OCR从‘做识别’推进到‘做结构’。它采用layoutRL强化学习框架,结合真实与合成数据构建Infinity-Doc。跑分强且复杂结构表现优,透露Document AI向结构化生成转变趋势。
实测腾讯云 AndonQ:号称比肩原厂技术专家的 “领域虾”,到底有多能打?
文章实测腾讯云 AndonQ,它号称全球首款 ITSM“领域虾”,可适配主流“虾”类工具,集成至 IM Bot。测评显示其成本低、上手轻量,在架构选型、故障排查等场景表现出色,将 ITSM 体系浓缩到对话框。