「推理评测」共找到 2556 篇相关文章
吴恩达年度AI总结来了!附带一份软件开发学习小tips
AI大神吴恩达总结2025热门AI趋势,包括模型推理成标配、Meta引发人才争夺战、数据中心火热、智能体编程重塑软件开发。还给出软件开发学习建议,如参加课程、动手实践、读论文。
刚刚,马斯克发布Grok 4!全榜第一,年费飚到2万+
北京时间中午,马斯克现身 xAI 发布会发布 Grok 4,称其是世界最好的 AI。Grok 4 推理能力强,多类基准测试成绩领先,还在多方面能力获加强,已上线但付费昂贵。
桌面 Agent 的下一步:不是会操作,而是会调度工具
复旦大学和通义实验室提出 ToolCUA,让模型在 GUI 与工具调用间编排路径。它从已有 GUI 轨迹合成训练数据,设计奖励机制,在 OSWorld - MCP 评测中效率与准确率大幅提升,为 CUA 发展提供方向。
刚刚,阿里官方认领神秘「欢乐马」,来自ATH郑波团队
周二晚间,AI评测平台Artificial Analysis上,‘欢乐马’空降榜首引热议。现阿里官方认领,它是ATH郑波团队模型,正内测,近期将开放API。其在多项排行榜表现出色,支持四种视频生成模式。
再不怕乱引文献!绕过付费墙,BibAgent把学术核验转为证据链
大模型生成学术论述,其引用验证成难题,尤其付费墙后论文难以核验。BIBAGENT突破此困境,不破解付费墙也能验证引文语义真伪,还构建MISCITEBENCH评测,表现优异,为科学写作补“可审计基础设施”。
源神阿里!图像生成Ovis-Image再开源,7B小参数媲美GPT-4o和20B开源模型
阿里Ovis团队发布Ovis - Image,7B参数文本到图像模型,在文本渲染任务媲美GPT - 4o和20B + 开源模型。它架构优化、数据工程精细、训练范式独特,实测数据表现佳,显存占用低、推理快。
Lumina-mGPT 2.0:自回归模型华丽复兴,媲美顶尖扩散模型
上海人工智能实验室等团队提出Lumina - mGPT 2.0自回归模型,统一多种图像任务。它采用独立训练架构、统一多任务处理框架和高效推理策略,实验表现优异,后续将优化采样时间并扩展至多模态理解。
AI安全的过去与未来:从大模型到智能体 | 预约
业界提升前沿AI模型和智能体安全性,常用安全评测和‘安全对齐’技术,但未真正解决风险。本次分享将介绍‘内生安全’探索成果,还公布了相关论文信息,刘东瑞等嘉宾将参与。
分割一切、3D重建一切还不够,Meta开源SAM Audio分割一切声音
Meta 深夜放出音频分割模型 SAM Audio,可通过多模态提示分离任意声音。其核心 PE - AV 推动性能领先,还发布评测模型、基准等,整合进新平台,虽有局限但为音频 AI 带来新可能。
深夜炸场!Claude Sonnet 4.5上线,自主编程30小时,网友实测:一次调用重构代码库,新增3000行代码却运行失败
Anthropic推出Claude Sonnet 4.5,号称‘世界上最好的编码模型’,持续运行时长、推理等能力提升,‘幻觉’等问题改进,Claude Code也有更新,开发者实测有惊喜也有问题,新一轮AI‘内卷’开启。