中科大」共找到 6834 篇相关文章

新闻资讯8

字节发布全球首个预测未来基准FutureX,Grok-4 拿下冠军

字节跳动发布全球首个实时未来预测基准测试FutureX,杜绝模型作弊。在25个模型评测,Grok - 4夺冠。它从多网站构建问题,分四级难度。人类专家在部分等级仍领先AI 。

AGI Hunt
算法论文8

Google研究发现:Multi-Agent的核心竟然是Prompt设计!

Google和剑桥学研究多智能体系统,发现提示设计影响,有效拓扑结构占比小。提出Mass框架分三阶段优化,实验用Gemini 1.5 Pro和Flash模型,对比多种方法,在多任务上性能显著提升。

PaperAgent
算法论文8

GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题

上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距

量子位
新闻资讯7

小展直击爆款毕设幕后!AI 能偷走人类的艺术灵魂?

最近AI绘画风很,有人喊“人类要失业”,但郭奕彤带着《合成图像家庭》站出来打脸。他用碳笔勾勒‘毕加索版’耳朵图图,让AI‘打辅助’,还给电视装‘随机盲盒’系统定制影像。

搜狐看展
开源动态8

AI智能体也有「蜘蛛感应」,防御延时骤降至8.3%

传统Agent防御机制易致延时积累,研究者联合推出Spider - Sense智能体防御框架,利用两核心技术将防御延时从200% + 降至8.3%,在主流数据集和新基准测试表现优异。

新智元
产品应用7

Cursor自研模型反超Opus 4.6!价格脚踝斩,氛围编程沸腾了

Cursor新编程模型Composer 2性能超Claude Opus 4.6,价格“脚踝斩”。它靠引入新强化学习方法,让模型学会“做笔记”突破上下文瓶颈,在任务表现出色,研究员还放出Composer 3消息。

量子位
开源动态8

The Batch: 855 | 为智能体而生

总部位于北京的 Moonshot AI 发布 1 万亿参数的 Kimi K2 系列语言模型,包括预训练和微调版本。它输入输出能力强,架构独特,在多基准测试领先,支持工具调用,多家服务商已集成。

DeeplearningAI
算法论文8

AI 的本质不是算力,而是「上下文革命」

上交刘鹏飞团队提出人工智能本质是“上下文革命”,在论文把“上下文”提升为智能系统核心结构,提出“上下文工程”学框架,通过实验揭示智能发展规律,为AI发展指明新方向。

AI科技评论
开源动态8

最低仅需2G显存,谷歌开源端侧模型刷新竞技场纪录,原生支持图像视频

今天凌晨,谷歌官宣Gemma 3n,原生支持多模态。它在模型竞技场超1300分,是首个超此分数的10B以下模型。其VRAM占用低,最低2GB,已在谷歌AI Studio等可用,还公开了技术细节。

量子位
新闻资讯8

刚刚Gemini上新模型,全球只有7人比它会编程,谷歌姚顺宇参与

北京时间周五凌晨,谷歌发布Gemini 3 Deep Think重升级,在多学术基准测试取得佳绩,成本幅降低,编程能力超多数人。在多学领域表现出色,还推动了实际应用,已上线供部分用户使用。

机器之心