「中科大」共找到 6825 篇相关文章
GPT-Image-2正式发布!设计师可以告别「古法设计」了
OpenAI正式发布ChatGPT Images 2.0(GPT - Image - 2),它是首个具“思考”能力的图像模型,处理复杂任务能力强,实测在商品广告、论文海报等场景表现出色,已全量上线,在大模型竞技中领先。
“中科院系”两家科技巨头合并:国产算力格局要变天?
美国切断部分对华半导体技术出口,国内算力产业有新动作,海光信息换股吸收合并中科曙光。当下中美算力竞争焦点转向‘生态’,英伟达等靠生态占据优势,此次合并或构建国产算力生态。
一个模型千万个灵魂!Anthropic找到了防止AI陷入疯狂的防线
Anthropic和牛津大学研究发现,大模型的AI助理角色易在长对话中漂移崩塌,致其陷入幻觉。研究解析助理轴,揭示模型人格定位,还提出激活上限技术,能在保能力的同时降低有害回复率。
LLM后训练太烧钱?清华&腾讯有了破解法门:关键是得会Rollout
大模型强化学习后训练中,rollout预算易成瓶颈,且并非所有rollout都有用。清华和腾讯研究者提出TRACE框架,将Agent轨迹视为树,分配预算给易产生“成功/失败对比”的节点,实验显示其效果良好。
上百个Agent,该怎么管?清华团队新思路:重做Session
当Agent数量增多,管理难题凸显。清华与中大团队开源OpenRath,以Session为核心,让多Agent共享状态。它借鉴PyTorch,解决了证据存储、状态流动等问题,使Agent集群管理更高效。
重复一下提示词,Gemini准确率竟从21%飙升至97%!
Google Research团队研究发现,重复提示词可让Gemini准确率从21.33%升至97.33%。该策略能提升主流大模型非推理任务表现,在多模型多基准测试中优势明显,且不增加延迟。
音频全能王炸!小米MiMo-Audio开源,力压Gemini/GPT-4o!
小米团队开源通用音频大模型MiMo-Audio,集多种功能于一身,支持7国语言零样本克隆和中英混合合成。首包延迟低,效果自然稳定。在多个基准测试中表现优于Gemini-2.5-Flash和GPT-4o-Audio。
OCR 发生了一件反直觉的事
百度 PaddleOCR 团队的 500 万参数模型 PP - OCRv5,在文字识别准确率上可与 Qwen3 - VL、GPT - 4o 等巨无霸模型抗衡。团队挑战‘模型越大,效果越好’,认为 OCR 中数据质量比参数重要,通过实验证明并优化数据。
谷歌Nature震撼发文,Gemini教练暴打专家!医学双料冠军,秒出睡眠报告
谷歌DeepMind把Gemini版大模型PH - LLM调教成「AI健康私教」,将可穿戴设备数据转化为睡眠健身建议,准确率超人类医生。它经两阶段训练,在多项测试中表现优异,或开启预防医学未来。
智能交互终于步入真·人机交互时代了,这很讯飞
科大讯飞发布会上展示智能硬件新范式,AIUI升级实现拟人自然对话,机器人超脑平台赋能机器人,还有数字人等成果。其交互技术不断突破,展示全链技术方案,推动产业升级。