「测试成绩」共找到 1892 篇相关文章
ChatGPT引爆教育革命,学习效果暴涨86.7%!
新智元报道,Nature子刊元分析汇总51项研究,揭示ChatGPT显著提升中小学生学业表现和高阶思维能力,不限学科和使用方式,还能减轻精神负担,但使用需家长和老师指导。
生数科技按下B端商业化快进键:30天签约智谱、飞书等多家行业龙头|甲子光年
AI视频生成行业商业化加速,生数科技不到一周官宣与智谱、飞书等合作。其Vidu基座模型能力强,多领域开花,2025年Q1商业化增速快,还凭交付与服务能力获头部青睐。
24小时、78轮实验、持续迭代,AiScientist自己把最优解一步一步逼出来了
中国人民大学高瓴人工智能学院的AiScientist挑战让AI持续推进研究工程。它采用“thin control over thick state”设计,通过分层编排和File - as - Bus等方式,在多任务上表现出色,为AI科研工程补上关键底座。
The Batch: 940 |Claude Mythos Preview 引发安全担忧
Anthropic为即将推出的Claude Mythos Preview采取特别预备措施,因其会带来网络安全风险。该模型能力强大,能发现众多代码漏洞。Anthropic组建联盟增强防御,其表现也优于多个知名模型。
让龙虾越用越聪明!普林斯顿大学为OpenClaw搞了个强化学习框架
普林斯顿大学研究团队发布强化学习框架OpenClaw - RL,能捕捉用户反馈与环境结果信号,有独立解耦异步机制,融合打分与文本指导,经真实场景验证效果良好,蹚出自我进化新路径。
南京大学开源SteadyDancer模型实现完美动作迁移,首帧保留彻底解决身份漂移难题
南京大学、腾讯PCG与上海人工智能实验室联合推出SteadyDancer,这是首个基于Image-to-Video范式并严格实现首帧保留的开源人像动画框架,解决了传统方法身份漂移难题,在多方面表现优异。
OpenAI的「梦醒时分」
这个冬天,OpenAI不好过。今年其概念股涨幅远逊谷歌,还深陷2070亿美元资金缺口与信任危机。谷歌凭借深厚家底复仇,OpenAI跌落神坛,一场残酷博弈正在上演。
人物一致性新王Nano Banana登基,AI图片编辑史诗级升级。
Nano Banana是神秘的AI绘图新模型,大概率出自Google。它生图一致性超强,在人物一致性、背景替换等多方面测评中完胜GPT - 4o等模型。虽仅在LMArena盲测随机出现,仍值得一试。
港科联合港中文提出AdaCtrl,自适应可控Reasoning,可降10~90%
港科联合港中文提出AdaCtrl,解决LLM推理的过度思考、算力浪费和响应延迟问题。它有自适应和用户控制两种模式,通过两阶段训练法实现目标,实验效果好,未来或拓展到多领域。
最强编码模型Claude 4来了!Mcp集成无需Client,扩展提示缓存增强Agent长上下文保持能力
Anthropic 昨日推出新一代 Claude 模型,包括 Claude Opus 4 和 Claude Sonnet 4,在编码、高级推理和 AI Agent 方面树立新标准,有卓越编码能力、显著提升的 Agent 能力、全新 API 功能,Claude Code 也全面上市。