「科研能力」共找到 3447 篇相关文章
7个月翻一番!AI agent能力飙升,METR报告揭示指数级进化规律
非营利研究机构METR报告显示,Agent能力每7个月翻一番,这在9项基准测试中得到验证,任务涉及编程、数学等领域,大模型正迈向高度自动化,且Agent性能提升快,未来处理复杂任务能力或更强。
OpenAI CFO 摊牌:算力即营收,而 90% 的企业正被卷死在“能力鸿沟”里
本期 OpenAI 播客嘉宾,CFO Sarah Friar 和投资人 Vinod Khosla 探讨 AI 应用。指出多数人使用 AI 能力有限,2026 年是弥合“能力鸿沟”开端。还提及算力与营收相关,OpenAI 在企业端已领先,创业公司也有机会。
预训练就学会思考!字节、北大等用14亿参数,撬动百亿模型推理能力
字节、北大等联合发布Ouro模型,用14亿参数实现百亿级模型推理能力。它在预训练阶段学会循环思考,通过三大创新构建推理能力,在基准测试中表现优异,实现参数效率提升,是潜在推理范式的胜利。
TACL 综述 | 别只卷架构了——长文本模型的能力天花板,其实是数据决定的
该 TACL 综述首次从数据视角审视长上下文语言模型,指出长上下文能力本质是数据驱动。它建立分类体系,明确高质量长文数据条件,给出核心能力的数据配方与评估法,还整理数据集和基准,提出待解问题。
炸裂!Claude以第一作者写论文反驳苹果「推理模型根本没有推理能力」:苹果有三大错误
苹果论文称推理模型无推理能力,引发争议。Anthropic的Claude Opus以第一作者写论文反击,指出苹果研究有混淆‘推理失败’与‘输出截断’等三大问题,还通过实验证明模型能力,强调需更聪明评估方法。
马斯克发布 Grok 4 模型:推理能力较前代提升 10 倍,各学科测试接近满分
xAI 发布 Grok 4 及 Grok 4 Heavy 模型,推理能力较前代提升 10 倍,多测试接近满分。马斯克称其为世界最好 AI。它在多方面表现出色,如长任务能力强、推理效率佳等,但代码能力欠佳,且付费昂贵。后续还将推多款模型。
GPT-5内测抢先公布:日常推理首次击败人类,编程数学科学问题能力都很强
疑似GPT - 5发布预告刚出,内测体验抢先释出。网友实测其推理能力首超人类,编程、数学等能力也出色,虽提升或没GPT - 3到GPT - 4明显,但市场竞争激烈,8月8日凌晨OpenAI发布或为GPT - 5。
科研虾LabClaw接管实验室!斯坦福和普林斯顿重新定义人机协作边界
斯坦福和普林斯顿团队构建完整AI生态,LabClaw有206个科研技能,可部署为实验室代理;LabOS结合计算与实验,能自我进化;MedOS模仿人类认知用于临床。三者协同重新定义人机协作边界。
刚刚,Anthropic 发布 Claude for Life Sciences,目标生物科研全流程
Anthropic推出Claude for Life Sciences,全方位布局生命科学领域。它配备Skills功能,生物学测试表现提升,能解读图像、分析数据。还深度整合科研生态,应用场景广,获众多药企、学术机构青睐,还有AI for Science计划。
把AI变成你的科研搭子,公益培训启动报名!
面对科研难题,AI科研加速营招募启动。由上海人工智能实验室等主办,公益开放。以真实科研任务为主线,用“书生·端砚”实践,课程覆盖多领域,学员可获多种权益。