「人类在环」共找到 8709 篇相关文章
AgentIF-OneDay 发布,评估全场景长时复杂任务
红杉中国 xbench 发布 AgentIF - OneDay 评测体系,用于评估大模型解决复杂任务的能力。该体系从任务复杂度新视角出发,沿 Scaling Context 和 Scaling Domain 推进,构造了三类典型任务进行测评,揭示了主流 Agent 的能力边界。
黄仁勋CES2026最新演讲:三个关键话题,一台“芯片怪兽”
北京时间1月6日,英伟达CEO黄仁勋在CES2026演讲。回顾过去一年开源模型发展,本次围绕系统与基础设施、模型、应用落地三条主线演讲,展示Rubin架构等成果,推动推理型AI发展及应用。
谢赛宁REPA得到大幅改进,只需不到4行代码
Adobe Research等团队对REPA展开研究,发现驱动目标表征生成性能的是空间结构而非全局性能。基于此构建iREPA,代码不到4行,能提升REPA收敛速度,在多方面表现出色。
Yoshua Bengio,刚刚成为全球首个百万引用学者!
计算机科学家Yoshua Bengio成Google Scholar上首个引用超百万的人。他是深度学习“三巨头”之一,在“AI寒冬”坚守研究,成果显著。如今他担忧AI风险,积极推动伦理准则和监管。
7年了,OpenAI官方给出五代GPT对比,网友却怀念起「狂野」初代
OpenAI总裁分享给定相同提示下,GPT-1到GPT-5输出的差异,对比显示GPT系列在知识储备等方面不断进步,但网友看法不一,不少人怀念初代模型的‘狂野’。
DeepSeek 新模型 R1-0528 悄悄开源,与o3 相当,实测来了。
DeepSeek团队悄无声息地在Hugging Face上开源推理模型新升级版DeepSeek R1-0528,基于DeepSeek-V3-0324模型,架构和训练方法有改进,性能与o3相当,实测表现不错。
Google研究发现:Multi-Agent的核心竟然是Prompt设计!
Google和剑桥大学研究多智能体系统,发现提示设计影响大,有效拓扑结构占比小。提出Mass框架分三阶段优化,实验用Gemini 1.5 Pro和Flash模型,对比多种方法,在多任务上性能显著提升。
马斯克野心升级:再投千亿建地球最大发射场,星舰要一天发30次
当地时间8月25日,SpaceX宣布投资千亿美元在路易斯安那州建巨型太空发射基地,最终成全球最大发射场,具备年支持数千次星舰飞行能力,马斯克称一天能执行超30次飞行。
Reddit一张神图疯传!2年后,你的笔记本就能跑Fable 5
r/LocalLLaMA社区一张图刷屏AI圈,显示Fable 5级AI预计2年后可在笔记本本地运行。从历史模型看,前沿能力从云端到本地约24个月。这意味着AI正从云端垄断走向桌面民主化。
LabVLA:当AI走进科学实验室,浙大x上海 AI Lab联合探索科学具身智能
浙江大学与上海人工智能实验室联合推出 LabVLA,探索更具泛化能力的科学具身智能范式。团队构建仿真数据引擎 RoboGenesis 与语料 LabEmbodied - Data,LabVLA 在多测试中表现良好,还将探索多场景应用。