「智能测试用例生成系统」共找到 4795 篇相关文章
打穿 AI 智商测试!GPT-6 Astra 的符号世界模型,是突破还是钞能力刷分?
OpenAI的GPT-6 Astra亮相,在ARC - AGI - 3测试成绩逼近100%,远超GPT - 5.6 Sol。它生成的符号世界模型被认为是AI迈向高级推理必经之路。不过出题人指出其靠Harness加持,离AGI还远。
超越Claude 3.5和o1!8B模型靠「分层投票+测试时训练」逆袭
近日MIT研究者发现测试时训练在大模型应对复杂推理问题时,能分解任务提升回答准确率。8B的lemma3模型经此方法,在ARC和BBH数据集上性能显著提升,超Claude 3.5等。但该策略部署效率低。
世界模型公司「厘清智能」完成数亿元种子轮融资,顺为红杉高瓴齐押注
清华系初创公司「厘清智能」完成数亿元种子轮融资,投资方豪华。其构建世界模型系统,全栈自研,释放强大泛化能力。由97年博导李一鸣领衔,集结名校人才。资本认为其是稀缺的‘范式级’团队。
硅基智能完成数亿元D轮融资,司马华鹏带领团队深耕全球AI数字人生态。
2025年8月11日硅基智能完成数亿元D轮融资,由嘉兴高新区产业基金独投。其自2017年成立已累计超10轮融资,总超十亿元。该司技术领先,打破AI落地困境,商业覆盖多行业,还构建开发者生态。
具身智能从此「边听边说」,智源研究院开源原生全双工语音大模型RoboBrain-Audio
北京智源研究院联合多方发布原生全双工语音对话大模型 RoboBrain - Audio,采用新架构和创新训练范式,在性能上全面领先,革新音频 - 文本对齐方式,丰富了 RoboBrain 全栈体系,推动具身智能发展。
九成以上模型止步白银段位,只有3个铂金!通用AI下半场评测标准来了
OpenAI研究员姚顺雨提出AI发展步入新阶段,下半场关键在评估模型真实智能。新加坡国立大学等团队提出“通才智能”评测框架,剖析多模态大模型短板,推出五级评估体系和测试集,测试结果暴露模型弱点,引发社区积极反响。
特斯拉开源硬件,中国团队开源大脑!首个具身智能顶配全家桶上线
4月特斯拉宣布人形机器人Optimus技术开放,国内智平方推出全球首个具身智能模型开源社区AlphaBrain Platform,提供全链路技术栈。该平台亮点多,还适配最新具身Benchmark,打破实验室围墙,推动技术突破。
亿级短视频数据突破具身智能Scaling Law!Being-H0提出VLA训练新范式
真机数据匮乏使具身智能VLA模型发展受限,现有真机数据与所需上亿级训练样本相差甚远。BeingBeyond团队提出创新性方案,利用人类视频手部数据构建数据集,训练出VLA模型Being - H0,经实验验证效果良好。
Anthropic智能体大会:Agent也会精神分裂,我们发现了多Agent协作的本质解法。
Anthropic开发者大会聚焦Agent,分享多智能体实战经验。Omni的Blobby出现‘精神分裂’问题,根源是内外层Agent能力认知断裂,修复方案是将工具上提。Anthropic团队则通过协商签订协议解决角色定义不一致问题。
一张4090就能爆改!面壁智能MiniCPM-V 4.6开源,1B多模态卷出新高度
今年是AI应用大规模落地年,参数小的端侧模型有特定场景性能优势。5月11日面壁智能开源MiniCPM-V 4.6,参数仅约1B,多模态能力超阿里、谷歌同类模型,还在多维度提升,站稳端侧多模态开源领域。