「真实世界测试」共找到 2919 篇相关文章
一场“直面行业真问题”机器人比赛的万字观赛报告|甲子光年
甲子光年发布ICRA上WBCD赛事观赛报告。该赛聚焦双臂机器人,设生命科学、物流打包、餐桌服务挑战。从实际需求出发,吸引全球团队。各赛展现不同技术亮点,如洛桑联邦理工线控、卡内基梅隆神经 - 符号架构等。
刚刚,OpenAI开放GPT-4.1,100万上下文、代码能力超强
今天凌晨1点30,OpenAI宣布开放GPT - 4.1,可在ChatGPT中使用。它针对编码任务,支持100万tokens上下文,在多项测试中表现优于前代,价格更优,不同用户将陆续获得使用权限。
豆包工作这波更新,我给满分!一大波实测来了
本文为新智元出品的实测文章,针对字节跳动豆包工作的最新三大更新展开体验测评,分析当前AI办公的核心痛点,验证新功能的实际解决效果,给出真实使用评价。
GPT-6来了,立摘ASI坐标系今日金牌!
OpenAI 正式发布 GPT - 6 Astra,在多项测试中表现优异。近期 Anthropic、谷歌也有新模型发布。马斯克、Altman 对 AI 发表看法。新智元决定做 ASI 坐标系,相关官网 9 月 7 日上线,现征集需求。
重磅!OpenAI深夜发布GPT-6 Astra,总裁Brockman:这就是AGI
OpenAI发布GPT-6 Astra,总裁称实现了AGI。它在多基准测试成绩优异,能独立完成复杂工作,网络安全能力强。但推理难监控,其即日起向特定机构开放,有使用价格标准。
0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26
大视觉语言模型带来隐蔽攻击面,现有检测器难平衡。中国人民大学与阿里巴巴集团联合提出Learning to Detect(LoD),不依赖攻击样本和手工规则,从模型内部激活学安全模式,实验效果好且代码开源。
今天,「空间原生」时代正式到来!
6月8日,工信部和国资委要求机器人年底从「表演模式」转向「作业模式」,但现有模型空间感知能力不足。今天蚂蚁灵波发布 LingBot - Depth 2.0,开源 LingBot - Vision,其采用「空间原生」路线,训练高效且表现亮眼。
刚刚,OpenClaw和Cursor杀入手机!Agent从此塞进口袋
OpenClaw和Cursor同日发布原生App,OpenClaw上架全血原生App,可无缝交互,解锁设备底层能力;Cursor发布iOS应用公开测试版,可让开发者在手机上指挥代码开发,重塑人类工作方式。
AI软递归自我提升,Hassabis夜不能寐:人类已至奇点山脚
AI递归自改进和研究自动化正从概念走向现实,哈萨比斯称人类站在「奇点山脚」。Claude已独立编写超80%代码,Anthropic工程师效率大幅提升。但AI递归也带来安全风险,全球实验室陷入「囚徒困境」。
ICML 2026 | Agentic强化学习训练的信息自锁问题
随着大语言模型走向真实交互,强化学习训练LLM agents时出现信息自锁问题。香港中文大学等研究者分析其原因并提出AREW方法,在多场景实验中表现稳定且具鲁棒性。