「测试平台」共找到 2981 篇相关文章
当具身智能遇到“大脑”瓶颈,一家国家队公司决定拆掉围墙共筑基石|甲子光年
2月28日“启智涌现”开发者大会举行,启智机器人试图解决行业软硬件耦合深等矛盾。它打造通用技术底座,用大衍数据平台等构建技能进化引擎,还以新商业模式构建生态飞轮,推动机器人融入各行业。
做RAG这一年,最后悔的就是上知识图谱
基于知识图谱的检索增强生成在问答任务中存在三元组索引丢失上下文语义问题,作者提出MDER - DR双阶段框架,在标准测试和特定数据集上性能提升最高66%,还具备多方面优势。
逐项解读黄仁勋GTC演讲:Vera Rubin、token王、英伟达“龙虾”、太空计算和雪宝|甲子光年
美国当地时间3月16日,英伟达创始人黄仁勋在GTC 2026演讲,发布五项重要技术,包括下一代AI计算平台Vera Rubin等。他想让英伟达成AI基础设施公司,强调token成本,认为AI工厂是工业基础设施。
The Batch:924|GPT-5.4:性能更高,价格也更高
OpenAI更新旗舰模型GPT-5.4,有Thinking和Pro两个版本,扩展工具使用能力,多基准测试达当前先进水平,但定价高。虽在部分任务表现超Claude,挑战Gemini地位,不过成本也更高。
OpenClaw不会蛋炒饭!Ropedia放出人类经验,机器人「教科书」来了
当LeCun和李飞飞各自拿下10亿美元押注世界模型时,一个更底层的问题浮出水面:谁来为Physical AI提供真正能用的数据?Ropedia给出的答案,不是更多视频,而是一部结构化的、来自真实世界的「经验百科全书」。
安全的下一个好赛道,非常值得研究
近几年机器人发展火爆,摩根士丹利预测到2050年产业规模或超5万亿美元。但机器人领域安全复杂,研究团队用CAI框架对三款消费级机器人渗透测试,揭示严重安全问题,且行业整体对安全无知。
震惊海外开发者!BOSS直聘3B小模型比肩80B,怎么做到的?
BOSS直聘楠北阁团队发布3B轻量端侧小模型Nanbeige4.1-3B,性能震惊海外开发者。团队从多方面改进,如优化推理和偏好对齐,重构训练数据,采用多种强化学习算法,使其性能比肩大模型。
MMLU已死?「人类最后考试」登Nature:全球AI模型集体不及格!
AI发展迅猛,现有基准测试难以跟上其步伐。近1000名研究人员组成的全球联盟创建「人类最后的考试」(HLE),涵盖多领域难题,目前最强AI准确率不足50%,凸显AI与人类专家的差距。
吴恩达复盘百度岁月:我带过的自动驾驶、智能音箱都成了!Altman 我也带过,但 Gemini 3 比 ChatGPT 强
吴恩达团队提出新版图灵测试界定 AGI,避免行业泡沫。在播客中他还谈及 AI 关键议题,指出 AGI 短期难实现,规模化非唯一路径,AI 不会大面积取代岗位,中美 AI 各有优势等。
小米的首代机器人VLA大模型来了!丝滑赛德芙,推理延迟仅80ms丨全面开源
具身机器人成科技新热点,大家期待其释放生产力。小米首代具身VLA大模型Xiaomi - Robotics - 0抓间歇停顿问题,4.7B参数规模下推理延迟仅80ms,还做三项技术创新,且全面开源。