「AI模型测试」共找到 14004 篇相关文章
Mistral 为 Le Chat 新增远程智能体与 Work 模式
Mistral发布1280亿参数的Mistral Medium 3.5模型,在Vibe和Le Chat引入云端智能体能力,还在Le Chat新增Work模式。新模型可自托管,支持长上下文窗口。社区反馈积极,开发者认可,也有人嫌定价贵。
实证:现在的LLM根本不会Reasoning!
论文指出当前大推理模型(LRM)如DeepSeek - R1等可能只是在表演“思考秀”,遇到复杂问题就崩溃。研究者用4个可控谜题测试,有三大颠覆发现,还揭示思考过程的荒诞现象,直指行业痛点并给出发展方向。
夸克做ChatBot,为什么是现在?
AI行业曾有“垂直Agent幻觉”误区,重演App时代“功能碎片化”老路。而模型趋势是泛化与整合。10月23日夸克上线“对话助手”,其此时入局是基于技术、竞争和交互形态三重判断,且有模型和系统双重保障。
Claude自主发现类CRISPR新酶系统,但还不知道它能干什么,张锋点评:值得研究
本文报道Anthropic旗下Claude大模型独立完成搜索分析,从噬菌体DNA中发现此前未被发现的类CRISPR新酶系统ART,展示了大模型在生命科学新发现中的独特能力,目前ART功能尚未明确,张锋点评其值得进一步研究。
5Y News|GIM 完成数千万元天使轮融资
日前,GIM宣布完成数千万元天使轮融资,由五源资本与Monolith投资。资金用于自研金融大模型迭代等。其定位自进化智能体投资平台,已推自研金融时序大模型,未来将推基金策略与产品。
刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代
OpenAI官宣下一代旗舰模型GPT - 6 Astra,定义其为「世界上最智能、对齐程度最高」的模型。它多项基准测试成绩惊人,在编程、计算机使用等多领域表现卓越,还改写科研纪录,不过因安全能力强暂未全开放。
用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单
本文讨论GPT-6 Astra接入机器人控制取得亮眼单项成绩,但真机测试暴露不安全不稳定问题,介绍穹彻智能发布的开源RoboRSI多智能体自进化框架,解决具身智能落地核心痛点,探讨大模型时代具身智能行业的发展方向
强化学习之父Richard Sutton最新采访:LLM是“死路一条”
强化学习之父Richard Sutton在采访中批判当前由LLMs主导的AI发展路径,认为其是死胡同,缺乏真实世界模型与目标。他构想‘经验时代’新范式,预言权力向更高级智能转移,也指出未来面临腐败与价值观挑战。
近十年后谷歌与波士顿动力再「牵手」,这次要为人形机器人注入「灵魂」
近日,在 CES 2026 上,波士顿动力与谷歌 DeepMind 宣布达成全新 AI 合作,将 Gemini Robotics AI 模型与 Atlas 人形机器人深度整合,赋能其完成工业任务,首个应用领域是汽车行业。双方曾有过交集,此次合作被网友看好。
网易云音乐前 CTO 曹偲:代码越来越不重要,好的架构才是软件工程核心
网易云音乐前CTO曹偲推出AI Coding产品Toco AI,旨在将确定性和工程性带入AI Coding。他认为架构决定软件开发上下限,代码会逐渐黑盒化,业务架构更重要且难被AI取代,产品可助力软件开发。