「测试全流程」共找到 3925 篇相关文章
大模型可否胸有成竹?探索LLM推理与自信心的关系 | 直播预约
本次全英文直播将探讨大语言模型推理能力扩展瓶颈,介绍以置信度为核心的推理视角,展示“自确定性”指标及应用,还会讨论方法有效性和“基于置信度的推理”意义。
小米MiMo-V2-Flash开源:3090亿参数大模型能否改写AI行业规则!
2025年12月16日小米开源旗舰大模型MiMo - V2 - Flash,参数3090亿。它有独创‘按需激活’机制,推理成本低。采用MIT协议,价格亲民,构建全栈开源矩阵,在编程、长文本处理等领域表现出色。
OpenAI 囤 DRAM 晶圆,内存价格炸了!32GB DDR5 一月狂涨 156%,厂商倒买、交货延期,商业遏制引市场崩盘?
文章指出OpenAI两笔巨额DRAM采购致全行业恐慌囤货,内存价格疯涨,32GB DDR5一月涨156%。原因是交易保密、规模大,且市场无安全库存。OpenAI买原始晶圆囤货,或为遏制对手。
ICLR重磅回应:评审回滚、AC重置、封禁泄密者、严查贿赂串通
自11月27日OpenReview平台曝出重大API漏洞,ICLR 2026超10000篇投稿数据泄露,评审流程熔断。ICLR公布处理方案,回滚评审数据、重分领域主席,封禁泄密者,涉串通论文将拒稿。
Github 1.8k star Skyvern:AI直接接管鼠标键盘,3行API干掉你写了3年的脆弱XPath脚本!
Skyvern是开源AI浏览器代理,结合LLM和计算机视觉,自动执行浏览器业务流程。它用简单API复刻人工操作,替代传统脚本,解决脚本脆弱、流程复杂等痛点,功能丰富,技术优势明显,适合多业务场景。
罗福莉首个小米成果!开源具身大模型
正式入职小米不到10天,罗福莉作为核心作者的首篇论文出炉。MiMo团队提出并开源全球首个打通自驾与具身操作领域的跨具身基座模型MiMo - Embodied,在29个Benchmark上霸榜。
AI终于学会「读懂人心」,带飞DeepSeek R1,OpenAI o3等模型
威斯康星大学麦迪逊分校联合清华的研究《MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems》,将元认知理论融入LLM架构,使模型在心智理论测试达人类平均水平,揭示构建社交智能AI方法论。
“中国英伟达”,离上市只差临门一脚
摩尔线程、沐曦等国产AI芯片企业距上市仅一步之遥,部分已在港交所提交申请表。企业闯关IPO面临诸多挑战,成功可获资金,失败或“失血而死”。上市后有望造富,也面临市场竞争,最终谁胜出要看生态构建。
谷歌Nano Banana 2 来了,图片AGI提前到来?
伴随Gemini 3、GPT 5.1小道消息,谷歌Nano Banana 2提前到来。它采用多步骤生成流程,有自我纠错循环,能替代部分Photoshop功能,在细节、配色等方面比一代提升明显,即将正式上线。
360发布全球最强视觉语言对齐模型!榜单全面领先!
360发布FG - CLIP 2双语细粒度视觉语言对齐模型,几乎在所有数据集上全面领先。它能让AI在统一框架内看懂图像细节、理解中英双语,团队还提出新中文多模态评测基准。