测试时深思」共找到 2293 篇相关文章

算法论文8

像开发软件一样造世界,Agent2World来了,把世界模型做成可运行的符号环境

为让模型真正“能行动”,需可执行、可验证的符号世界模型,但现有自动生成路线有困局。研究团队提出 Agent2World,经实验验证有显著效果,能稳定产出高质量符号世界模型,开辟 AI 理解现实环境新可能。

机器之心
推荐文章8

“AI 在一线:开发人员如何重塑软件开发流程” |圆桌讨论

文章是关于“AI在一线:开发人员如何重塑软件开发流程”的圆桌讨论,多位嘉宾分享了AI辅助工具对软件开发的影响,包括加速原型设计、缩短项目间等,也提到了局限性和需注意的问题,如信任和度量标准。

InfoQ
新闻资讯7

ChatGPT开始预测用户年龄,NSFW内容要来了!

OpenAI于1月20日更新推出年龄预测功能,通过分析用户多方面信息判断是否为18岁以下。网友测试发现猜测较准,这或使NSFW内容限制放宽,不同模型版本情况有别,更新还改进语音和记忆功能。

AI工程化
算法论文8

上海人工智能实验室让AI像科学家一样在探索中发明工具

上海人工智能实验室等团队提出推理工具演化(TTE)框架,推动AI在科学领域从被动选工具到主动发明工具。它解决传统工具库问题,提升多学科推理准确率,赋予AI跨学科迁移能力。

AIGC开放社区
开源动态8

2026开年王炸模型MiroThinker 1.5实测:Google和GPT没做到的事,被它做到了

自媒体从业者实测开源模型MiroThinker 1.5,它不拼参数规模,注重去伪存真。在多场景测试中表现出色,如投资决策、内容查证等。其技术揭示大模型未来或在于外部交互,而非参数膨胀。

AI寒武纪
推荐文章8

程序员每十年就“要被取代”一次:这件事从 1969 年开始

文章回顾软件开发史,从 COBOL 到如今的 AI 编程工具,每次新技术都承诺让编程变简单,但始终无法绕开复杂性。指出软件开发瓶颈在处理复杂性的思考能力,提醒用新工具保持清醒。

InfoQ
算法论文8

解锁任意步数文生图,港大&Adobe全新Self-E框架学会自我评估

香港大学与Adobe Research联合发布Self - E框架,可从零训练实现任意步数文生图。它改变训练范式,用两条互补训练信号,在GenEval基准表现出色,让文生图训练更灵活且具扩展性。

机器之心
推荐文章7

基于一个MXFP8量化Kernel谈一谈如何在B200上实现高性能的Memory Bound Kernel

作者向SGLang社区提交基于CUTLASS的MXFP8 Blockscaled Grouped GEMM实现,其中包含量化Kernel。文章关注此Kernel,介绍在B200上实现高性能Memory Bound Kernel的优化技术,如整体设计、向量化与合并访问、Occupancy优化、TMA利用等。

GiantPandaLLM
算法论文8

必须得让AI明白,有些不该碰的东西别碰(doge)

近期类o3模型在视觉推理任务表现优异,但陷入‘盲目用工具’状态。港中文MMLab等团队提出AdaTooler-V模型,具备自适应工具使用能力,还引入指标、算法,构建数据集,在多基准测评中优势明显。

量子位
新闻资讯8

性能真的不重要了吗?Jeff Dean给出反常答案

Google传奇工程师Jeff Dean更新文档《Performance Hints》,指出性能不是最后调出来的,而是写代码初始就注定的。很多人因对‘慢’无感、忽视性能,导致代码低效,顶级工程师则有‘物理地图’,能避开高成本路径。

新智元