事实保真度验证」共找到 874 篇相关文章

算法论文8

ACL'25 | CIGEval:一种基于多模态大模型的可控生图评测智能体

阿里国际AI团队提出CIGEval,这是基于多模态大模型驱动的图像生成评估智能体框架。它集成多功能工具箱,通过任务拆解与工具调度提升评估准确性与可解释性,已在ComfyUI - Copilot上线。

PaperAgent
新闻资讯8

Andrej Karpathy 分享ChatGPT模型选择指南

前OpenAI创始成员Andrej Karpathy发文分享ChatGPT模型使用指南,点出关键事实,如o3适合重要任务。社区热烈讨论,专业用户分享策略,还对o4 - mini等模型表现给出反馈。

AGI Hunt
算法论文8

爆火论文颠覆RL认知!「错误奖励」让LLM推理暴涨24.6%,学界惊了

最新爆火论文颠覆传统RL训练认知,华盛顿大学等团队证实「伪奖励」可让LLM推理性能提升。研究设置多种伪奖励形式实验,发现其对Qwen模型有效,但并非对所有模型都有效。

新智元
开源动态7

骨灰级克隆网站设计的开源项目

现在克隆网站设计常停留在截图和吸色,难以完全还原。designlang 项目用无头浏览器打开 URL,从实时 DOM 读取设计系统,输出多个文件,还能做到布局模式等其他提取器做不到的事。

GitHubStore
新闻资讯7

癌症疫苗爆火后,mRNA再迎突破:新技术有望让RNA在体内“活得更久”

8月19日,Moderna与默沙东个体化mRNA癌症疗法试验有阳性结果,引发mRNA话题热议。次日,名古屋大学与富士胶片针对环状RNA开发新LNP递送系统并验证功能,触及RNA长期治疗关键问题。

DeepTech深科技
新闻资讯7

英伟达和AMD,开始争夺AI制药的计算入口

每年的 Advancing AI 大会,AMD 都要回答 Instinct GPU 除训练大模型外的应用问题。今年大会上,AMD 把一个位置留给 AI 制药公司 MindWalk。而其对手英伟达已在生命科学领域布局多年,生命科学成两家竞争新战场。

DeepTech深科技
开源动态8

今天,「空间原生」时代正式到来!

6月8日,工信部和国资委要求机器人年底从「表演模式」转向「作业模式」,但现有模型空间感知能力不足。今天蚂蚁灵波发布 LingBot - Depth 2.0,开源 LingBot - Vision,其采用「空间原生」路线,训练高效且表现亮眼。

机器之心
新闻资讯8

李飞飞LeCun疯狂加注!这匹中国黑马,已在因果AI暗战6年

世界模型成AI核心战场,背后是行业向因果科学转向。多数人2026年关注“因果”,中国零犀科技早在2020年就探索因果AI,自研因果大模型,搭建工程架构,将能力融入业务体系,提前布局优势凸显。

新智元
产品应用8

让 AI 自己做增长:基于OPC和Harness思想的自主增长系统探索

文章围绕让AI自主做增长,基于OPC和Harness思想构建自主增长系统展开。介绍了系统背景、做法、多Agent架构落地方案,还提及踩坑问题、解决方案及对未来的思考,如完善数据集、探索OPC + AI Agent模式。

阿里云开发者
算法论文8

全球排名前三,复旦自进化Harness Engineering让GPT‑5.4再涨7个点

2026 年以来,Harness Engineering 成业界热词。复旦大学等团队提出 Agentic Harness Engineering (AHE),可实现 Harness 自动优化。实验中,AHE 让 GPT - 5.4 分数提升,适配 GPT - 5.5 后排名全球第三,且有良好泛化能力。

机器之心