分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA
分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA刚读了一篇 AI4AI 论文《AI4AI at Scale》,来自 XYZ Agentic Team。还是第一次听到这个 Lab。他们用 AI4AI 的方式做出了两个很强的搜索 agent,也公开了方法。借这篇 paper 讲讲 AI4AI 到底怎么工作,下面尽量少堆术语。
搜索
刚读了一篇 AI4AI 论文《AI4AI at Scale》,来自 XYZ Agentic Team。还是第一次听到这个 Lab。他们用 AI4AI 的方式做出了两个很强的搜索 agent,也公开了方法。借这篇 paper 讲讲 AI4AI 到底怎么工作,下面尽量少堆术语。
官宣入职 Anthropic 才两个多月,Andrej Karpathy 就要走了?刚刚,有网友发现 Karpathy 修改了自己的个人简介,去掉了其中的公司信息。在删除之前,他的信息简介栏有着清晰的「Anthropic」字眼。有人说,这个改动发生在昨天。
你有没有想过,写代码这件事的对象正在悄悄换人?上周一晚上,我在旧金山Market Street上WorkOS的办公室里待了将近两个小时,看了二十几个现场demo。进门之前我以为这只是一场普通的创业展示夜,但看完之后我意识到,这群人在展示的根本不是产品,而是他们对"写代码、用代码、读代码"这件事本身的理解,已经发生了多深的变化。
SFT是LLM从“通才”变成“专才”的关键步骤。业界默认做法是:准备标注数据(QA对、指令-回复对等)在基座模型上跑SFT训练。看loss曲线收敛了→认为训练完成。但问题在于:loss是全局平均,掩盖了样本间的差异。loss收敛只代表“大部分样本学会了”——那些始终学不会的样本被淹没了。
「我们删除了 80% 的 Claude Code 系统提示,这是我们从编写系统提示词、Skill 和 Claude.MD 中学到的。」本周五,Claude Opus 5 正式上线,Anthropic 技术团队成员 Thariq Shihipar 立即发帖,向我们介绍了新一代大语言模型之上,工程方面的趋势变化。
2023 年他在深圳创立听象科技,推出自有品牌昂听 ELEHEAR(下文统一简称 ELEHEAR)。前期发布 Alpha 系列产品试水助听器市场,2024 年 10 月推出旗舰产品 Beyond,凭借全栈自研的 AI 助听器+远程实时验配的新模式,用 1 年时间做到了美国亚马逊助听器类目 Top1,年销超 1500 万美元,市场份额从 1% 迅速增长至 18%。
停停停!Kimi K3的最佳打开方式可能不在Coding——用它做前端设计,才是真·Interesting。在Design Arena最新公布的单次生成前端榜单中,Kimi K3以1414分位列第一,力压Fable 5和GPT-5.6 Sol。
E-GRM的核心思路就是让模型自己判断输入复杂度——通过多次采样看答案是否收敛。收敛了就直接回答,不收敛再触发CoT。在RM-Bench、RMB、RewardBench三个基准上,约58%的样本被智能路由到“直答”,延迟降低62%,同时准确率还有提升。
近日,Meta 首席 AI 官、被称为公司“最高薪员工”的 Alexandr Wang,因一句简单却极具挑衅意味的话引起热议:“gemini who?(Gemini,谁啊?)”这场口水战的背后,其实是一场 AI 巨头之间的公开较量——Meta 最新模型 Muse Spark 1.1 在一份模型排行榜中超过了谷歌刚发布的 Gemini 3.6 Flash
近日,全球化AI互动娱乐平台海艺(SeaArt)宣布完成超亿元B轮融资。本轮融资由视觉中国、华盖创赢、祥峰投资联合领投,广发信德、天投资本、川创投、广州合伟永晟跟投。此前海艺曾获阿里、腾讯、招银国际、钟鼎资本、Actoz、上海人工智能产业系列基金、和溋资本等知名产业基金和财务投资机构加持。