Asana 使用 GPT-6 Astra 降低模型成本 76 倍
Asana 通过 Codex 集成 GPT-6 Astra,使浏览器代理成本降低 76 倍,速度提升 5 倍,提供更强大的模型。
Asana 通过 Codex 集成 GPT-6 Astra,使浏览器代理成本降低 76 倍,速度提升 5 倍,提供更强大的模型。
星动纪元自研世界动作模型VPP2在RoboDojo仿真榜单以平均成功率32.26%、平均得分39.26分拿下综合第一,领先GPT-6-Astra的22.48%和28.97分,并在泛化、精细操作、记忆三个维度居首。
Anthropic 发布 Claude Haiku 5.5 模型,称其为迄今速度最快、成本最低且能力最强的 Haiku 系列,平均运行成本较 Haiku 4.5 降低约 75%。
Hugging Face 发布了开源多模态决策模型 d1-3B 和 d1-omni-600M,支持文本和图像输入,其中 d1-3B 在决策索引 0.2.1 上得分 48.57,领先于所有 4B 和 9B 模型。
推荐理由:该模型在多个任务上表现出色,且支持多模态输入,具有实际应用价值。
Falcon ASR,由阿布扎比的科技创新研究所(TII)开发的1.6亿参数阿拉伯语语音识别模型,在阿拉伯语测试集中实现了20.92%的平均词错误率,支持阿拉伯语、英语、法语、西班牙语和葡萄牙语。
Nemotron 在 IOI 和 IMO 竞赛中取得了优异成绩,通过微调和强化学习等方法,展示了其在特定领域的强大适应性和可扩展性。
推荐理由:Nemotron 在 IOI 和 IMO 竞赛中取得了优异成绩,展示了其在特定领域的强大适应性和可扩展性。
GPT-6 在 ChatGPT 中推出全球版本,配备智能 UI,提供带有视觉和交互体验的更快响应。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
DeepMind 发布了 EmbeddingGemma 2,这是一个开源的多模态嵌入模型,能够将文本、图像、音频和视频组合映射到统一的嵌入空间。它基于 Gemma 4 架构,具有 7.4 亿个参数,适用于设备端推理。
推荐理由:EmbeddingGemma 2 是一个开源的多模态嵌入模型,具有轻量级和强大的功能,适用于设备端的多模态嵌入和搜索。读者可以了解其能力变化和开放入口,从而判断它将如何改变现有工作流。
Google 发布了新的 EmbeddingGemma 2 多模态嵌入模型,该模型能够将文本、图像、音频和视频组合映射到统一的嵌入空间,支持设备端推理,并具有高效存储和扩展的上下文处理能力。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
OpenAI 发布 GPT-6 模型使用指南,指导初创公司如何选择 GPT-6 模型、调整推理努力、优化提示和技能、协调工具以及为生产准备工作流程。
推荐理由:本文为 OpenAI 官方发布,提供了 GPT-6 模型选择、推理努力调整、提示和技能优化、工具协调以及生产工作流程准备等方面的指导,对了解 GPT-6 模型应用有重要参考价值。
DeepMind 发布了新的前沿模型 Gemini 4 Argon,该模型旨在通过其强大的推理能力,改变 Google 的工作和构建方式。Argon 在现实世界的软件工程、企业知识工作(如法律和金融)以及网络安全防御方面表现出前沿性能。该模型将逐步向可信的网络安全防御者推出,并计划以每百万输入令牌 2 美元和每百万输出令牌 10 美元的入门价格推出。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
DeepMind 推出 SynthID Bio,一种水印技术,用于合成生物学,以增强生物安全和科学诚信。该技术将不可察觉的签名嵌入到生物代码中,确保水印在数字模型和合成的物理蛋白质上都是可验证的,同时保持其生物功能。
推荐理由:SynthID Bio 是 DeepMind 开发的一种生物安全工具,通过在 AI 生成的蛋白质中嵌入不可察觉的签名,以增强生物安全和科学诚信。读者可以了解其工作原理和应用场景,以及它如何帮助解决生物安全挑战。
Hugging Face推出Open TTS Leaderboard,旨在为开源多语言语音合成和声音克隆模型提供可扩展评估。该平台采用客观指标评估模型的可懂度、速度和说话人相似度,旨在为社区提供有用的参考点。
OpenAI 推出 GPT-6.1 Sol 模型,具有近 Astra 智能体功能,适用于编码、计算机使用和专业工作,API 输入输出 token 价格仅为 Astra 标准的五分之一。
推荐理由:原文介绍了 GPT-6.1 Sol 的近 Astra 智能体功能,读者可以了解其在编码、计算机使用和专业工作中的应用。
Hugging Face 发布了新的智能体模型 Holo4,包括 27B dense 和 35B-A3B Mixture of Experts 两种版本,支持多种接口,并在学术基准测试中表现出色。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,两款文本到语音模型,支持自然语言提示、角色定制和多种语言方言,旨在为创作者、开发者和企业提供更丰富、更具表现力的音频体验。
DeepMind 发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 模型,这两个模型在实时推理和智能体任务完成方面取得了显著进步,并提供了更流畅的语音交互体验。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Hugging Face Jobs 上使用 LoRA 和 AsyncGRPOTrainer 进行高效训练,通过 LoRA 技术和异步训练方法,实现了训练和推理分离,并提高了训练效率。
DeepMind 发布了 AlphaGenome Atlas,一个包含 90 亿个单核苷酸变异预测的平台,旨在帮助研究人员更好地理解基因变异对生物学的影响。
推荐理由:AlphaGenome Atlas 提供了关于人类基因组中所有可能的 DNA 变异的预测,有助于加速我们对生物学的理解,并为研究人员提供了强大的工具来探索基因组数据。
DeepMind 发布了 WeatherNext 3,这是一个最先进和精确的全球天气 AI 模型,它集成了实时卫星数据、每小时刷新、更高分辨率、精确降水预测和清洁能源变量。
推荐理由:WeatherNext 3 模型在精度和分辨率上取得了显著提升,为全球天气预报提供了更准确的数据,对农业、能源等领域有重要影响。
Hugging Face 发布了 NeoMME,一个由 260M 和 800M 参数组成的跨语言多模态编码器。NeoMME 不使用单独的预训练视觉塔或因果语言模型,而是使用单个双向 Transformer 处理文本标记和原始图像补丁。NeoMME -Retriever 在视觉文档检索方面进行了微调,并提供了密集和后期交互嵌入。
推荐理由:NeoMME 是一个高效的多模态和跨语言编码器,其独特的架构和性能使其在视觉文档检索方面具有竞争力。
DeepMind 发布了 Gemini 3.8 Flash 和 3.8 Flash Cyber 模型,分别针对软件工程、智能体任务和网络安全领域,提供更强大的推理和编码能力。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
BenchMIRT 是一种新的方法,用于审计 LLM 基准测试,通过分析模型在各个问题上的表现,揭示现有基准测试的复杂性和局限性,为更精准的模型评估提供新思路。
推荐理由:BenchMIRT 通过分析模型在各个问题上的表现,揭示了现有基准测试的复杂性和局限性,为更精准的模型评估提供了新思路。
IBM 发布了 Granite 4.2 推理模型家族,包括 3B、8B 和 30B 三个版本,这些模型在 Granite-4.1 基础模型上进行后训练,并支持工具调用和推理功能。
推荐理由:Granite 4.2 模型在推理和工具调用方面表现出色,为读者提供了对大型语言模型构建的深入了解。
Hugging Face提出了一种名为量化感知修复(QAH)的新方法,通过直接从原始模型中提取知识,提高了压缩和量化后的模型的性能,使其在多个基准测试中优于原始的全精度版本。
推荐理由:该研究提出了量化感知修复(QAH)方法,通过直接从原始模型中提取知识,提高了压缩和量化后的模型的性能,为大型模型的小型化和高效运行提供了新的思路。
DeepMind 发布了新的 Gemini 3.7 Flash 模型,该模型在编码和智能体领域表现出色,具有更高的代码准确性和生成生产级代码的能力。此外,该模型还提供了更好的开发者体验和更具竞争力的价格。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
DeepMind 推出新的手语到文本翻译模型 SL2T,为听障和听力受损用户提供手语功能,支持 Gboard 和 Pixel 11 上的实时转录。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
DeepMind 发布了 WeatherNext AI 模型,该模型在台风预测方面取得了突破性进展,并开源了模型代码,旨在推动气象领域和AI应用的发展。
推荐理由:WeatherNext AI模型在预测台风方面取得了突破性进展,并开源了模型代码,对气象领域和AI应用有重要影响。
DeepMind 发布了 Gemini Robotics ER 2,这是一个能够进行视频理解、任务编排和多机器人协作的机器人技术,旨在使机器人在物理世界中更加有用。该模型允许机器人与人类交流、理解物理世界并规划多步任务,同时支持机器人之间在共享空间中协作完成复杂工作流程。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
DeepMind 发布了 Gemini Robotics 2,这是一款能够为机器人提供全身智能、高级灵巧和团队协作能力的智能层。它能够使机器人通过每个动作进行推理,解锁各种任务,例如行走、蹲下、伸展和操纵物体来清理杂乱的房间。
推荐理由:原文介绍了 Gemini Robotics 2 的能力提升和开放入口,读者可以据此判断它会如何改变现有工作流。
DeepMind 发布了新的 Gemini 模型,包括 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,旨在提高 AI 智能体的效率、降低延迟并提高可靠性。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
DeepMind 发布了 Nano Banana 2 Lite 和 Gemini Omni Flash,两款模型分别针对图像生成和视频编辑,旨在提高开发者的工作效率和创作能力。Nano Banana 2 Lite 是一款快速且成本效益高的图像模型,而 Gemini Omni Flash 则是一款高质量的视频生成和对话式编辑模型。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。