跳到正文
10月9日周五
  1. 量子位70

    MirroS 发布 AgentGarten:代码环境加神经渲染让智能体边玩边进化

    MirroS 团队发布 AgentGarten,将可执行代码环境与实时神经渲染器连接,以超过 30 fps 的吞吐让智能体持续交互。在重做的捉迷藏实验中,躲藏者第 4 轮学会搬挡板搭掩体,搜寻者第 10 轮掌握借坡道翻墙,而 2019 年 OpenAI 同类研究分别经历约 2500 万局和约 1 亿局。团队还给出技术报告、代码和项目主页。

10月7日周三
  1. Google DeepMind Blog85

    EmbeddingGemma 2:一个开源的轻量级多模态嵌入模型

    DeepMind 发布了 EmbeddingGemma 2,这是一个开源的多模态嵌入模型,能够将文本、图像、音频和视频组合映射到统一的嵌入空间。它基于 Gemma 4 架构,具有 7.4 亿个参数,适用于设备端推理。

    推荐理由:EmbeddingGemma 2 是一个开源的多模态嵌入模型,具有轻量级和强大的功能,适用于设备端的多模态嵌入和搜索。读者可以了解其能力变化和开放入口,从而判断它将如何改变现有工作流。

10月6日周二
9月28日周一
9月25日周五
9月23日周三
9月22日周二
9月21日周一
9月16日周三
  1. Google DeepMind Blog85

    DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 模型

    DeepMind 发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 模型,这两个模型在实时推理和智能体任务完成方面取得了显著进步,并提供了更流畅的语音交互体验。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

9月3日周四
  1. Hugging Face Blog85

    NeoMME:一个高效的多模态和跨语言编码器

    Hugging Face 发布了 NeoMME,一个由 260M 和 800M 参数组成的跨语言多模态编码器。NeoMME 不使用单独的预训练视觉塔或因果语言模型,而是使用单个双向 Transformer 处理文本标记和原始图像补丁。NeoMME -Retriever 在视觉文档检索方面进行了微调,并提供了密集和后期交互嵌入。

    推荐理由:NeoMME 是一个高效的多模态和跨语言编码器,其独特的架构和性能使其在视觉文档检索方面具有竞争力。

9月1日周二
  1. Hugging Face Blog75

    Hugging Face 发布 WebGPU 内核库 @huggingface/kernels

    Hugging Face 发布了 @huggingface/kernels 库,包含 207 个 WebGPU 内核,旨在加速浏览器推理,并提供 Fleet 工具进行基准测试和性能验证。

    推荐理由:Hugging Face 发布了 @huggingface/kernels 库,提供了 200 多个 WebGPU 内核,旨在加速浏览器推理,读者可以了解其如何改变现有工作流。

8月28日周五
8月27日周四
8月21日周五
7月30日周四
  1. Google DeepMind Blog80

    Gemini Robotics ER 2:利用视频理解、任务编排和多机器人协作推动机器人技术

    DeepMind 发布了 Gemini Robotics ER 2,这是一个能够进行视频理解、任务编排和多机器人协作的机器人技术,旨在使机器人在物理世界中更加有用。该模型允许机器人与人类交流、理解物理世界并规划多步任务,同时支持机器人之间在共享空间中协作完成复杂工作流程。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

7月28日周二
  1. Google DeepMind Blog85

    DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能

    DeepMind 发布了 Gemini Robotics 2,这是一款能够为机器人提供全身智能、高级灵巧和团队协作能力的智能层。它能够使机器人通过每个动作进行推理,解锁各种任务,例如行走、蹲下、伸展和操纵物体来清理杂乱的房间。

    推荐理由:原文介绍了 Gemini Robotics 2 的能力提升和开放入口,读者可以据此判断它会如何改变现有工作流。