AI基础设施团队发布GPU集群调度器新功能
AI基础设施团队发布了新的GPU集群调度器,通过引入GPU时间预算、分层公平共享分配和时间切片合同等功能,优化了资源分配和提升了工作效率。
推荐理由:原文介绍了GPU集群调度器的新功能,读者可以了解如何优化资源分配和提升工作效率。
AI基础设施团队发布了新的GPU集群调度器,通过引入GPU时间预算、分层公平共享分配和时间切片合同等功能,优化了资源分配和提升了工作效率。
推荐理由:原文介绍了GPU集群调度器的新功能,读者可以了解如何优化资源分配和提升工作效率。
TRAE发布新版本,将Code和Work功能合并,新增Agent模式和IDE模式,支持全局工作台和代码编辑,旨在提高开发效率和协作能力。
openJiuwen 发布并开源企业级 AgentOS,将多智能体协同、自演进、算力亲和与企业级安全能力整合进统一底座,并通过插件化架构连接上层应用与底层模型、算力资源。
MirroS 团队发布 AgentGarten,将可执行代码环境与实时神经渲染器连接,以超过 30 fps 的吞吐让智能体持续交互。在重做的捉迷藏实验中,躲藏者第 4 轮学会搬挡板搭掩体,搜寻者第 10 轮掌握借坡道翻墙,而 2019 年 OpenAI 同类研究分别经历约 2500 万局和约 1 亿局。团队还给出技术报告、代码和项目主页。
Goodfire推出新型AI监控工具,通过监控AI模型内部工作过程,以较低成本检测异常AI代理,提高AI系统安全性。
DeepMind 发布了 EmbeddingGemma 2,这是一个开源的多模态嵌入模型,能够将文本、图像、音频和视频组合映射到统一的嵌入空间。它基于 Gemma 4 架构,具有 7.4 亿个参数,适用于设备端推理。
推荐理由:EmbeddingGemma 2 是一个开源的多模态嵌入模型,具有轻量级和强大的功能,适用于设备端的多模态嵌入和搜索。读者可以了解其能力变化和开放入口,从而判断它将如何改变现有工作流。
Google 发布了新的 EmbeddingGemma 2 多模态嵌入模型,该模型能够将文本、图像、音频和视频组合映射到统一的嵌入空间,支持设备端推理,并具有高效存储和扩展的上下文处理能力。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google Flow Music 推出 Spaces 功能,允许制作人无需编码即可使用自然语言创建定制乐器或效果。现在,制作人可以将自定义 Spaces 导出为 VST3/AU 插件,在数字音频工作站中使用,提高音乐制作效率。
Google Earth AI 结合当地健康数据和高级地理空间模型,帮助公共卫生领导者克服报告滞后、预测疾病爆发并向全球脆弱社区提供护理。
推荐理由:原文展示了 Google Earth AI 在公共卫生领域的应用,读者可以了解其对疾病预测和社区健康趋势的影响。
Hugging Face Hub 推出 RL Environments 功能,提供强化学习环境共享与复用平台,支持多种环境框架,简化环境部署与运行,提升强化学习研究效率。
高通发布 Snapdragon X2 系列芯片的 Linux 开发者预览版,支持 systemd-boot、PCIe、Freedreno 等功能,预计于 11 月底达到生产就绪阶段。此版本旨在支持开发者将 Linux 部署到新硬件上,目前支持 Debian 13 操作系统。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,两款文本到语音模型,支持自然语言提示、角色定制和多种语言方言,旨在为创作者、开发者和企业提供更丰富、更具表现力的音频体验。
Hugging Face 的 Transformers 现在支持运行 GGUF 模型,允许用户使用适合笔记本电脑内存大小的检查点,通过熟悉的 Transformers API 进行生成。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Hugging Face 官方宣布支持 MLX 社区,并欢迎 oMLX 的创建者和维护者 Jun Kim 加入团队,这将推动本地 AI 的发展和应用。
Hugging Face 发布了 tokenizers v1,该版本在编码、解码和扩展方面进行了性能提升,通过优化算法和架构,实现了比 v0.23 版本更高的效率。
推荐理由:原文详细介绍了 tokenizers v1 的性能提升和改进,读者可以了解其如何加速机器学习工作流程。
DeepMind 发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 模型,这两个模型在实时推理和智能体任务完成方面取得了显著进步,并提供了更流畅的语音交互体验。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Hugging Face 发布了 NeoMME,一个由 260M 和 800M 参数组成的跨语言多模态编码器。NeoMME 不使用单独的预训练视觉塔或因果语言模型,而是使用单个双向 Transformer 处理文本标记和原始图像补丁。NeoMME -Retriever 在视觉文档检索方面进行了微调,并提供了密集和后期交互嵌入。
推荐理由:NeoMME 是一个高效的多模态和跨语言编码器,其独特的架构和性能使其在视觉文档检索方面具有竞争力。
DeepMind 发布了 Gemini 3.8 Flash 和 3.8 Flash Cyber 模型,分别针对软件工程、智能体任务和网络安全领域,提供更强大的推理和编码能力。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Hugging Face 发布了 @huggingface/kernels 库,包含 207 个 WebGPU 内核,旨在加速浏览器推理,并提供 Fleet 工具进行基准测试和性能验证。
推荐理由:Hugging Face 发布了 @huggingface/kernels 库,提供了 200 多个 WebGPU 内核,旨在加速浏览器推理,读者可以了解其如何改变现有工作流。
Open ASR Leaderboard 与 Voice Arena 合作,新增了印度语和印地语的语音识别评测,旨在提高评测的可靠性和多样性。
推荐理由:该材料介绍了 Open ASR Leaderboard 新增的印度语和印地语评测,读者可以了解其对语音识别领域的贡献和影响。
DeepMind 发布了 Gemini 3.5 Transcribe 智能转录模型,该模型旨在提供更精确和智能的实时转录功能,支持多种语言和方言,并具有自动格式化、自定义词汇识别等功能。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Hugging Face 通过结合 PostgreSQL 数据库、pgvector 和 RRF 算法,利用 Hugging Face Jobs、Storage Buckets 和 Inference Endpoints,构建了 Papers with Code 的混合搜索系统,支持超过 11 万篇论文的搜索,实现高效且强大的 AI 研究成果检索。
DeepMind 发布了 Gemini Robotics ER 2,这是一个能够进行视频理解、任务编排和多机器人协作的机器人技术,旨在使机器人在物理世界中更加有用。该模型允许机器人与人类交流、理解物理世界并规划多步任务,同时支持机器人之间在共享空间中协作完成复杂工作流程。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
DeepMind 发布了 Gemini Robotics 2,这是一款能够为机器人提供全身智能、高级灵巧和团队协作能力的智能层。它能够使机器人通过每个动作进行推理,解锁各种任务,例如行走、蹲下、伸展和操纵物体来清理杂乱的房间。
推荐理由:原文介绍了 Gemini Robotics 2 的能力提升和开放入口,读者可以据此判断它会如何改变现有工作流。