EASYHUB JOURNAL / 2025-11
2025年11月 AI 资讯
8 篇选读,按原文日期从新到旧。点击标题查看摘要、配图及原文链接。
- IT之家
Fara-7B 以屏幕图像完成网页动作,仍处实验阶段
微软发布面向电脑操作的 7B 研究模型,通过截图预测点击、输入和滚动。官方强调实验性质、沙箱和敏感操作确认,不能把“端侧”当作天然安全或已经稳定可用。
- IT之家
HunyuanOCR 用 1B 端到端模型处理文字与文档
HunyuanOCR 是 1B 参数的端到端文字与文档理解模型,面向文档、手写内容、票据、截图等输入。腾讯公开代码、权重及在线演示,重点在小规模模型上统一识别与复杂版面处理;报道中的榜单成绩属于特定测试,不能直接替代对实际文档的校验。
- IT之家
MiMo-Embodied 研究机器人与驾驶任务的跨域建模
小米开放具身模型和代码,把不同环境中的感知、规划任务纳入共同研究路线。模型实验不构成自动驾驶安全认证,也不能替代实际机器人系统的安全验证。
- Tencent
HunyuanVideo 1.5 开放 8.3B 主模型,串联视频生成与超分辨率
混元开放 HunyuanVideo 1.5 的推理代码与权重,用 8.3B 主生成模型同时支持文字和图片驱动视频,再由独立超分辨率模块提升输出清晰度。创作者可围绕生成、放大和素材编辑组织工作流,而不必把每段视频处理都放在同一个模型中完成。
- IT之家
VibeThinker-1.5B 探索小模型的数学与代码推理
微博 AI 开放 1.5B 推理模型,重点介绍训练策略和数学、代码任务成绩。特定题库表现不能直接推导出通用聊天、知识覆盖或复杂工具任务的全面领先。
- Google
NotebookLM 加入 Deep Research,可将报告与来源一并存入笔记本
NotebookLM 新增 Deep Research,可先制定检索计划,再整理报告和候选资料,并将报告及引用来源一起加入笔记本。此次还扩展 Google Sheets、Word、云盘 PDF 和图片等输入;功能分批开放,图片支持比其他文件类型稍晚上线。
- IT之家
Omnilingual ASR 开放多语种语音识别模型与语料
Meta 发布多尺寸语音识别模型及低资源语言语料,扩大语言覆盖范围。模型和数据采用不同许可,语言数量也不意味着所有口音与场景具备相同准确度。