EasyHub工具与知识
站点导航
中文

网站外观

主色与风格,自由搭配

主色调玫瑰粉
视觉风格不改变内容与功能

柔和渐变 · 立体图标

已应用:玫瑰粉 · 灵感,自动保存到此浏览器。

EASYHUB JOURNAL / 2025-02

2025年2月 AI 资讯

12 篇选读,按原文日期从新到旧。点击标题查看摘要、配图及原文链接。

  1. IT之家

    混元 Turbo S 发布,采用混合架构改善响应速度

    腾讯发布快思考模型 Turbo S,结合 Mamba 与 Transformer,重点降低长文本处理的计算和缓存开销。发布时腾讯云 API 已开放,元宝计划逐步接入;它也被用作推理、长文和代码等混元衍生模型的基础,而不是仅面向聊天的新入口。

  2. IT之家

    Phi-4 家族新增迷你与多模态版本

    微软扩展 Phi-4 系列,分别提供较小语言模型和统一语音、视觉、文本输入的版本。不同版本支持的输入输出与部署要求各不相同,不能混用家族整体宣传。

  3. IT之家

    Magma 研究把视觉语言动作连接到数字与物理任务

    微软开放多模态智能体研究模型,探索屏幕操作与机器人动作的共享表示。示例不能保证真实购物或机器人任务安全,应保留明确授权和执行验证。

  4. IT之家

    万相 2.1 开放视频模型,提供 1.3B 与 14B 选择

    阿里开放万相视频模型权重和推理代码,覆盖较小尺寸与高质量生成路线。消费级显卡的演示对应特定分辨率和配置,不意味着所有版本都只需同样显存。

  5. IT之家

    Moonlight 与分布式 Muon 实现开放,研究训练效率

    月之暗面公布在 Muon 上训练的 MoE 模型、优化器实现和中间检查点。重点是训练方法和可复查资源,模型总参数与每次激活参数应分别记录。

  6. IT之家

    SkyReels-V1 与 A1 开放人物视频和表情驱动研究

    昆仑万维开放面向人物视频生成的模型和表情动作控制方法,覆盖文字、图片及驱动视频等创作输入。演示是工作流起点,成片仍需检查动作、身份与镜头一致性。

  7. IT之家

    阶跃与吉利开放视频生成和语音交互模型

    双方公布 Step-Video-T2V 与 Step-Audio,分别面向视频生成和可控制表达的语音交互。两种任务属于不同模型与部署链路,不能把一个版本的硬件需求套用到另一个。

  8. Dify

    Dify 1.0 以插件与 Agent 节点扩展应用工作流

    Dify 1.0 将模型和工具等能力拆成可扩展插件,并在工作流中引入 Agent 节点,方便组合决策逻辑与外部服务。开发者可通过生态市场或自有插件扩展应用,但插件会接触实际工具和数据,安装来源与调用权限仍需逐项审查。

  9. IT之家

    OmniParser V2 解析屏幕元素,配合 OmniTool 研究电脑操作

    OmniParser V2 将截图中的按钮、图标等内容转成大模型可定位的结构化元素,改进小目标识别。配套 OmniTool 提供 Docker 化 Windows 实验环境,将界面理解、动作规划和执行连接起来;解析器本身不是完整智能体,实际操作仍需权限边界与人工监督。

  10. 新智元

    OpenThinker-32B 开放推理模型及配套训练数据

    OpenThoughts 团队公开推理训练数据、生成流程和模型,研究数据筛选对推理质量的影响。报道中的成绩来自指定基准,开放资料的价值在于便于复查和继续实验。

  11. IT之家

    VideoWorld 探索从视频中学习知识与动作

    字节与高校团队开放 VideoWorld,研究不以语言模型为中心的视频学习路线。围棋和机器人实验展示了特定任务的潜力,不应将这些实验概括为已经理解整个物理世界。

  12. 机器之心

    FireRedASR 开放两种识别架构,覆盖精度与效率需求

    小红书 FireRed 团队开放 FireRedASR 模型与推理代码,提供编码器—解码器和大语言模型结合两种路线,服务中文语音转文字。前者侧重较轻量推理,后者借助语言模型提升识别表现;这是语音识别而非语音合成,榜单结果仍依赖具体测试集。