Claude 新增文本生成动画视频与实时数据看板功能
Anthropic 为 Claude 推出两项新功能:Motion 可根据文本、图表和图片生成可编辑代码并导出 MP4 的动画解说视频;Dashboards 连接 BigQuery 等数据源,通过文本提示生成带底层查询的自动更新实时看板。
Anthropic 为 Claude 推出两项新功能:Motion 可根据文本、图表和图片生成可编辑代码并导出 MP4 的动画解说视频;Dashboards 连接 BigQuery 等数据源,通过文本提示生成带底层查询的自动更新实时看板。
Pollo AI 借助 GPT-5.6、GPT-6 Astra 和 GPT‑Image‑2.5 帮助创作者将创意转化为详细的图像和电影级视频广告。
开发者 Brandon Thomas 使用 Anthropic 的 Claude Opus 5.5 在 Rust 中逆向工程 Adobe 软件,推出 Artcraft 套件。该套件包含 Photoshop、Illustrator 等七款开源应用,旨在复刻 Adobe 产品的界面与功能。目前处于早期 Alpha 阶段,提供 Rust 及 WebAssembly 版本。
Google 推出全新的 SynthID.com 网站,允许用户直接检测 AI 生成内容中的隐形水印,无需通过 Gemini 模型。该检测器现已支持 Google 合作伙伴的水印,解决了此前仅能检测 Google 自家 SynthID 的局限。
Mistral 发布 Mistral Large 4 预览版,这是一个拥有 1 万亿参数、490 亿活跃参数的模型,通过 API 提供预览,并承诺月底开放权重。该模型支持“无”和“高”两种推理级别,在多模态图像生成上表现显著提升,在 Artificial Analysis 上得分 38,接近 DeepSeek 4.1 Flash。
开源工具 RemoveMacAI 通过配置描述文件和 Apple 资产服务,在保持系统完整性保护开启且不直接修改 /System 目录的前提下,快速移除 macOS 27 中的 Apple Intelligence 功能。开发者表示用户可选择性移除特定功能,撤销操作后 macOS 会重新下载模型。该工具在 GitHub 已获得 1,700 颗星,反映了部分用户对 Apple 智能功能的抵触情绪。
NVIDIA Inception 计划中的初创企业利用 AI 技术解决乳腺癌筛查与治疗中的痛点。iSono Health 的 ATUSA 平台通过 AI 实现自动化 3D 超声扫描,敏感度较传统手持超声提升 28%。Whiterabbit.ai 的 WRDensity 软件自动评估乳腺密度,Ataraxis AI 则通过数字病理切片预测治疗反应,加速临床决策。
Google DeepMind 发布 SynthID Bio,将数字水印技术延伸至合成生物学领域,在保留蛋白质生物功能的同时实现物理层面的可验证性。该方法通过微调 AlphaFold 3 扩散网络,使预测的 3D 结构自带可检测签名,并在湿实验中对 VEGF-A 等靶点验证了功能一致性。
推荐理由:将数字水印技术延伸至合成生物学领域,在保留蛋白质生物功能的同时实现物理层面的可验证性。
Google Research 提出 Diffusion Controller 框架,将图像生成过程重构为连续控制问题,通过轻量级“转向阻尼器”网络动态调整生成轨迹。该框架在灰盒和全白盒环境下均优于 LoRA,实现了更优的质量与效率平衡。
推荐理由:提出统一控制框架解决图像生成引导难题,在受限访问下优于LoRA。
Hugging Face 官方博客发布 Workflow1111,将 AUTOMATIC1111 的核心功能重构为基于 Gradio Workflow 的节点图。
推荐理由:Gradio 官方展示了 Workflow1111 项目,将 AUTOMATIC1111 的核心功能重构为基于 Gradio Workflow 的节点图,支持多模型混合编排与 MCP 工具调用。
Google Research与NASA JPL合作在PNAS发表论文,提出MAPL-EMIT深度学习框架,利用Swin-S视觉Transformer和360万合成数据,实现了对EMIT卫星数据中甲烷羽流的高精度检测与源定位。该模型在专家标注数据上召回率达84%,并开源了全球羽流数据库、训练模型及推理库。
推荐理由:论文提出结合物理模拟与视觉Transformer的深度学习框架,显著提升了卫星遥感甲烷排放检测的精度与灵敏度。
微软研究团队开源 GigaPath-Flash 和 GigaTIME-Flash,通过知识蒸馏将原始模型参数量大幅缩减,在保持竞争力的同时使推理成本降低约 50 倍、内存占用减少约 8 倍。这两个 Apache 2.0 许可的研究模型支持全切片表示学习和肿瘤微环境空间蛋白质组学预测,旨在降低计算门槛以推动大规模病理发现。
推荐理由:通过知识蒸馏显著降低算力需求,使病理大模型在大规模队列分析中具备实际可行性。
Hugging Face Diffusers原生集成Nunchaku Lite,支持4-bit权重与激活量化(W4A4),无需自定义Pipeline即可加载预量化模型。实测在Blackwell GPU上峰值显存降低约50%,推理速度提升约30%,配合torch.compile可提速至1.8倍。
推荐理由:Nunchaku Lite原生集成至Diffusers,实现4-bit权重与激活量化,显著降低显存占用并提升推理速度。
Google Research 在 ICLR 2026 发表论文,揭示扩散模型的创造力源于神经网络训练中的“分数平滑”效应。正则化导致学习到的分数函数近似平滑,使去噪过程在训练数据点之间插值,从而生成新颖样本而非单纯记忆。
Photoroom 发布 PRX 模型数据策略,采用 Lance 格式进行数据探索与特征工程,利用 Qwen3-VL-8B 对图像进行长文本重标注,最终转换为 MDS 格式进行流式训练。
推荐理由:Photoroom 公开了 PRX 模型的数据构建全流程,提供了从数据探索、VLM 重标注到 MDS 流式训练的具体工程实践。
Google Research 发布覆盖50+全球城市的建筑级屋顶反射率数据集,并上线 Heat Resilience Earth Engine App。该数据集基于 Sentinel-2 与高分辨率卫星影像融合生成,精度达30厘米,旨在帮助城市规划者识别低反射率建筑并实施降温干预。
推荐理由:原文提供了覆盖50+城市的建筑级屋顶反射率数据集及可视化应用,为城市热岛缓解规划提供了高精度数据支持。
Google 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。Nano Banana 2 Lite 主打极速低成本图像生成,4 秒出图,价格 0.034 美元/千张,可无缝替代旧版 Nano Banana。
推荐理由:Nano Banana 2 Lite 提供极速低成本的图像生成,Gemini Omni Flash 开放视频生成与对话编辑,两者结合可构建端到端的多媒体工作流。
PaddleOCR 发布 PP-OCRv6 模型家族,包含 1.5M 至 34.5M 参数的三档模型,支持 50 种语言。medium 版本检测 Hmean 达 86.2%,较 v5 提升 4.6 个百分点,提供 Transformers 和 ONNX 后端。
推荐理由:提供了从1.5M到34.5M参数的三档模型及多后端支持,便于评估其在不同场景下的部署可行性。
Hugging Face 推出 agents.md 标准,使 Agent 能直接调用 Gradio Space 的 API 进行链式组合。作者通过该机制调用 ideogram-ai/ideogram4 生成图像,再经 VAST-AI/TripoSplat 重建 3D 高斯泼溅,最终自动构建并部署了 3D 巴黎地标画廊,展示了多媒体应用开发的模块化新范式。
推荐理由:通过 agents.md 实现 Hugging Face Spaces 的标准化调用与链式组合,展示了 Agent 构建多媒体应用的低成本路径。
Hugging Face转载Dharma AI论文,展示在SFT后引入DPO阶段,利用模型自身的退化输出作为拒绝样本,在五个视觉语言模型家族中平均降低59.4%的文本退化率。
推荐理由:文章验证了DPO在结构化OCR任务中抑制文本退化,为无标注场景下的模型优化提供了可迁移的方法。
AllenAI 发布 OlmoEarth v1.1 模型系列,通过优化 Transformer 的 Token 设计将计算成本降低至 v1 的三分之一,同时保持基准性能。该版本包含 Base、Tiny 和 Nano 多种尺寸,支持更高效的卫星图像推理与微调。
推荐理由:通过优化Token设计降低计算成本,为遥感模型的高效部署提供了可复用的工程实践。
Google 将 SynthID 和 C2PA Content Credentials 内容验证工具扩展至 Search、Gemini 和 Chrome,帮助用户识别内容的生成来源与修改历史。
Hugging Face 展示了基于 OpenAI 开源隐私过滤模型 Privacy Filter 构建的三个 Web 应用:文档隐私探索器、图像匿名化工具和智能文本脱敏服务。该模型支持 128k 上下文,可识别八类个人敏感信息。
推荐理由:Hugging Face 展示了基于 OpenAI Privacy Filter 构建的三个 Web 应用,揭示了其在文档、图像和文本场景中的工程实践。
Google Photos 在 Auto frame 功能中新增视角重算能力,利用3D点云估计与生成式扩散模型,在保留原图可见内容的同时智能补全新视角下的隐藏区域,自动优化人像构图与广角畸变。
推荐理由:通过3D重建与生成式补全实现照片视角重算,为后期构图调整提供了新的技术路径。
Google Research 发布两个实验性 AI 智能体:PaperVizAgent 可从文本自动生成出版级学术图表,在多项指标上超越 GPT-Image-1.5 等基线;ScholarPeer 模拟资深审稿人,通过多智能体协作和实时文献检索生成深度评审意见。
推荐理由:Google 发布两个实验性 AI 智能体,分别用于生成高质量学术图表和模拟资深审稿人,展示了 AI 深度介入科研流程的潜力。
Google Research 联合英国 NHS 发表两项研究,证实 AI 辅助乳腺癌筛查系统在双读流程中表现不劣于纯人工,且可减少 46% 的人工阅片工作量。AI 在独立检测中灵敏度高于首位放射科医生,能识别 25% 的漏诊间期癌,但需解决模型可解释性及数据漂移问题。
推荐理由:研究证实AI辅助双读流程在保持检测准确率的同时,可显著减少放射科医生工作量,为缓解医疗人力短缺提供实证。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),结合 Pro 级智能与 Flash 速度,支持多主体一致性和精确文本渲染。该模型已上线 Gemini、Search、AI Studio 及 Google Ads 等产品,并集成 SynthID 和 C2PA 溯源技术。
推荐理由:Nano Banana 2 将 Pro 级能力与 Flash 速度结合,提供多主体一致性和精确文本渲染,适合快速迭代场景。
伯克利 AI 研究团队提出一种基于互信息的框架,直接评估并优化成像系统。该方法通过分解噪声物理特性,仅需测量数据即可量化系统区分物体的能力。在色彩摄影、射电天文、无透镜成像和显微镜四个领域验证中,信息估计准确预测了下游任务性能,且优化结果匹配最先进端到端方法,同时显著降低内存和算力需求。
Diffusers 正式支持 FLUX-2 图像生成模型,提供 Flux2Pipeline 和 Flux2Transformer2DModel 等组件。该模型使用 Mistral3 作为文本编码器,可通过 diffusers/FLUX.2-dev-bnb-4bit 仓库加载,支持 4-bit 量化部署。
Google DeepMind 发布 Gemini 3 Pro Image(代号 Nano Banana Pro),提供 2K/4K 分辨率、高精度文本渲染及物理控制能力。该模型支持通过 Google Search 进行实时知识检索,并内置 SynthID 数字水印,已在 Google AI Studio 和 Vertex AI 开放预览。
推荐理由:该模型在文本渲染、物理控制和知识检索方面实现升级,开发者可据此构建更精准的多模态应用。
Google Research 联合 Google DeepMind 发布 Natural Forests of the World 2020 地图及数据集,利用 MTSViT 模型实现 10 米分辨率天然林识别,准确率达 92.2%。同时发布 Planted 和 ForTy 两个大规模基准数据集,用于支持 EUDR 合规及下一代森林分类模型研发。
推荐理由:发布全球首个10米分辨率天然林地图及基准数据集,为合规与生态监测提供高精度AI基线。
Hugging Face 发布指南,对比了 Nanonets-OCR2、OlmOCR-2、Granite-Docling 等开源OCR模型的能力与成本,介绍了 OlmOCR-Bench 等评测基准,并提供了基于 vLLM 和 Transformers 的本地部署与批量推理代码。
推荐理由:系统梳理了多款开源OCR模型的能力差异与评测基准,并提供了本地部署与批量推理的实操代码。
Hugging Face 发布教程,指导用户通过 Optimum Intel 和 OpenVINO 在 Intel CPU 上运行 SmolVLM2-256M-Video-Instruct 视觉语言模型。教程涵盖将模型转换为 OpenVINO IR、应用权重或静态量化以优化内存和推理速度,以及执行推理的具体步骤。
Hugging Face 发布教程详解如何将 RedNote 的 3B 参数 OCR 模型 dots.ocr 转换为 Core ML 格式以在 Apple 设备上运行。文章通过简化模型结构、修复 PyTorch 到 CoreML 转换中的算子报错,成功将模型部署至端侧,并预告后续将介绍 MLX 集成与 Neural Engine 量化优化。
推荐理由:详细拆解了将3B参数OCR模型适配Core ML的具体步骤与踩坑经验,为端侧部署提供了可复用的工程参考。