AAILore Sift

内容

情报流日报主题

工作台

脱水提炼文章与视频

我的

收藏知识库私人设置
AILore Sift事实、判断与机会,保持边界清晰。
返回主题地图

TOPIC · CURATED VIEW

图像生成

覆盖文生图、图像编辑与视觉创作工具,重点关注可控性、质量和生产效率。

全部 Story
26
近 7 天
0
当前结果
26
全部新闻论文产品模型

主题情报

#Story为什么值得看类别评分
01

新闻xAI 的 Imagine Image 2.0 在 Arena 基准测试中紧随 OpenAI 的 GPT-Image-2 之后

筛选线索图像生成AI 公司模型家族1 个独立信源

此次发布表明 xAI 在图像生成领域进入顶级行列,与 OpenAI 的最强模型差距缩小。新编辑工具和模板针对实际工作流,可能提升 Grok 的竞争力。

The Decoder AI News/8月8日 08:22
46
02

产品Qwen-Image-3.0 发布:高分辨率生成低至 0.03 美元

筛选线索图像生成模型家族发布动态1 个独立信源

阿里巴巴发布 Qwen-Image-3.0 图像生成模型,已可投入生产使用。该模型支持 4.5K token 输入,实现 100% 以上文本准确率且无破损 logo,原生支持 12 种语言,并提供灵活定价,高分辨率生成成本低至 0.03 美元。产品可通过 Model Studio 和 Qwen Cloud 平台访问。

AIHOT · X / 公众号精选/8月6日 06:12
52
03

模型Qwen-Image-3.0-Pro 上线 Qwen Cloud

筛选线索图像生成模型家族模型雷达1 个独立信源

Qwen-Image-3.0 发布并上线云平台,标志着阿里在文生图领域达到中国领先、国际主流水准,且提供 API 定价,意味着开发者可直接使用该能力,推动应用落地。

AIHOT · X / 公众号精选/8月5日 02:40
60
04

论文Boogu-Image-0.1:提升开源统一多模态理解与生成能力

筛选线索图像生成多模态模型家族智能体1 个独立信源

此前开源统一多模态模型在生成质量和速度上普遍落后于闭源系统,Boogu-Image-0.1证明在有限算力下通过优化数据质量、训练管道和推理时缩放即可达到接近闭源产品的水平,且完全开源,降低了高端图像生成与编辑模型的使用和定制门槛。

arXiv AI/7月14日 17:52
78
05

文章展示:Maginary.ai 新增 seedance2 与 GPT-images2 支持

筛选线索图像生成Agent 智能体模型家族智能体1 个独立信源

Maginary 此前已聚合 40 多个模型,本次新增 seedance2 和 GPT-images2 进一步扩大了可用模型种类,使用户能在统一界面中使用更多生成引擎,而无需分别注册不同服务。

Hacker News AI/7月26日 20:56
41
06

模型OpenRouter 上线 FLUX 3 Video 统一多模态模型

筛选线索图像生成多模态AI 主题模型雷达1 个独立信源

此前多模态模型多针对单模态或简单组合,此次 FLUX 3 Video 在 OpenRouter 平台向所有人开放,提供一个基础上同时覆盖视频、音频、图像和动作预测的统一模型家族,降低了多模态应用开发的接入门槛。

AIHOT · X / 公众号精选/8月4日 17:54
60
07

论文主动式人工智能:面向复杂系统的决策中心架构

筛选线索图像生成AI 主题人工智能1 个独立信源

该论文提出将 AI 从模型能力转向系统感知行动的框架,关注真实商业与工业场景中的可靠性、可行性、韧性与责任性,为 AI 在复杂系统的落地提供了新的组织化思路,可能影响企业级 AI 架构设计。

arXiv AI/8月4日 10:06
77
08

新闻Flux 3可生成20秒带原生音频视频,Black Forest Labs首次实现

筛选线索图像生成多模态基础模型多模态1 个独立信源

此前Black Forest Labs的视频生成模型仅输出无声画面,Flux 3首次实现视频与原生音频同步输出,时长达20秒,且内部测试成绩略超现有市场领先者Seedance 2.0,表明多模态视频生成质量迈上新台阶。

The Decoder AI News/7月23日 18:03
38
09

模型商汤开源 SenseNova U1:统一推理与图像生成

筛选线索图像生成多模态模型雷达1 个独立信源

以往推理与图像生成通常由不同模型或流程完成,SenseNova U1 将两者统一,可能简化多模态任务的处理方式,降低集成复杂性,并提高内容生成的连贯性。

AIHOT · X / 公众号精选/8月4日 15:46
60
10

论文AtumAI:用于数据中心控制平面策略智能体生成的原则性框架

筛选线索图像生成Agent 智能体AI 主题大语言模型1 个独立信源

此前数据中心控制平面策略设计依赖人工且耗时数月,现役智能体 AI 在正式性、可迁移性和系统性上存在不足。AtumAI 提出将这一过程自动化并形式化,有望显著缩短策略设计周期,提升数据中心运营效率。

arXiv AI/8月3日 17:45
75
11

新闻Google Vids 新增个性化 AI 头像,用户可创建自己的数字分身视频

筛选线索图像生成AI 视频AI 主题模型家族1 个独立信源

此前 AI 视频生成通常不包含用户本人的形象,Google Vids 让用户能以数字分身“参演”,降低了个人化视频制作门槛。

TechCrunch AI/7月16日 18:32
37
12

论文自动困难样本合成与多级智能体数据筛选

筛选线索图像生成多模态大语言模型智能体1 个独立信源

传统主动学习和人工标注在面对复杂新型多模态威胁时难以规模化,该框架完全自动化地合成边界样本,无需人类参与即可显著提升模型鲁棒性,代表内容安全防护从人工审查向自主红队测试的转变。

arXiv AI/7月15日 18:13
72
13

论文使用大语言模型智能体对概念擦除进行压力测试

筛选线索图像生成Agent 智能体AI 主题大语言模型1 个独立信源

此前概念擦除评估采用静态预定义方法,难以覆盖多样自然语言探测和挑战条件下的漏洞。STACE通过自适应假设搜索,由智能体迭代生成并验证测试,系统性扩展了失败模式覆盖,为可信AI部署提供了更有效的验证手段。

arXiv AI/7月20日 12:38
72
14

论文SymbOmni:通过符号概念学习进化代理式全模态模型

筛选线索图像生成多模态模型家族推理能力1 个独立信源

传统多模态模型每次任务都从零推理,无法积累知识。SymbOmni通过符号概念学习实现了知识的累积与重用,解决了“永久新手”问题,标志着从静态知识到运行时持续进化的范式转变。

arXiv AI/7月13日 18:00
72
15

论文无辜画面,仇恨故事:多轮视觉故事生成中仇恨意图的评估与检测

筛选线索图像生成多模态模型家族推理能力1 个独立信源

此前研究只关注单张图像的仇恨内容,忽略多张图像组合产生的群体级仇恨含义。前沿 T2I 系统支持跨轮一致的角色和场景,使得大规模制作仇恨视觉故事变得廉价,而现有审核工具对此类内容几乎失效,凸显新的安全漏洞。

arXiv AI/8月5日 08:56
70
16

论文统一具身合成与世界基础模型:小米机器人U0

筛选线索图像生成多模态模型家族基础模型1 个独立信源

过去具身生成方法常牺牲预训练的视觉知识,而该模型首次在多种机器人实体上实现高质量多视角场景生成,并引入结构化可控具身转移。它将世界基础模型的泛化能力保留并适应于具身场景,显著提升真实环境操作成功率。

arXiv AI/7月13日 14:57
70
17

论文CN101:面向生成式AI的数字热力学计算机

筛选线索图像生成AI 主题生成式 AI1 个独立信源

此前热力学计算依赖Langevin动力学,受限于模拟硬件。该研究将形式化方法推广到任意遍历过程,并首次在数字CMOS上实现,可能降低硬件门槛,提升精度可控性。

arXiv AI/8月1日 16:37
70
18

论文PosterMELD:基于多智能体的论文转海报生成,实现可控设计多样性与可编辑打印输出

筛选线索图像生成多模态智能体多模态1 个独立信源

与现有系统相比,PosterMELD将打印就绪率提升3.4至5.2倍,同时成本仅为Codex+Skill的3.5%。它解决了直接图像生成不可编辑、编码智能体工作流昂贵的问题,使生成的海报既可直接打印,又保持原生可编辑性,为学术海报自动化生成提供了更实用的方案。

arXiv AI/8月3日 13:39
69
19

论文Mage-Flow:一种高效的原生分辨率图像生成与编辑基础模型

筛选线索图像生成多模态基础模型多模态1 个独立信源

此前大模型生成与编辑需高算力成本、训练部署困难。Mage-Flow在同等规模下显著降低分词与训练开销,Turbo变体实现亚秒级高分辨率生成,使交互式实时图像编辑变得实用,降低了高质量生成模型的准入壁垒。

arXiv AI/7月21日 12:55
69
20

论文领域锚定的候选选择用于代理式图像编辑:以阴影去除为例

筛选线索图像生成多模态智能体多模态1 个独立信源

此前认为商用视觉语言模型可能取代传统低层视觉方法。该研究表明,直接使用存在物理错误,但结合物理先验的代理流程可显著提升性能,CDD降低47%以上,证实了经典先验与生成模型结合的价值。

arXiv AI/8月6日 14:19
69
21

论文视觉-语言模型供应链中通过表示引导的架构后门

筛选线索图像生成多模态多模态向量检索1 个独立信源

此前模型供应链安全主要关注数据投毒或微调阶段的后门,该研究证明攻击者无需接触训练数据或控制微调,仅通过修改架构定义就能嵌入不影响正常功能但可被触发利用的后门,大幅改变了供应链安全威胁模型,迫使产业界重新审视对第三方模型组件的信任边界。

arXiv AI/7月28日 09:12
69
22

论文通过自监督语义扩散训练类似参数的技能

筛选线索图像生成Agent 智能体大语言模型智能体1 个独立信源

此前封闭模型无法通过微调或强化学习提升专业技能,且依赖昂贵的人工标注或LLM评判。该方法无需访问权重、无需标注,利用现有高质量人类作品作为自监督信号,自动提取技能并增强专业能力,为提升闭源模型在特定领域的表现提供了新路径。

arXiv AI/7月30日 01:03
69
23

论文PathAgentBench:全切片病理图像上证据寻找视觉语言模型的基准测试

筛选线索图像生成多模态推理能力多模态1 个独立信源

此前病理基准测试多基于预裁剪补丁或预提取特征,无法评估模型从千兆像素原图中自主寻找证据的能力。PathAgentBench首次直接考核该能力,并揭示当前视觉语言模型在精确区域定位和自主探索方面的显著短板,为模型改进指明了关键方向。

arXiv AI/7月21日 16:33
68
24

论文ReDiTT: 用于异步时间序列的检索增强条件扩散Transformer

筛选线索图像生成开源模型与生态模型推理检索增强1 个独立信源

相比传统时间序列预测方法,ReDiTT 通过检索历史中的类似结构序列作为生成条件,克服了长时预测中的不确定性累积问题,同时提高了样本多样性。这是扩散模型在异步时间序列上首次结合检索增强机制,为处理不规则间隔事件序列提供了新范式。

arXiv AI/7月14日 06:11
68
25

论文Text2Sign:一个用于文本到手语视频生成的单GPU扩散基线

筛选线索图像生成多模态多模态模型推理1 个独立信源

此前手语视频生成依赖昂贵的大规模训练和推理资源,Text2Sign通过单GPU即可运行,显著降低了硬件门槛。但生成结果仅为低分辨率短片段,且文本条件控制效果有限,距离实用化仍有较大差距。

arXiv AI/7月14日 18:15
67
26

论文展示而非叙述:在生成像素中评估空间认知

筛选线索图像生成Agent 智能体大语言模型推理能力1 个独立信源

此前评估空间认知的基准均以文本或坐标作为答案接口,导致图像生成模型无法在相同语义下被评估。ProVisE让模型直接在像素空间表达空间判断,更贴近真实物理世界交互,且实验揭示了两种模型的能力差异,为后续评估和模型改进提供了新方向。

Hugging Face Daily Papers/7月24日 00:00
65