KO
|
EN
gitlite — search
Search
#python
#javascript
#css
#flutter
#html
#dart
#android
#raspberry-pi
#arduino
#api
#minecraft
#kotlin
Awesome-Agentic-Gen
★ 41
Open GitHub ↗
No description available.
Download README (.md)
Explore Similar Repositories
bmad-automator
:
No description available.
laufey
:
Modern web native application framework
tiny-roommate
:
A tiny AI pet that lives on your desktop. Every AI wants to make you productive — this one just purrs.
clawy
:
A cute pixel companion for Claude Code sessions.
agent-wrapper
:
a wrapper framework for agent runtimes
// repository documentation
Was this content helpful?
★ 0
(0 ratings)
Select Rating:
★
★
★
★
★
Submit Feedback
Recent Feedback
×
Download README
Do you want to download the
README.md
file for
Awesome-Agentic-Gen
?
Download (.md)
# Awesome Agentic Gen 🔥 A curated and continuously updated collection of research papers on **Agentic Generation**. Recent advances in multimodal foundation models are pushing generative systems beyond one-shot synthesis toward **agentic creation** — systems that can **reason, plan, search, use tools, generate, evaluate, refine, and self-improve** through iterative interaction with generative models and environments. This repository aims to track research at the intersection of **AI Agents** and **Multimodal Generation**, covering both autonomous agents and agentic workflows for creating and editing visual content. ## 📚 Scope We broadly include research on: * 🖼️ **Agentic Image Generation & Editing** * 🎬 **Agentic Video Generation & Editing** * 🌍 **3D / World / CAD Generation Agents** * 🔍 **Search- and Retrieval-Augmented Generation Agents** * 🛠️ **Tool-Using & Workflow Generation Agents** * 🤖 **Multi-Agent Generative Systems** * 🧠 **Planning, Reasoning, Reflection & Self-Evolving Generation** * 🎨 **Creative Agents for Figures, Posters, Slides, UI, SVG, and Design** * ⚙️ **ComfyUI and Generative Workflow Agents** * 📊 **Benchmarks, Evaluation, and Data for Agentic Generation** We use a **broad definition of Agentic Generation**: a work may be included if an agent, multi-agent system, planner, controller, or agentic workflow plays a meaningful role in the generation process — such as task decomposition, information retrieval, tool selection, workflow construction, generation, evaluation, refinement, editing, or self-improvement. Papers are organized in **reverse chronological order**, with the latest works listed first. ## 🤝 Contributions Agentic Generation is evolving rapidly, and we may miss relevant papers. If you know of a paper that should be included, feel free to **open an issue or submit a pull request**. ⭐ If you find this repository useful, please consider giving it a star! > **From one-shot generation to agents that search, plan, create, evaluate, refine, and evolve.** ## 📝 Papers ### 2026-08 | Title | Paper Link | Venue | |---|---|---| | ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation | [arXiv](https://arxiv.org/abs/2608.04436) | — | | PosterMELD: Multi-Agent Paper-to-Poster Generation for Controllable Design Diversity with Editable Print-Ready Outputs | [arXiv](https://arxiv.org/abs/2608.02218) | — | | CADIR: A Cross-Backend Editable Intermediate Representation for Agentic CAD Generation | [arXiv](https://arxiv.org/abs/2608.00891) | — | | ParticleGen: A Multi-Agent System for Particle Effects Generation | [arXiv](https://arxiv.org/abs/2608.00629) | — | | DrawAI: Agentic Benchmark and Workflow for Making Raster Images Editable | [arXiv](https://arxiv.org/abs/2608.00548) | — | | Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text to Image Generation | [arXiv](https://arxiv.org/abs/2608.06751) | — | | Domain-Grounded Candidate Selection for Agentic Image Editing: A Shadow Removal Case | [arXiv](https://arxiv.org/abs/2608.06075) | — | | VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing | [arXiv](https://arxiv.org/abs/2608.05485) | — | | WorldClaw: Agentic 3D Open-World Generation at Scale | [arXiv](https://arxiv.org/abs/2608.05248) | — | | SeaSlides: Semantic Abstraction Layer for Agentic Slide Generation | [arXiv](https://arxiv.org/abs/2608.03298) | — | | Crayotter: Learning Long-Horizon Video Editing Agents via Group-Relative Preference Backpropagation | [arXiv](https://arxiv.org/abs/2608.02694) | — | ### 2026-07 | Title | Paper Link | Venue | |---|---|---| | VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System | [arXiv](https://arxiv.org/abs/2607.27380) | — | | PRISM: Prompt Refinement via Image-grounded Self-Rewarding Mechanism | [arXiv](https://arxiv.org/abs/2607.24353) | — | | What Can I Edit? Open-Ended Strategy Discovery and the Emotion Editability Landscape (EmoScope) | [arXiv](https://arxiv.org/abs/2607.23920) | — | | JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents | [arXiv](https://arxiv.org/abs/2607.23588) | — | | GS-Agent: Creating 4D Physical Worlds With Generative Simulation | [arXiv](https://arxiv.org/abs/2607.21522) | — | | Engine-Native Editable 3D World Reconstruction with Objects and Lighting | [arXiv](https://arxiv.org/abs/2607.20889) | — | | ETPDesigner: Multi-Agent Orchestration for Interactive Multimodal Electronic Theater Program | [arXiv](https://arxiv.org/abs/2607.19947) | — | | FilmWorld: Agentic Novel-to-Film Generation through Dynamic Cinematic World Modeling | [arXiv](https://arxiv.org/abs/2607.19038) | — | | Knowledge-Centric Agents for Workflow Generation in ComfyUI | [arXiv](https://arxiv.org/abs/2607.15845) | — | | SymbOmni: Evolving Agentic Omni Models via Symbolic Concept Learning | [arXiv](https://arxiv.org/abs/2607.12042) | — | | CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration | [arXiv](https://arxiv.org/abs/2607.05465) | — | | Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation | [arXiv](https://arxiv.org/abs/2607.05382) | — | | CoGen3D: An Agentic Human-AI Co-Design Pipeline for 3D Asset Generation for Virtual Reality | [arXiv](https://arxiv.org/abs/2607.03731) | — | | OmniPresent: Generating Coherent Presentation Suites from Scientific Papers | [arXiv](https://arxiv.org/abs/2607.02590) | — | | SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation | [arXiv](https://arxiv.org/abs/2607.01766) | — | | COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows | [arXiv](https://arxiv.org/abs/2607.01709) | — | | SAGE: Structured Agentic Graph Editing for Software Diagrams | [arXiv](https://arxiv.org/abs/2607.01102) | — | | Grounded Multi-Operation Editing for E-Commerce Images (GMO-E²DIT) | [arXiv](https://arxiv.org/abs/2607.00920) | — | | GVR-Coder: A Visual-Feedback Framework for Structured SVG Generation in Complex Document and Meeting Scenarios | [arXiv](https://arxiv.org/abs/2607.28073) | — | | CinemaTraj: Composing Atomic Camera Trajectories for 3D Scenes with LLM Agents | [arXiv](https://arxiv.org/abs/2607.26910) | — | | PlanCraft: Sketch, Refine, and Furnish for Architect-Inspired Progressive 3D Residential Scene Generation | [arXiv](https://arxiv.org/abs/2607.23491) | — | | AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment | [arXiv](https://arxiv.org/abs/2607.22241) | — | | Agentic Designer: Progressive Multi-Agent Collaboration for Structure-Aware Interior Layout Generation | [arXiv](https://arxiv.org/abs/2607.20866) | — | | PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation | [arXiv](https://arxiv.org/abs/2607.16355) | — | | Clarify Before Executing: A Self-Evolving Agent for Resolving Intent Asymmetry in 3D Tool Orchestration | [arXiv](https://arxiv.org/abs/2607.16352) | ACM MM 2026 | | Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget | [arXiv](https://arxiv.org/abs/2607.13125) | — | | MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models | [arXiv](https://arxiv.org/abs/2607.11594) | — | | Exploring Agentic Workflows for Generating High Quality Math Visual Aids | [arXiv](https://arxiv.org/abs/2607.09839) | — | | Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing | [arXiv](https://arxiv.org/abs/2607.08497) | — | | PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation | [arXiv](https://arxiv.org/abs/2607.01883) | ACL 2026 | | OrchestrXR: A Multi-Agent System for Idea-to-Prototype XR Study Authoring | [arXiv](https://arxiv.org/abs/2607.01588) | — | ### 2026-06 | Title | Paper Link | Venue | |---|---|---| | DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation | [arXiv](https://arxiv.org/abs/2606.31537) | — | | Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution (SEAR) | [arXiv](https://arxiv.org/abs/2606.28971) | — | | Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards | [arXiv](https://arxiv.org/abs/2606.27376) | — | | Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation | [arXiv](https://arxiv.org/abs/2606.26907) | — | | VideoAgent: All-in-One Framework for Video Understanding and Editing | [arXiv](https://arxiv.org/abs/2606.23327) | — | | RS-Gen: A Multi-Stage Agentic Framework for Reasoning and Search-Augmented Image Generation | [arXiv](https://arxiv.org/abs/2606.23221) | — | | Taming I2V Models for Image HOI Editing: A Cognitive Benchmark and Agentic Self-Correcting Framework (SCPE) | [arXiv](https://arxiv.org/abs/2606.19073) | — | | Bridging Creative Intent and Visual Quality: Creator-Driven Recurrent Video Generation with Agentic Feedback Loops (CHIEF) | [arXiv](https://arxiv.org/abs/2606.18591) | — | | SceneCraft: Interactive System for Image Editing via Scene Graph | [arXiv](https://arxiv.org/abs/2606.16103) | — | | MUSE: Agentic 3D Scene Authoring via Memory-Grounded Incremental Requirement Satisfaction | [arXiv](https://arxiv.org/abs/2606.14168) | — | | InterleaveThinker: Reinforcing Agentic Interleaved Generation | [arXiv](https://arxiv.org/abs/2606.13679) | — | | SceneConductor: 3D Scene Generation from a Single Image with Multi-Agent Orchestration | [arXiv](https://arxiv.org/abs/2606.08402) | — | | VideoWeaver: Evaluating and Evolving Skills for Agentic Long Video Generation | [arXiv](https://arxiv.org/abs/2606.08091) | — | | ViMax: Agentic Video Generation | [arXiv](https://arxiv.org/abs/2606.07649) | — | | Crayotter: Traceable Multi-Agent Workflows for Long-Form Video Editing | [arXiv](https://arxiv.org/abs/2606.07636) | — | | MemoGen: Can Past Experience Improve Future Text-to-Image Generation? | [arXiv](https://arxiv.org/abs/2606.03243) | — | | JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation | [arXiv](https://arxiv.org/abs/2606.03168) | — | | Any2Poster: Any-Source Poster Generation Across Modalities and Domains | [arXiv](https://arxiv.org/abs/2606.02915) | — | | OctoT2I: A Self-Evolving Agentic Text-to-Image Router | [arXiv](https://arxiv.org/abs/2606.01803) | — | | APE: Agentic Prompt Enhancer for Image Generation and Editing | [arXiv](https://arxiv.org/abs/2606.00204) | — | | ManimAgent: Self-Evolving Multimodal Agents for Visual Education | [arXiv](https://arxiv.org/abs/2606.30296) | — | | NaLA: A 3D Native LLM Layout Agent for High-quality 3D Scene Generation | [arXiv](https://arxiv.org/abs/2606.29395) | ECCV 2026 | | TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL | [arXiv](https://arxiv.org/abs/2606.28016) | — | | One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception | [arXiv](https://arxiv.org/abs/2606.20764) | — | | OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation | [arXiv](https://arxiv.org/abs/2606.17536) | — | | MemSlides: A Hierarchical Memory Driven Agent Framework for Personalized Slide Generation with Multi-turn Local Revision | [arXiv](https://arxiv.org/abs/2606.17162) | — | | Closed-Loop Triplet Synergistic Generation for Long-Form Video | [arXiv](https://arxiv.org/abs/2606.16184) | — | | Temporal Backtracking Search for Test-time Generative Video Reasoning | [arXiv](https://arxiv.org/abs/2606.13861) | — | | IterCAD: An Iterative Multimodal Agent for Visually-Grounded CAD Generation and Editing | [arXiv](https://arxiv.org/abs/2606.13368) | — | | HDSL: A Hierarchical Domain-Specific Language for Structured 3D Indoor Scene Generation and Localized Editing with LLM Agents | [arXiv](https://arxiv.org/abs/2606.09738) | — | | IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment | [arXiv](https://arxiv.org/abs/2606.08016) | CVPR 2026 Findings | | Global-Local Monte Carlo Tree Search in Vision-Language Models for Text-to-3D Indoor Scene Generation | [arXiv](https://arxiv.org/abs/2606.06002) | — | | TVIR: Building Deep Research Agents Towards Text-Visual Interleaved Report Generation | [arXiv](https://arxiv.org/abs/2606.02320) | — | | Multi-Agent Orchestration for Interactive Multimodal Storytelling in Visual-Novel-Style Adventure Games | [CVF](https://openaccess.thecvf.com/content/CVPR2026W/AISTORY/html/Wei_Multi-Agent_Orchestration_for_Interactive_Multimodal_Storytelling_in_Visual-Novel-Style_Adventure_Games_CVPRW_2026_paper.html) | CVPR 2026 Workshop (AISTORY) | | Multi-Agent Video Prediction: Self-Correcting Conditional Frames for Dynamic Scene Forecasting | [CVF](https://openaccess.thecvf.com/content/CVPR2026W/MEIS/html/Zhang_Multi-Agent_Video_Prediction_Self-Correcting_Conditional_Frames_for_Dynamic_Scene_Forecasting_CVPRW_2026_paper.html) | CVPR 2026 Workshop (MEIS) | | IntentEdit: Multi-Agent Reasoning for Intent-Driven Complex Image Editing | [CVF](https://openaccess.thecvf.com/content/CVPR2026F/html/Zhang_IntentEdit_Multi-Agent_Reasoning_for_Intent-Driven_Complex_Image_Editing_CVPRF_2026_paper.html) | CVPR 2026 Findings | | StoryNodes: Human-AI Co-Creation for Multimodal Media Generation Using an Agentic Node-Based Interface | [CVF](https://openaccess.thecvf.com/content/CVPR2026W/A4VM/papers/Kyaw_StoryNodes_Human-AI_Co-Creation_for_Multimodal_Media_Generation_Using_an_Agentic_CVPRW_2026_paper.pdf) | CVPR 2026 Workshop (A4VM) | ### 2026-05 | Title | Paper Link | Venue | |---|---|---| | Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs | [arXiv](https://arxiv.org/abs/2605.30611) | — | | GenClaw: Code-Driven Agentic Image Generation | [arXiv](https://arxiv.org/abs/2605.30248) | — | | DirectorBench: Diagnosing Long-Form Video Generation with Personalized Multi-Agent Evaluation | [arXiv](https://arxiv.org/abs/2605.30090) | — | | MangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga Generation | [arXiv](https://arxiv.org/abs/2605.28173) | — | | AgenticVBench: Can AI Agents Complete Real-World Post-Production Tasks? | [arXiv](https://arxiv.org/abs/2605.27705) | — | | LiveFigure: Generating Editable Scientific Illustration with VLM Agents | [arXiv](https://arxiv.org/abs/2605.23527) | — | | GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation | [arXiv](https://arxiv.org/abs/2605.21605) | — | | Aurora: Unified Video Editing with a Tool-Using Agent | [arXiv](https://arxiv.org/abs/2605.18748) | — | | Generation Navigator: A State-Aware Agentic Framework for Image Generation | [arXiv](https://arxiv.org/abs/2605.17969) | — | | Articraft: An Agentic System for Scalable Articulated 3D Asset Generation | [arXiv](https://arxiv.org/abs/2605.15187) | — | | From Plans to Pixels: Learning to Plan and Orchestrate for Open-Ended Image Editing | [arXiv](https://arxiv.org/abs/2605.15181) | — | | SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning | [arXiv](https://arxiv.org/abs/2605.09423) | — | | SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation | [arXiv](https://arxiv.org/abs/2605.08043) | — | | EditRefiner: A Human-Aligned Agentic Framework for Image Editing Refinement | [arXiv](https://arxiv.org/abs/2605.07457) | — | | Action Agent: Agentic Video Generation Meets Flow-Constrained Diffusion | [arXiv](https://arxiv.org/abs/2605.01477) | — | | 3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code | [arXiv](https://arxiv.org/abs/2606.01057) | — | | CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning | [arXiv](https://arxiv.org/abs/2605.28056) | — | | ReViz: Structured Visual Synthesis of Research Methodology Diagrams | [OpenReview](https://openreview.net/forum?id=jgN31gJMrH) | — | | Code2UML: Agentic LLMs with context engineering for scalable software visualization | [arXiv](https://arxiv.org/abs/2605.24453) | — | | S2ED: From Story to Executable Descriptions for Consistency-Aware Story Illustration | [arXiv](https://arxiv.org/abs/2605.22448) | IEEE ICME 2026 | | One Sentence, One Drama: Personalized Short-Form Drama Generation via Multi-Agent Systems | [arXiv](https://arxiv.org/abs/2605.22144) | — | | SceneCode: Executable World Programs for Editable Indoor Scenes with Articulated Objects | [arXiv](https://arxiv.org/abs/2605.19587) | — | | NEWTON: Agentic Planning for Physically Grounded Video Generation | [arXiv](https://arxiv.org/abs/2605.18396) | — | | Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration | [arXiv](https://arxiv.org/abs/2605.17423) | — | | Genflow Ad Studio: A Compound AI Architecture for Brand-Aligned, Self-Correcting Video Generation | [arXiv](https://arxiv.org/abs/2605.16748) | ACM CAIS 2026 | | PresentAgent-2: Towards Generalist Multimodal Presentation Agents | [arXiv](https://arxiv.org/abs/2605.11363) | — | ### 2026-04 | Title | Paper Link | Venue | |---|---|---| | Co-Director: Agentic Generative Video Storytelling | [arXiv](https://arxiv.org/abs/2604.24842) | — | | Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback | [arXiv](https://arxiv.org/abs/2604.20730) | — | | Making Image Editing Easier via Adaptive Task Reformulation with Agentic Executions | [arXiv](https://arxiv.org/abs/2604.15917) | — | | Authoring for Living Worlds: Tool-Constrained LLM Agents for Executable Multi-Actor Scenarios | [arXiv](https://arxiv.org/abs/2604.10383) | — | | EvoDiagram: Agentic Editable Diagram Creation via Design Expertise Evolution | [arXiv](https://arxiv.org/abs/2604.09568) | — | | Camera Artist: A Multi-Agent Framework for Cinematic Language Storytelling Video Generation | [arXiv](https://arxiv.org/abs/2604.09195) | — | | Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation | [arXiv](https://arxiv.org/abs/2604.25318) | — | | PhysCodeBench: Benchmarking Physics-Aware Symbolic Simulation of 3D Scenes via Self-Corrective Multi-Agent Refinement | [arXiv](https://arxiv.org/abs/2604.23580) | — | | CineAGI: Character-Consistent Movie Creation through LLM-Orchestrated Multi-Modal Generation and Cross-Scene Integration | [arXiv](https://arxiv.org/abs/2604.23579) | IEEE ICME 2026 | | Self-Reasoning Agentic Framework for Narrative Product Grid-Collage Generation | [arXiv](https://arxiv.org/abs/2604.16958) | — | | CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding | [arXiv](https://arxiv.org/abs/2604.13452) | — | | Sima 1.0: A Collaborative Multi-Agent Framework for Documentary Video Production | [arXiv](https://arxiv.org/abs/2604.07721) | — | | Lighting-grounded Video Generation with Renderer-based Agent Reasoning | [arXiv](https://arxiv.org/abs/2604.07966) | CVPR 2026 | | SCMAPR: Self-Correcting Multi-Agent Prompt Refinement for Complex-Scenario Text-to-Video Generation | [arXiv](https://arxiv.org/abs/2604.05489) | — | | GLANCE: A Global-Local Coordination Multi-Agent Framework for Music-Grounded Non-Linear Video Editing | [arXiv](https://arxiv.org/abs/2604.05076) | — | | DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing | [arXiv](https://arxiv.org/abs/2604.04875) | — | | CAMEO: A Conditional and Quality-Aware Multi-Agent Image Editing Orchestrator | [arXiv](https://arxiv.org/abs/2604.03156) | — | ### 2026-03 | Title | Paper Link | Venue | |---|---|---| | CutClaw: Agentic Hours-Long Video Editing via Music Synchronization | [arXiv](https://arxiv.org/abs/2603.29664) | — | | Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis | [arXiv](https://arxiv.org/abs/2603.29620) | — | | IMAGAgent: Orchestrating Multi-Turn Image Editing via Constraint-Aware Planning and Reflection | [arXiv](https://arxiv.org/abs/2603.29602) | — | | Automatic Method Illustration Generation for AI Scientific Papers via Drawing Middleware Creation, Evolution, and Orchestration | [arXiv](https://arxiv.org/abs/2603.29590) | — | | Gen-Searcher: Reinforcing Agentic Search for Image Generation | [arXiv](https://arxiv.org/abs/2603.28767) | — | | GEMS: Agent-Native Multimodal Generation with Memory and Skills | [arXiv](https://arxiv.org/abs/2603.28088) | — | | ScaleEdit-12M: Scaling Open-Source Image Editing Data Generation via Multi-Agent Framework | [arXiv](https://arxiv.org/abs/2603.20644) | — | | Agentic Flow Steering and Parallel Rollout Search for Spatially Grounded Text-to-Image Generation (AFS-Search) | [arXiv](https://arxiv.org/abs/2603.18627) | — | | Mind-of-Director: Multi-modal Agent-Driven Film Previsualization via Collaborative Decision-Making | [arXiv](https://arxiv.org/abs/2603.14790) | — | | GameUIAgent: An LLM-Powered Framework for Automated Game UI Design with Structured Intermediate Representation | [arXiv](https://arxiv.org/abs/2603.14724) | — | | coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation | [arXiv](https://arxiv.org/abs/2603.12829) | CVPR 2026 Findings | | SceneAssistant: A Visual Feedback Agent for Open-Vocabulary 3D Scene Generation | [arXiv](https://arxiv.org/abs/2603.12238) | — | | MANSION: Multi-floor lANguage-to-3D Scene generatIOn for loNg-horizon tasks | [arXiv](https://arxiv.org/abs/2603.11554) | — | | COMIC: Agentic Sketch Comedy Generation | [arXiv](https://arxiv.org/abs/2603.11048) | — | | ImageEdit-R1: Boosting Multi-Agent Image Editing via Reinforcement Learning | [arXiv](https://arxiv.org/abs/2603.08059) | — | | Agentic Planning with Reasoning for Image Styling via Offline RL | [arXiv](https://arxiv.org/abs/2603.07148) | — | | AutoUE: Automated Generation of 3D Games in Unreal Engine via Multi-Agent Systems | [arXiv](https://arxiv.org/abs/2603.07106) | Findings of ACL 2026 | | StruVis: Enhancing Reasoning-based Text-to-Image Generation via Thinking with Structured Vision | [arXiv](https://arxiv.org/abs/2603.06032) | — | | InfinityStory: Unlimited Video Generation with World Consistency and Character-Aware Shot Transitions | [arXiv](https://arxiv.org/abs/2603.03646) | — | | VisionCreator: A Native Visual-Generation Agentic Model with Understanding, Thinking, Planning and Creation | [arXiv](https://arxiv.org/abs/2603.02681) | CVPR 2026 | | RAISE: Requirement-Adaptive Evolutionary Refinement for Training-Free Text-to-Image Alignment | [arXiv](https://arxiv.org/abs/2603.00483) | CVPR 2026 | | Towards Context-Aware Image Anonymization with Multi-Agent Reasoning | [arXiv](https://arxiv.org/abs/2603.27817) | CVPR 2026 Workshop (GRAIL-V) | | WorldAgents: Can Foundation Image Models be Agents for 3D World Models? | [arXiv](https://arxiv.org/abs/2603.19708) | — | | SMART-Editor: A Multi-Agent Framework for Human-Like Design Editing with Structural Integrity | [ACL Anthology](https://aclanthology.org/2026.findings-eacl.169/) | Findings of EACL 2026 | | iARCS: Iterative Agentic RL for Controllable 3D Scene Generation | [arXiv](https://arxiv.org/abs/2608.06161) | CVPR 2026 Workshop (SynData4CV) | | MSRAMIE: Multimodal Structured Reasoning Agent for Multi-instruction Image Editing | [arXiv](https://arxiv.org/abs/2603.16967) | — | | Learning to Present: Inverse Specification Rewards for Agentic Slide Generation | [arXiv](https://arxiv.org/abs/2603.16839) | — | | Feynman: Knowledge-Infused Diagramming Agent for Scalable Visual Designs | [arXiv](https://arxiv.org/abs/2603.12597) | — | | VQQA: An Agentic Approach for Video Evaluation and Quality Improvement | [arXiv](https://arxiv.org/abs/2603.12310) | — | | SPIRAL: Self-Evolving Action-Conditioned Video Generation via Reflective Planning Agents | [arXiv](https://arxiv.org/abs/2603.08403) | — | | BrandFusion: A Multi-Agent Framework for Seamless Brand Integration in Text-to-Video Generation | [arXiv](https://arxiv.org/abs/2603.02816) | — | ### 2026-02 | Title | Paper Link | Venue | |---|---|---| | DeepPresenter: Environment-Grounded Reflection for Agentic Presentation Generation | [arXiv](https://arxiv.org/abs/2602.22839) | — | | PhotoAgent: Agentic Photo Editing with Exploratory Visual Aesthetic Planning | [arXiv](https://arxiv.org/abs/2602.22809) | ICML 2026 (Oral) | | AnimeAgent: Is the Multi-Agent via Image-to-Video Models a Good Disney Storytelling Artist? | [arXiv](https://arxiv.org/abs/2602.20664) | — | | SAGE: Scalable Agentic 3D Scene Generation for Embodied AI | [arXiv](https://arxiv.org/abs/2602.10116) | CVPR 2026 | | Agent Banana: High-Fidelity Image Editing with Agentic Thinking and Tooling | [arXiv](https://arxiv.org/abs/2602.09084) | — | | M3: High-fidelity Text-to-Image Generation via Multi-Modal, Multi-Agent and Multi-Round Visual Reasoning | [arXiv](https://arxiv.org/abs/2602.06166) | — | | PaperX: A Unified Framework for Multimodal Academic Presentation Generation with Scholar DAG | [arXiv](https://arxiv.org/abs/2602.03866) | — | | SIDiffAgent: Self-Improving Diffusion Agent | [arXiv](https://arxiv.org/abs/2602.02051) | — | | Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation | [arXiv](https://arxiv.org/abs/2602.01756) | — | | Vinedresser3D: Towards Agentic Text-guided 3D Editing | [arXiv](https://arxiv.org/abs/2602.19542) | CVPR 2026 | | RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward | [arXiv](https://arxiv.org/abs/2602.17558) | — | | PhyScensis: Physics-Augmented LLM Agents for Complex Physical Scene Arrangement | [arXiv](https://arxiv.org/abs/2602.14968) | ICLR 2026 | | Beyond End-to-End Video Models: An LLM-Based Multi-Agent System for Educational Video Generation | [arXiv](https://arxiv.org/abs/2602.11790) | KDD 2026 | | DECKBench: Benchmarking Multi-Agent Frameworks for Academic Slide Generation and Editing | [arXiv](https://arxiv.org/abs/2602.13318) | — | | SceneSmith: Agentic Generation of Simulation-Ready Indoor Scenes | [arXiv](https://arxiv.org/abs/2602.09153) | ICML 2026 Spotlight | | T2VTree: User-Centered Visual Analytics for Agent-Assisted Thought-to-Video Authoring | [arXiv](https://arxiv.org/abs/2602.08368) | — | | AutoFigure: Generating and Refining Publication-Ready Scientific Illustrations | [arXiv](https://arxiv.org/abs/2602.03828) | ICLR 2026 | ### 2026-01 | Title | Paper Link | Venue | |---|---|---| | PaperBanana: Automating Academic Illustration for AI Scientists | [arXiv](https://arxiv.org/abs/2601.23265) | ICML 2026 (Spotlight) | | GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning | [arXiv](https://arxiv.org/abs/2601.18543) | — | | Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning (VIGA) | [arXiv](https://arxiv.org/abs/2601.11109) | — | | Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM Encoders | [arXiv](https://arxiv.org/abs/2601.10332) | — | | From Text to Simulation: A Multi-Agent LLM Workflow for Automated Chemical Process Design | [arXiv](https://arxiv.org/abs/2601.06776) | — | | From Idea to Co-Creation: A Planner-Actor-Critic Framework for Agent Augmented 3D Modeling | [arXiv](https://arxiv.org/abs/2601.05016) | — | | SciFig: Towards Automating Editable Figure Generation for Scientific Papers | [arXiv](https://arxiv.org/abs/2601.04390) | — | | ComfySearch: Autonomous Exploration and Reasoning for ComfyUI Workflows | [arXiv](https://arxiv.org/abs/2601.04060) | — | | Agentic Retoucher for Text-To-Image Generation | [arXiv](https://arxiv.org/abs/2601.02046) | CVPR 2026 | | PerfGuard: A Performance-Aware Agent for Visual Content Generation | [arXiv](https://arxiv.org/abs/2601.22571) | ICLR 2026 | | The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation | [arXiv](https://arxiv.org/abs/2601.17737) | — | | 3D Space as a Scratchpad for Editable Text-to-Image Generation | [arXiv](https://arxiv.org/abs/2601.14602) | CVPR 2026 | | World Craft: Agentic Framework to Create Visualizable Worlds via Text | [arXiv](https://arxiv.org/abs/2601.09150) | — | | APEX: Academic Poster Editing Agentic Expert | [arXiv](https://arxiv.org/abs/2601.04794) | — | | MiLDEdit: Reasoning-Based Multi-Layer Design Document Editing | [arXiv](https://arxiv.org/abs/2601.04589) | — | | I2E: From Image Pixels to Actionable Interactive Environments for Text-Guided Image Editing | [arXiv](https://arxiv.org/abs/2601.03741) | — | | A Versatile Multimodal Agent for Multimedia Content Generation | [arXiv](https://arxiv.org/abs/2601.03250) | — | ### 2025-12 | Title | Paper Link | Venue | |---|---|---| | AutoMV: An Automatic Multi-Agent System for Music Video Generation | [arXiv](https://arxiv.org/abs/2512.12196) | — | | AgentComp: From Agentic Reasoning to Compositional Mastery in Text-to-Image Models | [arXiv](https://arxiv.org/abs/2512.09081) | — | ### 2025-11 | Title | Paper Link | Venue | |---|---|---| | JarvisEvo: Towards a Self-Evolving Photo Editing Agent with Synergistic Editor-Evaluator Optimization | [arXiv](https://arxiv.org/abs/2511.23002) | CVPR 2026 | | MIRA: Multimodal Iterative Reasoning Agent for Image Editing | [arXiv](https://arxiv.org/abs/2511.21087) | CVPR 2026 Findings | | ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation | [arXiv](https://arxiv.org/abs/2511.11483) | — | ### 2025-10 | Title | Paper Link | Venue | |---|---|---| | From Pixels to Paths: A Multi-Agent Framework for Editable Scientific Illustration (VisPainter) | [arXiv](https://arxiv.org/abs/2510.27452) | — | | Open Multimodal Retrieval-Augmented Factual Image Generation (ORIG) | [arXiv](https://arxiv.org/abs/2510.22521) | — | | Hollywood Town: Long-Video Generation via Cross-Modal Multi-Agent Orchestration | [arXiv](https://arxiv.org/abs/2510.22431) | — | | VISTA: A Test-Time Self-Improving Video Generation Agent | [arXiv](https://arxiv.org/abs/2510.15831) | CVPR 2026 | | GenPilot: A Multi-Agent System for Test-Time Prompt Optimization in Image Generation | [arXiv](https://arxiv.org/abs/2510.07217) | Findings of EMNLP 2025 | | World-To-Image: Grounding Text-to-Image Generation with Agent-Driven World Knowledge | [arXiv](https://arxiv.org/abs/2510.04201) | — | ### 2025-09 | Title | Paper Link | Venue | |---|---|---| | PromptSculptor: Multi-Agent Based Text-to-Image Prompt Optimization | [arXiv](https://arxiv.org/abs/2509.12446) | EMNLP 2025 System Demonstrations | | Maestro: Self-Improving Text-to-Image Generation via Agent Orchestration | [arXiv](https://arxiv.org/abs/2509.10704) | — | | Interleaving Reasoning for Better Text-to-Image Generation | [arXiv](https://arxiv.org/abs/2509.06945) | — | ### 2025-08 | Title | Paper Link | Venue | |---|---|---| | AniME: Adaptive Multi-Agent Planning for Long Animation Generation | [arXiv](https://arxiv.org/abs/2508.18781) | SIGGRAPH Asia 2025 Posters | | An LLM-LVLM Driven Agent for Iterative and Fine-Grained Image Editing (RefineEdit-Agent) | [arXiv](https://arxiv.org/abs/2508.17435) | — | | PosterGen: Aesthetic-Aware Multi-Modal Paper-to-Poster Generation via Multi-Agent LLMs | [arXiv](https://arxiv.org/abs/2508.17188) | — | | A Unified Multi-Agent Framework for Universal Multimodal Understanding and Generation (MAGUS) | [arXiv](https://arxiv.org/abs/2508.10494) | — | | MAViS: A Multi-Agent Framework for Long-Sequence Video Storytelling | [arXiv](https://arxiv.org/abs/2508.08487) | — | | Talk2Image: A Multi-Agent System for Multi-Turn Image Generation and Editing | [arXiv](https://arxiv.org/abs/2508.06916) | AAAI 2026 | | Uni-CoT: Towards Unified Chain-of-Thought Reasoning Across Text and Vision | [arXiv](https://arxiv.org/abs/2508.05606) | ICLR 2026 | ### 2025-07 | Title | Paper Link | Venue | |---|---|---| | T2I-Copilot: A Training-Free Multi-Agent Text-to-Image System for Enhanced Prompt Interpretation and Interactive Generation | [arXiv](https://arxiv.org/abs/2507.20536) | ICCV 2025 | | Captain Cinema: Towards Short Movie Generation | [arXiv](https://arxiv.org/abs/2507.18634) | — | | Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing | [arXiv](https://arxiv.org/abs/2507.05259) | — | ### 2025-06 | Title | Paper Link | Venue | |---|---|---| | VisualPrompter: Semantic-Aware Prompt Optimization with Visual Feedback for Text-to-Image Synthesis | [arXiv](https://arxiv.org/abs/2506.23138) | ICLR 2026 | | AniMaker: Automated Multi-Agent Animated Storytelling with MCTS-Driven Clip Generation | [arXiv](https://arxiv.org/abs/2506.10540) | SIGGRAPH Asia 2025 Conference Papers | | ComfyUI-R1: Exploring Reasoning Models for Workflow Generation | [arXiv](https://arxiv.org/abs/2506.09790) | Findings of ACL 2026 | | ComfyUI-Copilot: An Intelligent Assistant for Automated Workflow Development | [arXiv](https://arxiv.org/abs/2506.05010) | ACL 2025 System Demonstrations | | Gen-n-Val: Agentic Image Data Generation and Validation | [arXiv](https://arxiv.org/abs/2506.04676) | CVPR 2026 Findings | | OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation | [arXiv](https://arxiv.org/abs/2506.02015) | CVPR 2026 | ### 2025-05 | Title | Paper Link | Venue | |---|---|---| | ReasonGen-R1: CoT for Autoregressive Image Generation Models through SFT and RL | [arXiv](https://arxiv.org/abs/2505.24875) | — | | PreGenie: An Agentic Framework for High-quality Visual Presentation Generation | [arXiv](https://arxiv.org/abs/2505.21660) | Findings of EMNLP 2025 | | Agentic 3D Scene Generation with Spatially Contextualized VLMs | [arXiv](https://arxiv.org/abs/2505.20129) | — | | ComfyMind: Toward General-Purpose Generation via Tree-Based Planning and Reactive Feedback | [arXiv](https://arxiv.org/abs/2505.17908) | — | | IA-T2I: Internet-Augmented Text-to-Image Generation | [arXiv](https://arxiv.org/abs/2505.15779) | — | | MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation | [arXiv](https://arxiv.org/abs/2505.02648) | CVPR 2025 | | T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT | [arXiv](https://arxiv.org/abs/2505.00703) | NeurIPS 2025 | ### 2025-04 | Title | Paper Link | Venue | |---|---|---| | Marmot: Multi-Agent Reasoning for Multi-Object Self-Correcting in Improving Image-Text Alignment | [arXiv](https://arxiv.org/abs/2504.20054) | — | | A Unified Agentic Framework for Evaluating Conditional Image Generation (CIGEval) | [arXiv](https://arxiv.org/abs/2504.07046) | ACL 2025 | | CREA: A Collaborative Multi-Agent Framework for Creative Image Editing and Generation | [arXiv](https://arxiv.org/abs/2504.05306) | NeurIPS 2025 (Main Conference) | ### 2025-03 | Title | Paper Link | Venue | |---|---|---| | ComfyGPT: A Self-Optimizing Multi-Agent System for Comprehensive ComfyUI Workflow Generation | [arXiv](https://arxiv.org/abs/2503.17671) | — | | Automated Movie Generation via Multi-Agent CoT Planning (MovieAgent) | [arXiv](https://arxiv.org/abs/2503.07314) | — | | MM-StoryAgent: Immersive Narrated Storybook Video Generation with a Multi-Agent Paradigm across Text, Image and Audio | [arXiv](https://arxiv.org/abs/2503.05242) | — | ### 2025-02 | Title | Paper Link | Venue | |---|---|---| | Multi-Agent Multimodal Models for Multicultural Text to Image Generation (MosAIG) | [arXiv](https://arxiv.org/abs/2502.15972) | — | ### 2025-01 | Title | Paper Link | Venue | |---|---|---| | Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step | [arXiv](https://arxiv.org/abs/2501.13926) | CVPR 2025 | | FilmAgent: A Multi-Agent Framework for End-to-End Film Automation in Virtual 3D Spaces | [arXiv](https://arxiv.org/abs/2501.12909) | — | ## Community Join our WeChat community to discuss. <img src="./assets/ed048cd69337aa1bd8679ae5457ad42d.jpg" width="300"> ## 📮 Contact [yuxm02@gmail.com](mailto:yuxm02@gmail.com)