Related Experiment Video
Updated: Aug 6, 2026

07:12
Whole-cell Super-Resolution Imaging via DNA-PAINT on a Spinning Disk Confocal with Optical Photon Reassignment
Published on: January 6, 2026
PiGIE: Proximal policy optimization guided diffusion for fine-grained image editing
Tiancheng Li1, Jinxiu Liu1, Weijian Luo2
1South China University of Technology, No.777, Xingye Avenue East, Panyu District, Guangzhou, Guangdong, 511442, Asia, China.
Summary
Proximal Policy Optimization Guided Image Editing (PiGIE) accurately edits tiny objects in complex images. This novel diffusion model uses reinforcement learning for improved image quality and generalization in text-guided editing tasks.
Area of Science:
- Computer Vision
- Artificial Intelligence
- Machine Learning
Background:
- Instruction-based image editing is complex, especially for tiny objects and intricate scenes.
- Current methods struggle with precise localization and manipulation of small elements in images.
Purpose of the Study:
- To develop a novel diffusion model for accurate text-guided image editing of tiny objects.
- To enhance the ability to edit fine-grained details within complex visual scenes.
Main Methods:
- Introduced Proximal Policy Optimization Guided Image Editing (PiGIE), a diffusion model.
- Employed reinforcement learning with Proximal Policy Optimization (PPO) to fine-tune the diffusion model.
- Utilized UNet attention maps and human feedback as a reward signal for model optimization.
Main Results:
- PiGIE demonstrates significant improvements in image quality and generalization capabilities.
- Achieved a new baseline for editing fine-grained images with multiple tiny objects.
- Successfully incorporated noise masks guided by attention maps for precise editing.
Conclusions:
- PiGIE offers a robust solution for challenging text-guided image editing tasks involving small objects.
- The reinforcement learning approach enhances the model's ability to interpret and execute complex editing instructions.
- This work paves the way for future advancements in editing fine-grained visual content.