✨Artemis: Structured Visual Reasoning for Perception Policy Learning
📝 Summary:
Artemis improves visual perception by using structured spatial reasoning with label bounding-box pairs instead of linguistic intermediate reasoning. This avoids language ambiguity, enables direct supervision, and leads to strong performance and generalization across diverse visual tasks.
🔹 Publication Date: Published on Dec 1
🔹 Paper Links:
• arXiv Page: https://arxiv.org/abs/2512.01988
• PDF: https://arxiv.org/pdf/2512.01988
• Project Page: https://vi-ocean.github.io/projects/artemis/
• Github: https://github.com/WayneTomas/Artemis
==================================
For more data science resources:
✓ https://xn--r1a.website/DataScienceT
#VisualPerception #ComputerVision #SpatialReasoning #AI #MachineLearning
📝 Summary:
Artemis improves visual perception by using structured spatial reasoning with label bounding-box pairs instead of linguistic intermediate reasoning. This avoids language ambiguity, enables direct supervision, and leads to strong performance and generalization across diverse visual tasks.
🔹 Publication Date: Published on Dec 1
🔹 Paper Links:
• arXiv Page: https://arxiv.org/abs/2512.01988
• PDF: https://arxiv.org/pdf/2512.01988
• Project Page: https://vi-ocean.github.io/projects/artemis/
• Github: https://github.com/WayneTomas/Artemis
==================================
For more data science resources:
✓ https://xn--r1a.website/DataScienceT
#VisualPerception #ComputerVision #SpatialReasoning #AI #MachineLearning
✨VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images
📝 Summary:
VisionFoundry creates synthetic visual question answering data using LLMs and text-to-image models to improve VLM visual perception. Training with this targeted data significantly boosts model performance on visual perception benchmarks like MMVP and CV-Bench-3D.
🔹 Publication Date: Published on Apr 10
🔹 Paper Links:
• arXiv Page: https://arxiv.org/abs/2604.09531
• PDF: https://arxiv.org/pdf/2604.09531
• Project Page: https://zlab-princeton.github.io/VisionFoundry/
==================================
For more data science resources:
✓ https://xn--r1a.website/DataScienceT
#VLM #VisualPerception #SyntheticData #LLM #AI
📝 Summary:
VisionFoundry creates synthetic visual question answering data using LLMs and text-to-image models to improve VLM visual perception. Training with this targeted data significantly boosts model performance on visual perception benchmarks like MMVP and CV-Bench-3D.
🔹 Publication Date: Published on Apr 10
🔹 Paper Links:
• arXiv Page: https://arxiv.org/abs/2604.09531
• PDF: https://arxiv.org/pdf/2604.09531
• Project Page: https://zlab-princeton.github.io/VisionFoundry/
==================================
For more data science resources:
✓ https://xn--r1a.website/DataScienceT
#VLM #VisualPerception #SyntheticData #LLM #AI