This blog post presents a study on Agent Explorative Policy Optimization (AXPO) for enhancing multimodal agentic reasoning in AI models. The post identifies limitations in existing reasoning models that struggle with external tool utilization and proposes AXPO as a solution, demonstrating improved performance across multiple benchmarks compared to traditional methods.