{"as_of":"2026-08-08T12:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2ab921169281e00aab138517867c50dd1bb3fd4d11c736b97bbc52aa3abcc4e8","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T19:56:35.246936Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T11:53:35.315405Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T12:03:24.478700Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"cited_work":{"arxiv_id":"2603.00546","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.00546","snapshot_observed_at":"2026-07-16T02:22:33.558625Z","title":"Advancing multimodal judge models through a capability-oriented benchmark and mcts-driven data generation.arXiv preprint arXiv:2603.00546, 2026","venue":null,"work_id":"279b0ff6-2205-489f-8eb4-e3efee67c674","year":2026},"citing_paper":{"arxiv_id":"2605.28579","last_updated":"2026-06-04T01:52:56Z","snapshot_observed_at":"2026-08-08T07:04:18.529242Z","submitted_at":"2026-05-27T15:01:59Z","title":"MUSE: Benchmarking Manufacturable, Functional, and Assemblable Text-to-CAD Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T11:53:35.315405Z"},"links":{"cited_paper":"/paper/2603.00546","citing_paper":"/paper/2605.28579"},"observation_digest":"sha256:f06f7f982569aa59cab237f190a7ab13d2c2f6abbb3df533292b760c58362ecb","observation_id":"ffe76620-05ea-44fc-a9dd-555a06543955","resolution":{"observed_at":"2026-07-16T02:22:33.558625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.00546/citation-record","integrity":"/paper/2603.00546/integrity","json":"/paper/2603.00546/citation-record.json","paper":"/paper/2603.00546"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T19:56:27.636015Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:27.636015Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:43b91acda2d8f4ac846cba444bb28817f880ca18646e330a2f20b52fbbfb5f32","observation_id":"b95ece5a-b998-493a-afb4-1960e4c6ae80","resolution":{"observed_at":"2026-08-02T19:56:27.636015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:27.702214Z","title":"MLLM-as-a-judge: Assessing multimodal LLM-as-a-judge with vision-language benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:27.702214Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:edd5c1bf544a91cf57b8c8db78738b260b6164a481b37ab729d1e5e54d6f7508","observation_id":"ba55f520-b18f-42e9-a081-06f8bc823306","resolution":{"observed_at":"2026-08-02T19:56:27.702214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:27.862650Z","title":"Are we on the right way for eval- uating large vision-language models? InAdvances in Neural Information Processing Systems, pages 27056–27087","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:27.862650Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:72a159cd7201386385922c2e37d1f62028c64a204e0c2b79f09104afc1d34dc0","observation_id":"8fcd1560-87f6-4f87-900e-1b0d3c5986c8","resolution":{"observed_at":"2026-08-02T19:56:27.862650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:27.933953Z","title":"M 3CoT: A novel benchmark for multi- domain multi-step multi-modal chain-of-thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:27.933953Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:f34f8d0d5b226378824d9a72dccef567a01ba664008d9531708410949b6e1a61","observation_id":"ef5384c5-836c-40fe-8259-79616f60e36b","resolution":{"observed_at":"2026-08-02T19:56:27.933953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17793","last_updated":"2025-03-22T15:00:18Z","snapshot_observed_at":"2026-08-07T16:44:08.279475Z","submitted_at":"2025-03-22T15:00:18Z","title":"Every Sample Matters: Leveraging Mixture-of-Experts and High-Quality Data for Efficient and Accurate Code LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17793","snapshot_observed_at":"2026-08-02T19:56:27.990155Z","title":"Every Sample Matters: Leveraging Mixture-of-Experts and High- Quality Data for Efficient and Accurate Code LLM, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:27.990155Z"},"links":{"cited_paper":"/paper/2503.17793","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:05cd95e4eb1dd647873820c9f6f46372be5cdae681eb79c916bb6e2c6ba82a6e","observation_id":"84d50ffe-005a-44d1-9271-ab0a73a543e3","resolution":{"observed_at":"2026-08-02T19:56:27.990155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-02T19:56:28.086458Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:28.086458Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:eb9f49535c6d60c0ac8f075add97bb889d27602ed132ca5aa3a15b5ed328770d","observation_id":"0941feac-e08e-45b6-a2d3-e47d321952a4","resolution":{"observed_at":"2026-08-02T19:56:28.086458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:28.281455Z","title":"Efficient selectivity and backup operators in monte-carlo tree search","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:28.281455Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:315f21e843e1413ccdfca4658a346c9d41cb57038c005a4e62f5685ea498087d","observation_id":"0cd671ac-3da1-430b-83e5-ca62c916d4f5","resolution":{"observed_at":"2026-08-02T19:56:28.281455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:28.333590Z","title":"Mm-ifengine: Towards multimodal instruction following","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:28.333590Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:cad5216713ee4106a6ab62fe14132456c32c0076a3e345aa9c439b63cc1dfb17","observation_id":"2bb1915a-a348-4929-842a-7dd66ba6281e","resolution":{"observed_at":"2026-08-02T19:56:28.333590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13427","last_updated":"2025-06-05T05:29:41Z","snapshot_observed_at":"2026-08-07T15:42:59.225164Z","submitted_at":"2025-05-19T17:55:08Z","title":"MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13427","snapshot_observed_at":"2026-08-02T19:56:28.466278Z","title":"MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scal- able Step-Level Supervision, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:28.466278Z"},"links":{"cited_paper":"/paper/2505.13427","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:392eb2251de34e63c3a3e7d3052efa4e0b5ba9a13f8959be902519f978ab5f57","observation_id":"1ca2f837-1ad3-464c-977a-95820fb8ab4f","resolution":{"observed_at":"2026-08-02T19:56:28.466278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-02T19:56:28.590628Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:28.590628Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:68e244dbbf2e5f400ba6ccec7658464fd261b78cea3728066d8e63690710e75c","observation_id":"335b71fd-9a91-4702-bd6d-6032358880bd","resolution":{"observed_at":"2026-08-02T19:56:28.590628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-02T19:56:28.712586Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:28.712586Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:e69affedbcc29e2b9fd1e686b463bba7cbf074e19168925793f1dea25ead15e0","observation_id":"1d0c79e5-8689-4bae-998d-69272bda73bc","resolution":{"observed_at":"2026-08-02T19:56:28.712586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:28.870577Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:28.870577Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:ba23bf09895809b942801c701908b6d872f0f9ce971a25f8212cee228e71b1f7","observation_id":"39b7f9c5-7f9a-4158-9cc7-c8e0108ca516","resolution":{"observed_at":"2026-08-02T19:56:28.870577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-02T19:56:29.025781Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.025781Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:a5f55e24dcb65278d70c3170189f27564b2672aec151ab353d5efa51ee97ef2f","observation_id":"3aee8528-579a-4fed-8205-11dc1dea540c","resolution":{"observed_at":"2026-08-02T19:56:29.025781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:29.234607Z","title":"From generation to judgment: Op- portunities and challenges of LLM-as-a-judge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.234607Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:79d7c715846d63f63b63433663a951fe7ff81704310cac737f4565672d017224","observation_id":"87760e01-565b-4123-b07d-57f1790e7454","resolution":{"observed_at":"2026-08-02T19:56:29.234607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:29.459785Z","title":"Vl- rewardbench: A challenging benchmark for vision-language generative reward models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.459785Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:d67b6740ddba166b1d4385f7c57b91bc8b56e19c0d4d33a438eb3d6bd8e3f026","observation_id":"71cc89be-fb92-444b-aeaf-a86bf525ddd8","resolution":{"observed_at":"2026-08-02T19:56:29.459785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-07T05:53:12.643515Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-02T19:56:29.545585Z","title":"Skywork-reward: Bag of tricks for reward modeling in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.545585Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:5951ae5b9dc0d5c270370da9e2ec5ebed15f881eda801a3a918134b90556ee80","observation_id":"7ee98173-9fc8-4dbf-8b53-fa26734bad75","resolution":{"observed_at":"2026-08-02T19:56:29.545585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:29.603365Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.603365Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:1541e245251748e3b4c3a78402b8ea6296d917813d82d16689f8f21a3b1f889f","observation_id":"58616d15-a35e-4aaf-a966-0a5b2c48cabd","resolution":{"observed_at":"2026-08-02T19:56:29.603365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:29.695853Z","title":"MIA-DPO: Multi-image augmented di- rect preference optimization for large vision-language mod- els","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.695853Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:85dbba62ba0d44b792c602f6a6ed8d1ad75e965c12abc766c3b9c0448f35148a","observation_id":"6a18d149-1aea-4896-837c-e464ed7cdb4a","resolution":{"observed_at":"2026-08-02T19:56:29.695853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-02T19:56:29.797926Z","title":"Improve Mathemat- ical Reasoning in Language Models by Automated Process Supervision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.797926Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:a4be03484ecdca0957a57ef47a4166352412402ac588d3d753d571300e83158b","observation_id":"208fa9a9-3acd-4f28-8dec-c003cd5ceac1","resolution":{"observed_at":"2026-08-02T19:56:29.797926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:29.895022Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.895022Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:40f5c66ae42ae951ac03a2dd009e68ffcd604fd45fe70fbb4ff304b0595ec7c1","observation_id":"f61d1d53-b576-40ce-9acb-973822cea5b2","resolution":{"observed_at":"2026-08-02T19:56:29.895022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:30.102690Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:30.102690Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:e2af1c0b42658af0ca89d7ef09a1acacbfe948f3111f7e5dda7c9759a1c1e2f5","observation_id":"2d4e6dec-6a8a-418e-8d02-bb3c703b7692","resolution":{"observed_at":"2026-08-02T19:56:30.102690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-02T19:56:30.300126Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:30.300126Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:0dab8fd612acd8a5d8f7944f25e8b33e39ca78bcb0ba957f215a679a9901f052","observation_id":"c12b52a3-8990-4b27-9ced-1a516fc9929e","resolution":{"observed_at":"2026-08-02T19:56:30.300126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:30.487065Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:30.487065Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:ba8c0f87fc27436d08de60ec2a442294d571aa6ea13a36737021ed59c1217604","observation_id":"43515f9f-132e-49c3-b733-22885f3f06ae","resolution":{"observed_at":"2026-08-02T19:56:30.487065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-02T19:56:30.621170Z","title":"MiMo-VL Technical Report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:30.621170Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:0ad9b694b2fe69545dc260d798c5dbc44a508e3008e9f216dcd6d7e46f958389","observation_id":"9a820de4-a910-4a8d-a76c-6440165bd6fd","resolution":{"observed_at":"2026-08-02T19:56:30.621170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:30.762220Z","title":"Mea- suring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:30.762220Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:38ef87a691b2eb6063f70657f4ae40aeb1e16906747b9e84501d7cc1ab6f7bd5","observation_id":"0d27393f-7520-41ec-b445-bf42ce9cb706","resolution":{"observed_at":"2026-08-02T19:56:30.762220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02666","last_updated":"2024-08-08T17:09:58Z","snapshot_observed_at":"2026-08-08T10:45:45.471332Z","submitted_at":"2024-08-05T17:57:02Z","title":"Self-Taught Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02666","snapshot_observed_at":"2026-08-02T19:56:30.964243Z","title":"Self- taught evaluators.arXiv preprint arXiv:2408.02666, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:30.964243Z"},"links":{"cited_paper":"/paper/2408.02666","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:aa2db1e41cf98daa28b2c56c27ce8800a9806366920e8e1d7a53415020fe90a6","observation_id":"c956993e-8033-4bb3-b88b-75403199d96d","resolution":{"observed_at":"2026-08-02T19:56:30.964243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-02T19:56:31.100419Z","title":"Enhancing the Rea- soning Ability of Multimodal Large Language Models via Mixed Preference Optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:31.100419Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:a971b8c605020ddb3d46df8f11f1fe069e73566727efa3a79f4a588d48b110f4","observation_id":"a626effc-9642-4931-824b-5e833831e6c4","resolution":{"observed_at":"2026-08-02T19:56:31.100419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-02T19:56:31.186279Z","title":"Internvl3.5: Advancing open-source multimodal models in versatility, reasoning, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:31.186279Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:c8d101db80a22fcb2d1a087fb99166d6d742ab36a34d1694f3391454ec0c922f","observation_id":"ce050607-bab2-4464-920e-7d6e9f9d0c97","resolution":{"observed_at":"2026-08-02T19:56:31.186279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:31.281051Z","title":"SoTA with less: MCTS-guided sample selection for data-efficient visual reasoning self-improvement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:31.281051Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:e5f8d9720a3aa102debcb01b34fea342518bba1880b9ca3c890dd0eccd729fdb","observation_id":"c2f28a64-5501-45db-9814-687086437bd8","resolution":{"observed_at":"2026-08-02T19:56:31.281051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:31.484261Z","title":"Unified multimodal chain-of-thought reward model through reinforcement fine- tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:31.484261Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:c3d1d62b9a65566d7fa945fe9f8077117326462621caf61e096270bd11c71513","observation_id":"ad8e691b-00d2-4218-b3d7-c3be76064525","resolution":{"observed_at":"2026-08-02T19:56:31.484261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05236","last_updated":"2026-02-25T13:17:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T08:36:05Z","title":"Unified Reward Model for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05236","snapshot_observed_at":"2026-08-02T19:56:31.618718Z","title":"Unified Reward Model for Multimodal Understand- ing and Generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:31.618718Z"},"links":{"cited_paper":"/paper/2503.05236","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:bb8224c9a73321fa72032b657ee2c2835b4e391d61b26eba54e3fa7fb4cfb84e","observation_id":"31c2c557-fc52-4cda-b980-d82f73e7fe6d","resolution":{"observed_at":"2026-08-02T19:56:31.618718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:31.796208Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:31.796208Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:e9d7a8fec82cb72158321cb7a77823fb40dfd13f2c961ff43bbbfbb570110826","observation_id":"b91f6f3c-613a-4879-8461-3f7d70e5a749","resolution":{"observed_at":"2026-08-02T19:56:31.796208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:31.858453Z","title":"J1: Incentiviz- ing thinking in llm-as-a-judge via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:31.858453Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:aeb3d1c1ac6e29b8e92d517fe1e892dfaa842a043d67eabfc16eb264eb53a89f","observation_id":"aa3fc127-7b93-4a47-adbb-472fafd0fd03","resolution":{"observed_at":"2026-08-02T19:56:31.858453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:31.956457Z","title":"Multimodal Preference Data Synthetic Alignment with Re- ward Model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:31.956457Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:0794cb4bcda13a96d500e445b71f52668a7788afd79ce4270dcdf9bd98eed0d9","observation_id":"9bd999c1-d447-4212-867a-446d82d60593","resolution":{"observed_at":"2026-08-02T19:56:31.956457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:32.055970Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:32.055970Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:2c4ad3808e48babf94c56a97462a10d1ef9ffb19b438aae07da5f77eabf4f1d3","observation_id":"0e781a24-5391-49b4-8b7b-e7aaef3e4f5f","resolution":{"observed_at":"2026-08-02T19:56:32.055970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:32.196304Z","title":"Monte carlo tree search boosts reasoning via iterative prefer- ence learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:32.196304Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:9e17da631a71342eca93df9a52adaac6e729ef8194ad2dfcfd9a4fad2ebc72a7","observation_id":"4663dc23-d0e0-44b4-9820-d6eee7906aa3","resolution":{"observed_at":"2026-08-02T19:56:32.196304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:32.330762Z","title":"Llava- critic: Learning to evaluate multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:32.330762Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:a754afb421e05f65bcaf0483e4e6da8dbbb3b98df9ecd4eda677e13f0e53be0a","observation_id":"b5119312-8e6d-43c8-b357-5e3047303c21","resolution":{"observed_at":"2026-08-02T19:56:32.330762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:32.399862Z","title":"Chen, Wenzheng Liu, Wei Zhang, Wenjie Zeng, Xikun Zhang, Jingyi Zhang, YuXin Song, Wenhao Wu, and Dacheng Tao","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:32.399862Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:6bf2f61c3f7fb3ea140e9234475064bf00a91137fe0a10abb1f106f0be986bdd","observation_id":"344db1ac-eb17-4a89-9d55-ceccdefb5236","resolution":{"observed_at":"2026-08-02T19:56:32.399862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:32.469544Z","title":"Mulberry: Em- powering MLLM with o1-like reasoning and reflection via collective monte carlo tree search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:32.469544Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:4889d7d1b3f73e186c5504a5161f8c6bb3dae3e7d9e88d891b1f1e430d401e54","observation_id":"fd9a0d36-c308-4e71-96c4-c1ac633e6e16","resolution":{"observed_at":"2026-08-02T19:56:32.469544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14191","last_updated":"2025-02-20T01:48:13Z","snapshot_observed_at":"2026-08-07T18:03:15.507750Z","submitted_at":"2025-02-20T01:48:13Z","title":"Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14191","snapshot_observed_at":"2026-08-02T19:56:32.626573Z","title":"Multimodal RewardBench: Holistic Evalua- tion of Reward Models for Vision Language Models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:32.626573Z"},"links":{"cited_paper":"/paper/2502.14191","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:ae86a4a49fa0c34412615d8f58e345d84d185fcc595b6742cff7ffab7b3d2b46","observation_id":"9f2c75f4-4926-474b-a789-d457d18ac3e6","resolution":{"observed_at":"2026-08-02T19:56:32.626573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:32.755599Z","title":"A survey on multimodal large language models.National Science Review, 11(12): nwae403, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:32.755599Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:5a8789b88fce40e98ef52742183e2ff7be763ad40e620ac69480e175ff593be1","observation_id":"3cf4578e-7a22-4c43-abf0-b9ca285ac19e","resolution":{"observed_at":"2026-08-02T19:56:32.755599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-02T19:56:32.882052Z","title":"DAPO: An Open-Source LLM Reinforcement Learn- ing System at Scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:32.882052Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:ea0d2dffee9006b775e175f7a04c12cbb45ec8054fe95ad6b7e7cc7f477f2f42","observation_id":"d11f5705-9a13-488c-a8c2-2f9dd3c1a2e3","resolution":{"observed_at":"2026-08-02T19:56:32.882052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:32.951359Z","title":"Rlaif-v: Open-source ai feed- back leads to super gpt-4v trustworthiness","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:32.951359Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:a07550c31e5bdd757accb3a25f8197b31870c6f7d5bd6056576c9c751a7eeeb5","observation_id":"9c4fd817-26f6-4cc6-b80e-2a2cb135ec94","resolution":{"observed_at":"2026-08-02T19:56:32.951359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.005768Z","title":"Mmmu: A massive multi-discipline multimodal understand- ing and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.005768Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:f6c020570129281403602506eaec998805c11a54bad35c72ad3d6f5d8ca52be8","observation_id":"155dead4-f115-4b73-9b19-9b1e359ebcef","resolution":{"observed_at":"2026-08-02T19:56:33.005768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.062176Z","title":"MMMU-pro: A more robust multi-discipline multi- modal understanding benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.062176Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:ad1d40afebe867e2fb50173b85a72578ad755ef81d96002ac10f246f6f73ada0","observation_id":"4a90b085-ec11-4f09-8888-9cca6fa2976b","resolution":{"observed_at":"2026-08-02T19:56:33.062176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.095853Z","title":"InternLM-XComposer2.5-reward: A simple yet effective multi-modal reward model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.095853Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:c4638c19f9178f9046902e82f0b7935855f682a72927487561c379d59799f8b1","observation_id":"03d601ef-cc7b-48f2-bd53-025463245bb5","resolution":{"observed_at":"2026-08-02T19:56:33.095853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.160515Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? InComputer Vision – ECCV 2024, pages 169–186, Cham, 2025","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.160515Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:e050010ab160c4b0afa6da3334a743f6addc9791ab17e968a98b9aca79a17fc4","observation_id":"b478a422-45dc-47ad-adaf-8b3ec038477c","resolution":{"observed_at":"2026-08-02T19:56:33.160515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01361","last_updated":"2023-11-02T16:11:09Z","snapshot_observed_at":"2026-08-02T05:59:18.612817Z","submitted_at":"2023-11-02T16:11:09Z","title":"GPT-4V(ision) as a Generalist Evaluator for Vision-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01361","snapshot_observed_at":"2026-08-02T19:56:33.229753Z","title":"Gpt-4v (ision) as a general- ist evaluator for vision-language tasks.arXiv preprint arXiv:2311.01361, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.229753Z"},"links":{"cited_paper":"/paper/2311.01361","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:ceaa4786373e3191c356d147514dea148c777bf25daa50e430a6af090de665c5","observation_id":"e328df1f-2149-4c82-8992-e059970c3bd9","resolution":{"observed_at":"2026-08-02T19:56:33.229753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-02T19:56:33.297932Z","title":"R1-Reward: Train- ing Multimodal Reward Model Through Stable Reinforce- ment Learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.297932Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:a142ced7177cf1a3653592d613481515efbe941f5bd130f83e374a2b0dedf770","observation_id":"0e55930e-bd20-4101-a527-91a1f656848d","resolution":{"observed_at":"2026-08-02T19:56:33.297932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.389349Z","title":"Llamafac- tory: Unified efficient fine-tuning of 100+ language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.389349Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:6eda3c63ed085dd6d43039df91b4cbeecdeec7cf033bb2f60d03e4c6c88691a5","observation_id":"e46844e7-e775-4c67-9b1d-6f524c4336b3","resolution":{"observed_at":"2026-08-02T19:56:33.389349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.492213Z","title":"Easyr1: An efficient, scalable, multi-modality rl training framework, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.492213Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:68cae198dad0bdf7d6fa9fb054371518982c75c6359c3cab3ec50effc425e9f1","observation_id":"0634c388-8415-4f9c-bcc1-e76a24a1cd03","resolution":{"observed_at":"2026-08-02T19:56:33.492213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-02T19:56:33.552171Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.552171Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:448ffe24c30d5299b0b45ff6fb0a42e27b7469a59f4f8a64ec89f2012b008d95","observation_id":"30b42ec6-0547-43d4-b6b9-6efe512f3a97","resolution":{"observed_at":"2026-08-02T19:56:33.552171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.610346Z","title":"Capability-Oriented Evaluation Framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.610346Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:36841ac629ce7239599ddbe88185958f8128be2d0f318ebd5f85fe61a16cfce0","observation_id":"e10bb0df-8bd6-4365-93ea-d163e706ac3b","resolution":{"observed_at":"2026-08-02T19:56:33.610346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.646776Z","title":"Open-Source Training Data Collection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.646776Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:449666c7d54d58b2640c4ba216b5a4fbddbba71d4f0ba6afd6bb119a660b0683","observation_id":"b0bfeda5-4260-452d-9455-42e018e144f3","resolution":{"observed_at":"2026-08-02T19:56:33.646776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.698935Z","title":"Experimental Setup","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.698935Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:71fec3fb0d208abfd0300a78d845c3dd8d2d2ce72fa034437be7baedfac46de5","observation_id":"2569f6e2-ddd5-42d2-84e7-128362fddc86","resolution":{"observed_at":"2026-08-02T19:56:33.698935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.759584Z","title":"Benchmark Examples 3 A.1","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.759584Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:58393c526c5931c95df06f9c9e622eddd749e9f97f085295621004b94a1b41cd","observation_id":"4a291b2e-12d8-4054-81af-e02c462b0813","resolution":{"observed_at":"2026-08-02T19:56:33.759584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.832523Z","title":"**Gross operating surplus**: Net operating surplus + Con- sumption of fixed capital = 240,000 + 110,000 = 350,000 Rm; 3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.832523Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:4af24dfce6a9d4fd399047425abe45ad7a42d87d92edee22da3040443c80ee29","observation_id":"07341223-79eb-4b64-9143-15eec125faf3","resolution":{"observed_at":"2026-08-02T19:56:33.832523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:33.940890Z","title":"**Net operating surplus**: 240,000 Rm; 3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.940890Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:021d8e4c5f212909117a1fe1a8453566ac9094f4a5acc9835ae8ef6dbbd7e2b9","observation_id":"6284a8dd-0a6d-492e-a905-422ba40fa4c3","resolution":{"observed_at":"2026-08-02T19:56:33.940890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.012350Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.012350Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:7b5eda6d21f686b7817d84c6f9c456e1e03143566430ace65dd0e42b76042137","observation_id":"362b74d5-ae8d-46c4-b058-ff5a35b0ea33","resolution":{"observed_at":"2026-08-02T19:56:34.012350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.045268Z","title":"**Sum of numbers in triangles: ** 4 + 11 + 18 = 33; **Sum of numbers in circles: ** 5 + 12 + 16 = 33","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.045268Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:9d202180d9af287e56353b0c7d7f8722fbd0ec33738429c80ce2b48e1a24bf16","observation_id":"8396c4eb-63c1-4346-b453-3922c691afe6","resolution":{"observed_at":"2026-08-02T19:56:34.045268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.111025Z","title":"We can apply this rule to the squares","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.111025Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:f3ef25ec363e1ed4a70d873d83ec46f94b1e9d35efe07872e3f65418cf07a389","observation_id":"6367bd4e-400b-41d6-98a2-0d8c14f1fc27","resolution":{"observed_at":"2026-08-02T19:56:34.111025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.142051Z","title":"Key Observations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.142051Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:ad2e48157e9e1d577483e03c051a2b8dd545dd776d15c2b35cbcb566a1cd6402","observation_id":"1613519c-70a6-40cb-a12f-3594159d77c2","resolution":{"observed_at":"2026-08-02T19:56:34.142051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.206791Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.206791Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:e1ed0b55e3eb1bca41ea16c3c74b55348a36d595c7420d5ded4134e70359ce49","observation_id":"473dd069-4e65-4f6c-ba93-10ee49400532","resolution":{"observed_at":"2026-08-02T19:56:34.206791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.244048Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.244048Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:77922d7972fe2f2a75bb6fdc8a499534d1922aa716f2e4cc0f23716a4085882c","observation_id":"0bb5a77d-dc22-40ed-9233-9c4746f41ebf","resolution":{"observed_at":"2026-08-02T19:56:34.244048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.310999Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.310999Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:ded30064da15aeb893048cf9f50f6e6d0ee22023a2cf4092179f39e2baae7de2","observation_id":"a9e52dd4-6919-48a0-b722-62c693ff2d28","resolution":{"observed_at":"2026-08-02T19:56:34.310999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.371808Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.371808Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:2cd7024a5d061d753bc47218be9e9cd46855771fde0028059688a11647234ca7","observation_id":"281b89df-2018-40eb-a9d5-47ae0071c3b3","resolution":{"observed_at":"2026-08-02T19:56:34.371808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.464640Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.464640Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:9c4ae7b51dba1c532f2c785bb51c2fd5b2a48079e757a16acfb001dfd9fe691e","observation_id":"9f1f8935-3028-4716-b6cd-a0407b82339d","resolution":{"observed_at":"2026-08-02T19:56:34.464640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.535306Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.535306Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:3d3e40cd260d3be25aecf18d5c7982a7858761057110bcaa064d9c376b74a37b","observation_id":"e5b0b1b4-e301-432c-b732-fe556ad5b261","resolution":{"observed_at":"2026-08-02T19:56:34.535306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.568170Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.568170Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:dc56c1d677e56f7d2caeac47bce306a6e10426f7fd31f3d6c75339712944d840","observation_id":"5745fa83-121b-4620-93c9-36b8e4490c53","resolution":{"observed_at":"2026-08-02T19:56:34.568170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.635972Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.635972Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:ccde82e438302af58a0fa6ab2e5b3553ce7e92f83959d90c98eb85320ebe1303","observation_id":"5fd8554f-5120-4673-a33d-06e2b89c8ab2","resolution":{"observed_at":"2026-08-02T19:56:34.635972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.745434Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.745434Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:96a7d918aa6a9d15a8845347c1643ad50f9a0ec0abbca21f762761c4fdb4d4c0","observation_id":"1465f68a-7383-4e3c-819f-26928d009ee8","resolution":{"observed_at":"2026-08-02T19:56:34.745434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.814626Z","title":"Modify the given correct solution text by introducing subtle, hard-to-detect errors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.814626Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:a4b1c8230c8be1affcedd326fcb5cb17c8539b4253961c2794206a76a0dc2b3e","observation_id":"59d4d96f-b5a0-4ba1-bffc-3d8534be58a2","resolution":{"observed_at":"2026-08-02T19:56:34.814626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:34.951668Z","title":"Prioritize factual correctness above all other factors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:34.951668Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:696b772aaf44c099793e3d0a1238fb87847d5aefac5bf87f577617e49b6aa4e2","observation_id":"9d0f57b1-70f9-4258-8890-eae572b8befa","resolution":{"observed_at":"2026-08-02T19:56:34.951668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:35.022760Z","title":"Identify any reasoning fallacies, invalid inferences, or irrelevant logic chains that might affect reliability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:35.022760Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:86afeb43292047c3f6ef702acf7439aae856270c9c726e0cca013d3a9904441e","observation_id":"12fabe4f-29c8-4cc2-b9ec-245d1b9af5bd","resolution":{"observed_at":"2026-08-02T19:56:35.022760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:35.076387Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:35.076387Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:c71e995dcc865296f52fac608d541d1eebfb350f2b9801e6e08651dd2ab649ef","observation_id":"2432c871-2dd6-4796-ac40-3f56498da1ea","resolution":{"observed_at":"2026-08-02T19:56:35.076387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:35.154932Z","title":"The response should neither omit essential reasoning nor over-elaborate with redundant or misleading content","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:35.154932Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:6f7bfc92a46f19ab8545d1175fe10b04fcac140b187a97ca8b4ea52c6bccc77b","observation_id":"06447396-6fab-46ae-8381-46821f8fe1bd","resolution":{"observed_at":"2026-08-02T19:56:35.154932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:35.246936Z","title":"The decision should rely on reasoning quality, not stylistic fluency or writing pref- erence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:35.246936Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:86a0f8d263fa8aebcf82a88ad46532c16cebd490a03f5e0ef29d19a3cdcda499","observation_id":"386b1fba-a7de-4a2a-a35c-1eaf6c815f51","resolution":{"observed_at":"2026-08-02T19:56:35.246936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:56:29.346396Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.346396Z"},"links":{"citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:02ecdd367f1237916dcb1ddb9f200e5c0a01411c1af52a16ee0e9e68d0f7f921","observation_id":"c91a1c5d-cc07-4537-81d6-5419be646f88","resolution":{"observed_at":"2026-08-02T19:56:29.346396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":78,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 1 inbound Pith citation observation for arXiv:2603.00546."}