{"as_of":"2026-08-11T04:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df208b7b4e0789a30fef3c6b741f62b925b3e8d86e32d3337d843a6ada425035","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:29:58.706228Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T15:06:38.215137Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T15:07:03.800004Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.21655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21655","snapshot_observed_at":"2026-07-02T15:07:03.800004Z","title":"Apo: Enhancing reasoning ability of mllms via asymmetric policy optimization.arXiv preprint arXiv:2506.21655","venue":null,"work_id":"48aafd7f-2106-4e4b-b3bc-b660f585fb74","year":2025},"citing_paper":{"arxiv_id":"2509.24251","last_updated":"2025-10-05T04:01:18Z","snapshot_observed_at":"2026-08-10T21:20:13.670725Z","submitted_at":"2025-09-29T03:52:01Z","title":"Latent Visual Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T18:41:30.307521Z"},"links":{"cited_paper":"/paper/2506.21655","citing_paper":"/paper/2509.24251"},"observation_digest":"sha256:f200843d5dcad0c5318e75f1150bfcfafe253a17abe70ba62109203003cae2b6","observation_id":"42811ffa-b70c-4621-bfea-976bd4e8bfe9","resolution":{"observed_at":"2026-05-15T18:41:30.389824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.21655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21655","snapshot_observed_at":"2026-07-02T15:07:03.800004Z","title":"Apo: Enhancing reasoning ability of mllms via asymmetric policy optimization.arXiv preprint arXiv:2506.21655","venue":null,"work_id":"48aafd7f-2106-4e4b-b3bc-b660f585fb74","year":2025},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-02T20:30:57.005045Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2506.21655","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:ddf923426759577e404b0c0b4718815aad9ae7c2b43693d69ba4c95a99bccc64","observation_id":"bc77d68d-c518-4809-9aa7-c3db5c2fec50","resolution":{"observed_at":"2026-07-02T02:06:27.261864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.21655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21655","snapshot_observed_at":"2026-07-02T15:07:03.800004Z","title":"Apo: Enhancing reasoning ability of mllms via asymmetric policy optimization.arXiv preprint arXiv:2506.21655","venue":null,"work_id":"48aafd7f-2106-4e4b-b3bc-b660f585fb74","year":2025},"citing_paper":{"arxiv_id":"2606.29758","last_updated":"2026-07-27T10:44:50Z","snapshot_observed_at":"2026-08-02T09:40:36.275703Z","submitted_at":"2026-06-29T04:04:32Z","title":"PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-30T07:36:39.835616Z"},"links":{"cited_paper":"/paper/2506.21655","citing_paper":"/paper/2606.29758"},"observation_digest":"sha256:db5c24040c23028d77f5cec68b595ac6b4fbb27a488482eab521dca895f160b0","observation_id":"a858a48e-99e8-4637-bbd6-e9b8dc097144","resolution":{"observed_at":"2026-06-30T08:04:29.016519Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.21655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21655","snapshot_observed_at":"2026-07-02T15:07:03.800004Z","title":"Apo: Enhancing reasoning ability of mllms via asymmetric policy optimization.arXiv preprint arXiv:2506.21655","venue":null,"work_id":"48aafd7f-2106-4e4b-b3bc-b660f585fb74","year":2025},"citing_paper":{"arxiv_id":"2607.00461","last_updated":"2026-07-01T05:29:02Z","snapshot_observed_at":"2026-07-07T00:06:09.887791Z","submitted_at":"2026-07-01T05:29:02Z","title":"Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-02T15:06:38.215137Z"},"links":{"cited_paper":"/paper/2506.21655","citing_paper":"/paper/2607.00461"},"observation_digest":"sha256:1cae918ff613b3841cc614d5ec90f2b93b37eb12e49218569aa104ca6123d3b4","observation_id":"16209c2b-dcd3-46ce-befd-a980d05c49f3","resolution":{"observed_at":"2026-07-02T15:07:03.801892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21655/citation-record","integrity":"/paper/2506.21655/integrity","json":"/paper/2506.21655/citation-record.json","paper":"/paper/2506.21655"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.760588Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":"0ef78ca5-1afc-49ed-a974-3f1ddaf19bb8","year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.888597Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:cfd33cda90dff549091d3fcbec30eade47fb8e3444159f9ad305f27afc4518d2","observation_id":"5c96e234-31ec-458c-8f5d-8bb24e67d18e","resolution":{"observed_at":"2026-08-06T22:29:59.781638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.703940Z","title":"An augmented benchmark dataset for geometric question answering through dual parallel text encoding","venue":null,"work_id":"705c5c9b-1f5f-4471-90a0-74349bd0b7a1","year":2022},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.904495Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:ff6384ef67c8c7a49c9663775b90fe8287642366f7d68bc6c66e14b98b22cecc","observation_id":"327722d8-5644-4639-9b27-3bed28a57ba1","resolution":{"observed_at":"2026-08-06T22:29:59.735122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.924914Z","title":"Unigeo: Unifying geometry logical reasoning via reformulating mathematical expression, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.924914Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:bb69293402210d12776a542d564787bfad2cecdea91f76522d49f453be5ed14f","observation_id":"d09779fb-616a-4f88-9d59-238be952b6ae","resolution":{"observed_at":"2026-08-06T22:29:27.924914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T22:29:27.932417Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.932417Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:59c0246508989200cbe31876c63543482e41ddb30495fa2dcf003fff9da65db0","observation_id":"e81456dd-7cec-4c91-9ef0-abfb61a3f24f","resolution":{"observed_at":"2026-08-06T22:29:27.932417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.636976Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling, 2025","venue":null,"work_id":"148134ec-a925-4d2c-92c5-165b9ea7d686","year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.955233Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:af87b616b451a8a0a46593c89d296d575cc2a5a9ff1131c07dba4b007c20cbaa","observation_id":"016fa379-0fcf-4893-ad9f-fe665d6a571c","resolution":{"observed_at":"2026-08-06T22:29:59.652681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T22:29:27.974697Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.974697Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:7e0d3ce96a148547f8c75b772b30b521c6ed4234cd40e12f5af30ef603e03dbb","observation_id":"bbd749a9-6891-4608-86d9-ae3e8ea20915","resolution":{"observed_at":"2026-08-06T22:29:27.974697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-07T23:21:52.042305Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12432","snapshot_observed_at":"2026-08-06T22:29:27.988706Z","title":"Observe-r1: Unlocking reasoning abilities of mllms with dynamic progressive reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.988706Z"},"links":{"cited_paper":"/paper/2505.12432","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:ee0222a27738e5cacac3d3c0afa1bd203be017aee3c1d723f4e21a566ab9cd1b","observation_id":"5fdd68c9-9932-4818-b4ee-3ff99ee3e845","resolution":{"observed_at":"2026-08-06T22:29:27.988706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.581917Z","title":"Polymath: A challenging multi-modal mathematical reasoning benchmark, 2024","venue":null,"work_id":"8e244c7b-ab52-4654-8582-17c38792cb46","year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.994310Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:c3d9fb059b3f837de029e0fc4d619d9fc1e4840a4053f870003e85280e2deaaf","observation_id":"e818cc55-f350-4991-8670-0a8a355a27a5","resolution":{"observed_at":"2026-08-06T22:29:59.614767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-06T22:29:28.009078Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.009078Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:b4a72694ad6755db4585efcdc8ca4b37317197005b9687d2203a142fcac9fcd1","observation_id":"dbc04aea-902b-41ec-8568-3dd0883b44c9","resolution":{"observed_at":"2026-08-06T22:29:28.009078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T22:29:28.028456Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.028456Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:1be7816de7f7ef838c65a9d04918f0f68ee53c614c5bf1eeb8884bf846ea3e29","observation_id":"80de8bee-487e-4ee6-9186-82df041b8cbc","resolution":{"observed_at":"2026-08-06T22:29:28.028456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.522828Z","title":"Figureqa: An annotated figure dataset for visual reasoning, 2018","venue":null,"work_id":"b9c351a3-e424-426e-addc-85510cae149a","year":2018},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.044738Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:13442b6fc29dc0b30082b70f593ecc11d56332601b759a3922c460d3237b7dac","observation_id":"3ec7c38b-6828-4b97-88fc-9fa899b7ad1f","resolution":{"observed_at":"2026-08-06T22:29:59.544330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.463810Z","title":"Scemqa: A scientific college entrance level multimodal question answering benchmark, 2024","venue":null,"work_id":"4f67adde-b2ae-4755-9905-5f51e9265c65","year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.050376Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:01a6582d2242fd80087016dcc8a940740e81ddcfabfb977af80a263c3a754f1a","observation_id":"acf61fb4-74fe-426d-b3ee-ff087bf9ce08","resolution":{"observed_at":"2026-08-06T22:29:59.480854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.407816Z","title":"Clevr-math: A dataset for compositional language, visual and mathematical reasoning, 2022","venue":null,"work_id":"e8532c58-abc3-49e9-ad70-a7879906137c","year":2022},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.060256Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:cdcc40dc0d03c1434da90f07f18a0f6b7036bd73e4cd98bfcc231e2996354231","observation_id":"12dfd25f-c2a2-40f5-a76f-5eb6dfb29b1f","resolution":{"observed_at":"2026-08-06T22:29:59.429329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16081","last_updated":"2025-03-28T11:19:21Z","snapshot_observed_at":"2026-08-07T16:49:22.004428Z","submitted_at":"2025-03-20T12:22:18Z","title":"OThink-MR1: Stimulating multimodal generalized reasoning capabilities via dynamic reinforcement learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16081","snapshot_observed_at":"2026-08-06T22:29:28.079295Z","title":"Othink-mr1: Stimulating multimodal generalized reasoning capabilities via dynamic reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.079295Z"},"links":{"cited_paper":"/paper/2503.16081","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:3499f05d9d16b88d33a541b47bdfb83cb47898df236110630c726eb27999d3db","observation_id":"0f5e4e9e-3093-48d0-a5bb-64c12784dc1d","resolution":{"observed_at":"2026-08-06T22:29:28.079295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T22:29:28.095636Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.095636Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:2780c8c2cb5f2a0ad2a7f10d655bdc0e21cb442ac59ab4a693ddc70bdb2ca5e6","observation_id":"56df06e3-2475-4ddf-ad5e-8574e58b8645","resolution":{"observed_at":"2026-08-06T22:29:28.095636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:28.113236Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.113236Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:99d3da8225b10162c3af5fb71dc2012ba3391f9eed9a8c1b0cef5c232edd8399","observation_id":"206b3455-9ff0-4cf2-bd4a-da9688c92399","resolution":{"observed_at":"2026-08-06T22:29:28.113236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:28.132413Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.132413Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:a1c9db35e57a68de8e67a47010182c410f8bcdf230003eec00207c8ca8a12ae6","observation_id":"f3aac8ad-e753-4ebc-b15c-ffb64e941b4f","resolution":{"observed_at":"2026-08-06T22:29:28.132413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.347950Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning, 2023","venue":null,"work_id":"e170cd7b-ba3d-4ccb-a9a8-c99028899c45","year":2023},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.149495Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:fef60232a29a2d5a037bb678f7c74105fcca9c8aab59f0f8713b0d1678699500","observation_id":"03d23385-d3e8-4bdb-8bf6-8e49c2346561","resolution":{"observed_at":"2026-08-06T22:29:59.361633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-06T22:29:28.158314Z","title":"Mm-eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.158314Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:aa6752a0f4ebd2cb762daaf630364df1e1218f8c80549b46effc3b55a503834a","observation_id":"71e362d7-4cd3-4a1f-a580-8f5c901f3d14","resolution":{"observed_at":"2026-08-06T22:29:28.158314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T22:29:28.186779Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.186779Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:418f792eb10721849e7b88b3ce48af08f86144258a683caf9abf9d7c700093df","observation_id":"f952b1c0-258f-48bb-aeb8-4b3a4d6ae0ca","resolution":{"observed_at":"2026-08-06T22:29:28.186779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:28.211930Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.211930Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:71110dbe02c124a1b2eb8b59dd58ad1c9767cd02f5da39c82f4345196663a513","observation_id":"86fc2708-ff5b-4708-8c98-7bd8c78a9eb8","resolution":{"observed_at":"2026-08-06T22:29:28.211930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:28.226495Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.226495Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:49ecc42478c84b9a4e7b0c633a87ee312a3d226da6f94f311f0972ff1535518a","observation_id":"dc33ca82-101c-41c5-aaa3-3e8c96efbe77","resolution":{"observed_at":"2026-08-06T22:29:28.226495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:28.258630Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.258630Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:1f24bed8d9ee216efb54a861b39e0dc95074a14b02b2d484c41cc8ff996878dc","observation_id":"396e1984-423c-4197-943a-369eb298496f","resolution":{"observed_at":"2026-08-06T22:29:28.258630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05599","last_updated":"2025-06-09T11:44:18Z","snapshot_observed_at":"2026-08-09T12:50:50.767642Z","submitted_at":"2025-04-08T01:19:20Z","title":"Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05599","snapshot_observed_at":"2026-08-06T22:29:28.285695Z","title":"Skywork r1v: pioneering multimodal reasoning with chain-of-thought","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.285695Z"},"links":{"cited_paper":"/paper/2504.05599","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:e7625109b1f61db5cb13af977872c3ec8ea66db4618ee013a4a45f69b9619604","observation_id":"aa884deb-08a2-42ee-8cf7-3c4eb220165b","resolution":{"observed_at":"2026-08-06T22:29:28.285695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-06T22:29:28.314845Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.314845Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:94413c102ddd4c6e195ae95a91f4042d5783ece63cc1e0913182de1989ddb156","observation_id":"d3222508-3b10-4c05-9fcb-1cb1ca70d0b6","resolution":{"observed_at":"2026-08-06T22:29:28.314845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.253813Z","title":"We-math: Does your large multimodal model achieve human-like mathematical reasoning?, 2024","venue":null,"work_id":"4ea11da9-8c3c-4a7a-8d5f-1894232d68ea","year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.332879Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:97201714029bc35365a0854809cf453407bf79a83cc1230878d218baa1487677","observation_id":"9ebabd7b-508f-4a76-a38e-41f1264898a9","resolution":{"observed_at":"2026-08-06T22:29:59.270019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:28.350191Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.350191Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:871fef7a17b18432924cc9e0556d6c8c5f0e0785d2bbdab1622c224d6185846d","observation_id":"39c9e3c3-3bf3-4f1f-a155-c8be6a65e26a","resolution":{"observed_at":"2026-08-06T22:29:28.350191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T22:29:28.369712Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.369712Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:626f2077a821f6c33014e9db580e4cb225afe8d0eef6c4a88d3b025f47bfbfc2","observation_id":"28c8ddea-9165-4496-a0d0-ea487f9a260a","resolution":{"observed_at":"2026-08-06T22:29:28.369712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T22:29:28.391054Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.391054Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:faf40a0217c52d69106b9618847e3b808d34a1ba6067a3b012783e38016300f1","observation_id":"09744d3f-4f29-4648-8b1d-fa749b4b2543","resolution":{"observed_at":"2026-08-06T22:29:28.391054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.191839Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":"8163cfb6-4f77-492e-8c06-e8f4a77c09a4","year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.405993Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:6959f5d02d00ee4ba031abfd8186e56513b7fd63ee169e73ff0105ce6fa18f22","observation_id":"3fb3d1a6-01cd-4bbb-aa48-a8eb1b7bc719","resolution":{"observed_at":"2026-08-06T22:29:59.205422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:28.422267Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.422267Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:1ca02c31cabb4f3f8a0941a27a53a7b3a643e3427c510f1fd62c31d715e5d8da","observation_id":"df3d18f0-709c-4db1-a285-a23af471f3f5","resolution":{"observed_at":"2026-08-06T22:29:28.422267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-06T22:29:28.444374Z","title":"Llava-o1: Let vision language models reason step-by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.444374Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:b493ac513017f22d721433896b4bdeecfbe207e27aba91295b145fbd913a95bd","observation_id":"6696a32d-4608-4ef0-8de1-58e824fae9d1","resolution":{"observed_at":"2026-08-06T22:29:28.444374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-06T22:29:28.463737Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.463737Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:61848dead19415c49a833509dbf5497982bc01f2e2dad154dafda78cd83c400a","observation_id":"fe87a75a-7355-42d1-8540-f8e5d4d0c008","resolution":{"observed_at":"2026-08-06T22:29:28.463737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-11T04:46:35.104351Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-06T22:29:28.485026Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.485026Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:89664067b1280313d1d47d946b34adb6351b212a64d9ddac05a82ab5ee454803","observation_id":"ee98e613-7690-4797-9504-94d2f83e0d75","resolution":{"observed_at":"2026-08-06T22:29:28.485026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T22:29:28.505793Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.505793Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:fdf7eabb6772a70ba233b05598e4e063242cb2825e37816549e827d709855e4d","observation_id":"f7352591-2e0a-4fc6-99aa-2ddd81b2977a","resolution":{"observed_at":"2026-08-06T22:29:28.505793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:28.514846Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.514846Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:889c74804228b1641f48ea14972940e82d914422d0692b1dd208961d6a7bda37","observation_id":"b32addc3-6660-4748-8b35-0f3b99ab08f1","resolution":{"observed_at":"2026-08-06T22:29:28.514846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-06T22:29:58.645747Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.645747Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:560a49a26e019ba4853e7430e60c835ce3b8cfe7bcddde0cfecc2cad27e9f8f8","observation_id":"f559c9d4-cc7e-4725-96c6-91dcc2de487d","resolution":{"observed_at":"2026-08-06T22:29:58.645747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-06T22:29:58.670138Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? arXiv preprint arXiv:2403.14624, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.670138Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:dd4c2265ae6e42fb2a60a9c962be6affe95bf39019cff7f4e8c5eefab01fe127","observation_id":"4f21f1cc-1561-4ae4-b7f2-662c6d7cd173","resolution":{"observed_at":"2026-08-06T22:29:58.670138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-08-11T02:58:52.773885Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-06T22:29:58.699089Z","title":"aha moment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.699089Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:31e7c3fb42fa93a7e6ee031ad809ccb04be5facd9bee324ff3be1eecd2e0cf3e","observation_id":"b9d0598b-3945-4573-bf7d-2516c8da6e38","resolution":{"observed_at":"2026-08-06T22:29:58.699089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.123124Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models, 2025","venue":null,"work_id":"61bdc3f1-0d81-4178-9917-cef43d1faf2d","year":2025},"citing_paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.706228Z"},"links":{"citing_paper":"/paper/2506.21655"},"observation_digest":"sha256:3220d81acbe91e8b491085c10cd469ffc4cc5c4c1ffd633e026bff9ac0b036f8","observation_id":"9cb4bd50-cb27-4851-be18-111a1b7de6e1","resolution":{"observed_at":"2026-08-06T22:29:59.144612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21655","last_updated":"2025-06-26T17:57:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T05:43:43.789106Z","submitted_at":"2025-06-26T17:57:08Z","title":"APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 4 inbound Pith citation observations for arXiv:2506.21655."}