{"as_of":"2026-08-10T16:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f5b67d72a32eccacae74839729003e211a1d4ca2052fb4bbd64c113bfad5c08","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T05:07:40.106099Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08572/citation-record","integrity":"/paper/2607.08572/integrity","json":"/paper/2607.08572/citation-record.json","paper":"/paper/2607.08572"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:99d7fef9c297f99b9685a557ce595d9d5755864597eac8809ce9c7830c1cd416","observation_id":"75206606-2d14-4ee8-9766-409d162a943f","resolution":{"observed_at":"2026-07-10T05:16:48.114202Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.08457","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T05:16:48.115469Z","title":"Ares: Multimodal adaptive reasoning via difficulty-aware token-level entropy shaping","venue":null,"work_id":"86e3cc2e-b03c-4c04-98cb-55c976629bbc","year":2025},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:894f716a52906c4890a2201185e077861884ba48c0e4430954b19ab6793c935a","observation_id":"f47b38ad-c95f-4e43-9eb5-56ae2e3c5701","resolution":{"observed_at":"2026-07-10T05:16:48.117346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":"2503.21776","doi":"10.48550/arxiv.2503.21776","metadata_source":"pith","pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","venue":"cs.CV","work_id":"0ce88332-564c-4361-8e2a-3850eb1ace9c","year":2025},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:961be473add660e12335b164e8168411377f90328c3fc83816acb02e380d59d9","observation_id":"cb889607-63a3-4f79-8594-f425090b6a7c","resolution":{"observed_at":"2026-07-10T05:16:48.127937Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T08:50:13.017456+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T08:50:13.017456+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:ae43a9c3ace452fd175f8503955587eb93bbf461d3bac4a00070187adf46c208","observation_id":"73c4187c-fa4e-477a-9202-0e1a3dd727f4","resolution":{"observed_at":"2026-07-10T05:16:48.103262Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-07-30T08:40:23.849282Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2504.01296","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-07-10T05:16:48.068473Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"9eb97578-ef7d-45eb-b973-842ff7f61c2b","year":2025},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:0bfff9d3858c010f82c461154a4595c10afbe93d27b8ca5b6c9c45f7a803e534","observation_id":"0596a9b0-fd0d-41ec-9eaa-bc89c8382b7e","resolution":{"observed_at":"2026-07-10T05:16:48.069730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23905","last_updated":"2025-06-27T14:37:02Z","snapshot_observed_at":"2026-08-07T16:25:36.572641Z","submitted_at":"2025-03-31T09:54:55Z","title":"Boosting MLLM Reasoning with Text-Debiased Hint-GRPO","version":2},"cited_work":{"arxiv_id":"2503.23905","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.23905","snapshot_observed_at":"2026-07-10T05:16:48.098751Z","title":"Pei Ke, Bosi Wen, Andrew Feng, Xiao Liu, Xuanyu Lei, Jiale Cheng, Shengyuan Wang, Aohan Zeng, Yuxiao Dong, Hongning Wang, and 1 others","venue":"cs.CV","work_id":"df4a012f-d754-4456-9abb-47743d3a28a0","year":2025},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2503.23905","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:9fc6083bd31df856d94c49b4162211b802b6771116d8a130898367647ad47b7c","observation_id":"acad75f2-78db-4485-91aa-9a6d2cca548a","resolution":{"observed_at":"2026-07-10T05:16:48.100099Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:22196e947338a0061e8418e4b05c187feddb4edfff9a9bf1d6853fa980063f30","observation_id":"6182bec2-599a-4f4a-aaa2-ab55463b8b88","resolution":{"observed_at":"2026-07-10T05:16:48.133413Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"cited_work":{"arxiv_id":"2509.16679","doi":"10.48550/arxiv.2509.16679","metadata_source":"pith","pith_arxiv_id":"2509.16679","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning meets large language models: A survey of advancements and applications across the LLM lifecycle","venue":"cs.CL","work_id":"f4d2b80d-8fa3-41ad-a490-eab600e35f2f","year":2025},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2509.16679","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:41acd38fe787773eee70e44ecb9eed59b47242fd731aba51c1f40d5923a77840","observation_id":"3a2061e6-be90-4961-b661-0e466d79821e","resolution":{"observed_at":"2026-07-10T05:16:48.097060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.01785","doi":"10.48550/arxiv.2503.01785","metadata_source":"pith","pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-07-11T03:17:51.789600Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"872f09b5-998d-4a66-9a2f-f7ec2407cd62","year":2025},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:a057d9d4510def3f494adef64dba440228ec8828b5eafd7c9859775a40bcde26","observation_id":"445bfd8a-f823-46ed-a448-fdd75fb93c32","resolution":{"observed_at":"2026-07-10T05:16:48.105897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13214","last_updated":"2022-07-25T04:05:29Z","snapshot_observed_at":"2026-08-02T20:16:21.986025Z","submitted_at":"2021-10-25T18:52:26Z","title":"IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning","version":4},"cited_work":{"arxiv_id":"2110.13214","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.13214","snapshot_observed_at":"2026-07-10T11:37:03.154319Z","title":"Iconqa: A new benchmark for abstract diagram understanding and visual language reasoning","venue":"cs.CV","work_id":"e5046a8f-5c72-46fd-baba-98ea6bce6d5a","year":2021},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2110.13214","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:5dbf8e99210d91274885b59ae72fbd750a299cfc778b8ce905d5c75b22eda1ae","observation_id":"60df4eee-bb17-4688-a3ee-162763452667","resolution":{"observed_at":"2026-07-10T05:16:48.108859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.12529","last_updated":"2026-05-14T02:32:10Z","snapshot_observed_at":"2026-08-07T19:28:33.818488Z","submitted_at":"2026-03-13T00:07:18Z","title":"TERMINATOR: Learning Optimal Exit Points for Early Stopping in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":"2603.12529","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.12529","snapshot_observed_at":"2026-07-10T05:16:48.110146Z","title":"TERMINATOR: Learning Optimal Exit Points for Early Stopping in Chain-of-Thought Reasoning","venue":"cs.LG","work_id":"c10d03b1-431d-46dd-a83c-b4c237cde061","year":2026},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2603.12529","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:f6de4f0becc1360a1a0f1811c8964ed36fd121e160fc3ecdadb8d500c84303cb","observation_id":"23937e72-3d26-4014-8c13-480738d92280","resolution":{"observed_at":"2026-07-10T05:16:48.111617Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.12982","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T05:16:48.118724Z","title":"Safegrpo: Self-rewarded multimodal safety alignment via rule-governed policy optimization.arXiv preprint arXiv:2511.12982,","venue":null,"work_id":"be6c56ed-e89a-4cc6-bf91-28cf7fc8aba1","year":2025},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:0ffd8bfc4bc454b4b23b1711f2fac2a8bf71ee9a1ebc50f37b281691143ee798","observation_id":"32d2dd63-4520-40eb-93b5-0f6064373c65","resolution":{"observed_at":"2026-07-10T05:16:48.120378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:9076003349dcb74c020c0333f09d43adc98a368e1997be8e4de2ad7f11ea4b8b","observation_id":"6f8f9413-c154-4aec-8677-78b768dce8ad","resolution":{"observed_at":"2026-07-10T05:16:48.125440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:e70286fb3ae65d9bdf4810c61780bdfbbdd1bf09f9b1ab98cd9fae78cf00f639","observation_id":"85f4df1b-6102-4138-b5ce-8e10c571ab83","resolution":{"observed_at":"2026-07-10T05:16:48.136244Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:2e2183421cf0204ecceea16fca89f0bdf2fd724515378f50e678e63a126ae5b9","observation_id":"caec8aa2-2cc6-4a14-8bfc-28456e20a3fa","resolution":{"observed_at":"2026-07-10T05:16:48.130529Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.31062","last_updated":"2026-05-29T09:34:45Z","snapshot_observed_at":"2026-08-07T18:28:29.022048Z","submitted_at":"2026-05-29T09:34:45Z","title":"AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":"2605.31062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.31062","snapshot_observed_at":"2026-07-10T05:16:48.090191Z","title":"AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question Answering","venue":"cs.CL","work_id":"d4f6d4a9-8bac-4841-849d-46e8a1e84b04","year":2026},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2605.31062","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:20d18e1fbd72af3bdb2edc7fdddcd04e15666614d915c5a72c316d8b432cde24","observation_id":"cbdb5770-6e00-4341-98d8-226e05c37194","resolution":{"observed_at":"2026-07-10T05:16:48.091457Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07266","last_updated":"2025-05-27T02:56:52Z","snapshot_observed_at":"2026-08-08T13:14:58.702776Z","submitted_at":"2025-02-11T05:28:59Z","title":"When More is Less: Understanding Chain-of-Thought Length in LLMs","version":3},"cited_work":{"arxiv_id":"2502.07266","doi":"10.48550/arxiv.2502.07266","metadata_source":"pith","pith_arxiv_id":"2502.07266","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When more is less: Understanding chain-of-thought length in llms","venue":"cs.AI","work_id":"450a518d-6378-4944-9651-8e3ef8049ddf","year":2025},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2502.07266","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:6c3bb1d281f1dcb5f550db22ec11a50b578d2f794ee8d0fa962eacc218b1e2a9","observation_id":"5e486c2b-ec80-4531-a2e7-5dde2d114f28","resolution":{"observed_at":"2026-07-10T05:16:48.094170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.15895","doi":"10.48550/arxiv.2504.15895","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dynamic early exit in reasoning models.arXiv preprint arXiv:2504.15895, 2025a","venue":"ArXiv.org","work_id":"99c0642f-2c3c-4bfd-aa41-08cd3fb032e8","year":2025},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:1463478eadbbcd12a83132d6179dae811b872ab92ac085c8b6323c9c90c90e29","observation_id":"ede9c4e3-60de-4973-8663-4d65770c8b26","resolution":{"observed_at":"2026-07-10T05:16:48.085721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21113","last_updated":"2025-09-02T13:37:38Z","snapshot_observed_at":"2026-08-05T14:42:19.666014Z","submitted_at":"2025-08-28T17:48:19Z","title":"R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning","version":2},"cited_work":{"arxiv_id":"2508.21113","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.21113","snapshot_observed_at":"2026-07-10T05:16:48.087414Z","title":"R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning","venue":"cs.CV","work_id":"c005ac35-7caf-4333-b46e-917e63674f11","year":2025},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2508.21113","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:61818b11571be99b2eb6964898e3f0f92b16564eb6f3d8aab45217eb1bf44a9e","observation_id":"172c5265-982d-45bd-88fc-ec64add2b199","resolution":{"observed_at":"2026-07-10T05:16:48.088969Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16673","last_updated":"2025-05-22T13:39:32Z","snapshot_observed_at":"2026-08-07T14:55:04.641472Z","submitted_at":"2025-05-22T13:39:32Z","title":"R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO","version":1},"cited_work":{"arxiv_id":"2505.16673","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16673","snapshot_observed_at":"2026-07-10T05:16:48.065853Z","title":"arXiv preprint arXiv:2505.16673 , year=","venue":"cs.CV","work_id":"6423e550-f288-473f-962a-a320a509f0ea","year":2025},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2505.16673","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:fa589f3e2a15e5eeeed7277c5d1e1cf3903c9aeb663b681564286a3f686bce7e","observation_id":"86302e5a-d931-4bed-a8b0-c36aaa99e3f9","resolution":{"observed_at":"2026-07-10T05:16:48.067239Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14881","last_updated":"2025-02-14T08:42:43Z","snapshot_observed_at":"2026-08-07T22:02:21.919237Z","submitted_at":"2025-02-14T08:42:43Z","title":"A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations","version":1},"cited_work":{"arxiv_id":"2502.14881","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.14881","snapshot_observed_at":"2026-07-10T05:16:48.121722Z","title":"A survey of safety on large vision- language models: Attacks, defenses and evaluations","venue":"cs.CR","work_id":"926b36b9-f3d1-4fc7-ab4c-75a8ce58e4b7","year":2025},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2502.14881","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:6aa36b139e46b3a4a5f1025694dab13e2c75b5f2108d0277654e1931bf2c9976","observation_id":"03dc2a73-379d-46d3-b1bd-3180698589b6","resolution":{"observed_at":"2026-07-10T05:16:48.123078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":"2503.12937","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-07-10T05:16:48.080500Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","venue":"cs.AI","work_id":"e1614961-16d2-43bc-908a-8c57da5b151c","year":2025},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:afdae4dd779513756501bc4b7dfdfcaffb019853da95f84beb1d7b369577909c","observation_id":"1a8593ca-a459-4bfa-bb0a-a2a8f5dcbca8","resolution":{"observed_at":"2026-07-10T05:16:48.081912Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21277","last_updated":"2025-05-21T06:08:31Z","snapshot_observed_at":"2026-08-07T15:57:57.813561Z","submitted_at":"2025-04-30T03:14:28Z","title":"Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.21277","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.21277","snapshot_observed_at":"2026-07-10T05:16:48.077497Z","title":"Reinforced mllm: A survey on rl-based reasoning in multimodal large language models","venue":"cs.AI","work_id":"c6722ab6-bd76-46d6-83fa-e74d2417a5db","year":2025},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2504.21277","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:98285be180bbc67d747d94c5f6f58512a34a12257dfcba93845728e925bc3592","observation_id":"e61c7e6f-ad04-4b8a-a5a2-404dba7ec733","resolution":{"observed_at":"2026-07-10T05:16:48.079134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15507","last_updated":"2025-08-21T12:32:19Z","snapshot_observed_at":"2026-08-07T19:18:24.596510Z","submitted_at":"2025-08-21T12:32:19Z","title":"Think in Blocks: Adaptive Reasoning from Direct Response to Deep Reasoning","version":1},"cited_work":{"arxiv_id":"2508.15507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15507","snapshot_observed_at":"2026-07-10T05:16:48.074824Z","title":"Think in Blocks: Adaptive Reasoning from Direct Response to Deep Reasoning","venue":"cs.AI","work_id":"bedd325a-e40b-4bdc-9ace-0386243700a8","year":2025},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2508.15507","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:e93133c57384d02f5586c4b7d240f35d76813252f0fde7e2221bbef267b11196","observation_id":"dc21e25c-2802-4e4a-977c-f18ea9d45bc3","resolution":{"observed_at":"2026-07-10T05:16:48.076132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T05:16:48.393872Z","title":"Mathe- matics includes Geometry3k and MathVista; Chart/Doc comprises ChartQA and DocVQA; Ground- ing consists of RefAdv; and the remaining benchmarks are grouped under General","venue":null,"work_id":"e5590dfd-47d7-4f8a-9193-dbc261156176","year":2024},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:d3a197ffabf28f81517632a27cdb1aa62de1919e84c32f6b9913bd54b70b7534","observation_id":"e9edec57-32d4-4589-99aa-0d0537938e3c","resolution":{"observed_at":"2026-07-10T05:16:48.395291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T19:17:35.525533Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":20,"verified_fuzzy":1},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2607.08572."}