{"as_of":"2026-08-11T07:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:01a1567c8afb7b242cd864aa3ed24f2ec66c2cf10fdfb5f28d0726a166077e6e","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:43:34.049540Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.13973/citation-record","integrity":"/paper/2505.13973/integrity","json":"/paper/2505.13973/citation-record.json","paper":"/paper/2505.13973"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:26.837843Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:26.837843Z"},"links":{"citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:3898e4c9f6171d63654ac64a6cf2b8f2dbdfb1eeaa30214f881ebff6efb9aab2","observation_id":"c993af9c-0799-4b55-bc75-1b967876b1d8","resolution":{"observed_at":"2026-08-07T15:43:26.837843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:30.116351Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.116351Z"},"links":{"citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:c379f59a7d56bee7931c062dcbd59290f79aa6019e3b3b98d0e33b59f4443fb0","observation_id":"0086c278-2456-4593-9740-5be1e49a590d","resolution":{"observed_at":"2026-08-07T15:43:30.116351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15558","snapshot_observed_at":"2026-08-07T15:43:30.245226Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.245226Z"},"links":{"cited_paper":"/paper/2503.15558","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:f11ba802d4a66abd15e356506f6a706ea14194abb011f2305a34d670315ad2cd","observation_id":"d2625a23-56a5-45cf-900f-5be9c59664b9","resolution":{"observed_at":"2026-08-07T15:43:30.245226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.773788Z","title":null,"venue":null,"work_id":"7806bcdc-6fe5-49f0-ab37-ef00380cdf41","year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.351330Z"},"links":{"citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:df263492acf5e4018baef0290304c40e37ddf387f025cb41414316abf0729356","observation_id":"e585a3a3-fa6d-4b21-9c28-ec369a8b097a","resolution":{"observed_at":"2026-08-07T15:43:35.830709Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:30.454995Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.454995Z"},"links":{"citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:3ba2ce79601ebfe67e62cdff1df8068be1c7dd18a0d254fdb59d0dfe1deeba1f","observation_id":"eca15f64-1a27-4119-821e-080a268450fd","resolution":{"observed_at":"2026-08-07T15:43:30.454995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00855","last_updated":"2024-10-30T14:45:00Z","snapshot_observed_at":"2026-08-07T12:15:46.504578Z","submitted_at":"2024-10-30T14:45:00Z","title":"Vision-Language Models Can Self-Improve Reasoning via Reflection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00855","snapshot_observed_at":"2026-08-07T15:43:30.548612Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.548612Z"},"links":{"cited_paper":"/paper/2411.00855","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:d756fe4f5627739f512af83748cf38d264aff802c19704f1d4a6628006970bfe","observation_id":"39147750-bcef-4a0f-885f-f886e0ed0be5","resolution":{"observed_at":"2026-08-07T15:43:30.548612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:30.665481Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.665481Z"},"links":{"citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:a3591cb09649ed150e3af8b096208400ef7997a39591ad82240cd950480e5895","observation_id":"0353c2e0-0333-4069-944a-6ff0ea14d591","resolution":{"observed_at":"2026-08-07T15:43:30.665481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.479438Z","title":null,"venue":null,"work_id":"07ae3cf4-ff47-4756-8f38-798d08e2d673","year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.752803Z"},"links":{"citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:dfbc7c79b4ac6e6422ad2113690c27b86df672752628318589f159c199cd8680","observation_id":"7c12872c-2522-40a6-970b-18415343905b","resolution":{"observed_at":"2026-08-07T15:43:35.614745Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-07T15:43:30.841430Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.841430Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:4a1c0ffea28f8160629327a3bfbe823d8b6054b0659026b0a43e3b92e3424342","observation_id":"66edf0f7-809f-4720-b248-3123724d02d7","resolution":{"observed_at":"2026-08-07T15:43:30.841430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:43:30.931668Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.931668Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:3ede9e600425fdca7da46dea6bd91f6d46cfc196b602c33077da873e381bccb7","observation_id":"2a0aab34-6632-4de3-b56f-189c9c036697","resolution":{"observed_at":"2026-08-07T15:43:30.931668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:43:31.075196Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.075196Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:80eb63fa03494a213342d5da7eab4c9ee671c4489d712ddbe9035b42d68894e2","observation_id":"4cdb0920-2151-4686-94cf-331907972674","resolution":{"observed_at":"2026-08-07T15:43:31.075196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:31.214749Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.214749Z"},"links":{"citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:ff250758da7fda0c17977a5f7f51ee99a3173f8994d9ffd86b479063bc37618d","observation_id":"ccd43bf7-d09b-4d95-9382-1b4d39545788","resolution":{"observed_at":"2026-08-07T15:43:31.214749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T15:43:31.317058Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.317058Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:85ae60b4a1246323104d528e55920de4d523ec9188be00f6acb4360c4ba370b9","observation_id":"2c09e7ae-55fe-4bb5-bc2d-714a569c4bb0","resolution":{"observed_at":"2026-08-07T15:43:31.317058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T15:43:31.423898Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.423898Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:9dfe24ef736ada5f16a6ea991d940c2a0e9110d8842e934d5c9950723d6886c7","observation_id":"98b9ac47-5b2f-41f1-a935-572a3768597d","resolution":{"observed_at":"2026-08-07T15:43:31.423898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21321","last_updated":"2025-03-24T09:34:38Z","snapshot_observed_at":"2026-08-09T09:18:08.427943Z","submitted_at":"2025-02-28T18:59:54Z","title":"LLM Post-Training: A Deep Dive into Reasoning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21321","snapshot_observed_at":"2026-08-07T15:43:31.517756Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.517756Z"},"links":{"cited_paper":"/paper/2502.21321","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:38132c4829b66ab0a26337056a9514677d5def5b6d70603e0f410e44d2098d65","observation_id":"9a7f238e-3dc0-49c4-a70a-ea85c494cf12","resolution":{"observed_at":"2026-08-07T15:43:31.517756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10373","last_updated":"2024-07-17T09:34:00Z","snapshot_observed_at":"2026-08-02T05:31:09.782791Z","submitted_at":"2024-02-15T23:39:04Z","title":"BioMistral: A Collection of Open-Source Pretrained Large Language Models for Medical Domains","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10373","snapshot_observed_at":"2026-08-07T15:43:31.609026Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.609026Z"},"links":{"cited_paper":"/paper/2402.10373","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:cfe7bb3cec6b4c703e5d68c498c74df44f86edf9dc9979e66b11c965d735a081","observation_id":"d3224970-441f-48be-9339-575cec1021d1","resolution":{"observed_at":"2026-08-07T15:43:31.609026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:31.706196Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.706196Z"},"links":{"citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:aaee1f609c6cebab5daefce390dd654a4ef509c2634c767083b383097dac4259","observation_id":"3db54ed8-b633-4a5d-8721-1bd9472187d9","resolution":{"observed_at":"2026-08-07T15:43:31.706196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.294746Z","title":null,"venue":null,"work_id":"782bef3b-5794-4698-a07e-343ef12624db","year":2024},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.790430Z"},"links":{"citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:de89a959df5e272e196a494bcc6796116ce5f7d9184ef4436f49e8a51ffb2cc6","observation_id":"c59230b9-8a55-4f08-a5e8-635c00080c36","resolution":{"observed_at":"2026-08-07T15:43:35.372647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:31.871537Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.871537Z"},"links":{"citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:931023358e1ae927b3758ee0f96077984406ee890f2768f63e2c263b21574ae5","observation_id":"2bbb2501-e7b7-4296-9881-50c504fd81a5","resolution":{"observed_at":"2026-08-07T15:43:31.871537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T15:43:31.932837Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.932837Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:a0bec7a606fc0ef30d7639d673214418d7a956ae9a743b19e98911be244a8d1b","observation_id":"ff045b84-e5de-4954-a5aa-fab2900f7ee1","resolution":{"observed_at":"2026-08-07T15:43:31.932837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.068318Z","title":null,"venue":null,"work_id":"e756f226-d6d4-494c-a3d5-46e53ca1456b","year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.056482Z"},"links":{"citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:108ab8af3f02fb00eea9eb811343d7166fab88ba0872d8d590705ab21070affa","observation_id":"c37a488c-14a6-4e37-930d-03174f64e814","resolution":{"observed_at":"2026-08-07T15:43:35.154763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21620","last_updated":"2025-05-24T08:46:08Z","snapshot_observed_at":"2026-08-01T20:06:59.931737Z","submitted_at":"2025-03-27T15:39:30Z","title":"UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21620","snapshot_observed_at":"2026-08-07T15:43:32.164373Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.164373Z"},"links":{"cited_paper":"/paper/2503.21620","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:205a33aa1a7cade047c3abc17474cd1ea9f6d87ae8c5686b1dd34065eb5e3ca2","observation_id":"85bc92cc-e12d-40b5-bf4b-85aacc88b35b","resolution":{"observed_at":"2026-08-07T15:43:32.164373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:32.291467Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.291467Z"},"links":{"citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:8212987762e27c92dc9c5a952ec44cd75c7e562be8628938f9f3b52a6607e618","observation_id":"10625c65-f303-48e7-9c90-4ced387d8e12","resolution":{"observed_at":"2026-08-07T15:43:32.291467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:32.391411Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.391411Z"},"links":{"citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:7beefcaf63e18ebd17db4d435e6b1ec362df8b867d724ff4456742b87bc987e3","observation_id":"cc79f665-816d-45ab-98a2-834e7b962796","resolution":{"observed_at":"2026-08-07T15:43:32.391411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T15:43:32.491701Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.491701Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:4065e01c2520e533f90bd9fd521bf824093c96cac876b4321367b94a9cd51ddb","observation_id":"8a1e9c79-23c0-470c-9cb4-92c09170525a","resolution":{"observed_at":"2026-08-07T15:43:32.491701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T15:43:32.625665Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.625665Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:f5ec23a8efb1b4df005e3ea1368c81c45bdb36e30572cad27dc1a666fb960aa3","observation_id":"2d97a5d0-1e19-4bfa-a1dc-496777c6c5cd","resolution":{"observed_at":"2026-08-07T15:43:32.625665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T15:43:32.721672Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.721672Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:b72b8d33ff060d27bb72a8bc64f7d270f50063755d67e18761329623c76debf2","observation_id":"b69e7c64-86ed-48bb-8779-7f4c0fb824f7","resolution":{"observed_at":"2026-08-07T15:43:32.721672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:34.912379Z","title":null,"venue":null,"work_id":"6b20971f-cdab-46db-b776-41661c94f818","year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.849962Z"},"links":{"citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:2847f3f52f8bf0e49d7a888054bedcb317192e3bed54f2c4281fd17c76ac4ca0","observation_id":"e0ffa0d3-726f-4542-871f-6a653604d65a","resolution":{"observed_at":"2026-08-07T15:43:34.968000Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T15:43:33.001856Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.001856Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:cc72f3617196879e507125095d3442ded9e89e3774c789725ab30fb6db4400fc","observation_id":"e21db740-c644-4fd7-bdcd-e6fd90737047","resolution":{"observed_at":"2026-08-07T15:43:33.001856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T15:43:33.082866Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.082866Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:2df4e89c838d731878ef486b45fdfaeba8edf2e526404eba7f003e712530c572","observation_id":"1947b600-f53c-449e-843c-2386d4acd9ef","resolution":{"observed_at":"2026-08-07T15:43:33.082866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:34.741104Z","title":null,"venue":null,"work_id":"be66dce3-be9b-49d0-bde5-dafdb58c1d99","year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.221448Z"},"links":{"citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:fd9fe1a0f21c330b017bbbe81229be2f86205e696605023fa077d0b7fbe65cc9","observation_id":"9a6b834a-b81e-450e-8489-5efb40855b7e","resolution":{"observed_at":"2026-08-07T15:43:34.834256Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10458","last_updated":"2025-10-01T04:55:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:45:54Z","title":"GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10458","snapshot_observed_at":"2026-08-07T15:43:33.341166Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.341166Z"},"links":{"cited_paper":"/paper/2504.10458","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:5c2631fdb158d4bb3e58eedf2981cebe32731cb200caf16ebd16aa091d0dab73","observation_id":"9e3019e2-026c-4072-bb84-e23a7b886cd7","resolution":{"observed_at":"2026-08-07T15:43:33.341166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-08-08T03:30:51.616377Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-07T15:43:33.432167Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.432167Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:282d01da5f59e0b934c38e4bbe3a7f7d8ff19991a297c1610c8526eee959ae28","observation_id":"06a2df12-52da-4aee-95e4-e9c4a025b307","resolution":{"observed_at":"2026-08-07T15:43:33.432167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:33.540806Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.540806Z"},"links":{"citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:3d436b14dce6633c569a486d00a17fb1c510716bb48c5310d29adfbb236a121c","observation_id":"45eb7a77-1544-45be-9be2-8045541f163e","resolution":{"observed_at":"2026-08-07T15:43:33.540806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10415","last_updated":"2024-09-08T01:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:50:16Z","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10415","snapshot_observed_at":"2026-08-07T15:43:33.648501Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.648501Z"},"links":{"cited_paper":"/paper/2305.10415","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:870b448d2fe5c80f43c6db3a0e36ba4f3c62379d339400875c12542cd640473b","observation_id":"66a8f6d7-957d-4702-89d6-8ebcfda7b726","resolution":{"observed_at":"2026-08-07T15:43:33.648501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05379","last_updated":"2025-03-10T07:11:14Z","snapshot_observed_at":"2026-08-07T21:57:26.595540Z","submitted_at":"2025-03-07T12:46:42Z","title":"R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05379","snapshot_observed_at":"2026-08-07T15:43:33.729004Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.729004Z"},"links":{"cited_paper":"/paper/2503.05379","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:3ad4e1cee1ae524f0d29cb05ab60da7422139e7483207c15a67dc5d2f25085fc","observation_id":"e46c66b0-777a-4121-bda9-b6f6f8947210","resolution":{"observed_at":"2026-08-07T15:43:33.729004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:34.512079Z","title":null,"venue":null,"work_id":"d4e4046f-3fdc-4965-9fb4-7a46d793173d","year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.787424Z"},"links":{"citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:d3e925f93f77fc99a45ecf544b0de158a25db081bd23d0727decc0ca2014c337","observation_id":"4591e73e-4ce8-40f9-ae02-e5d880d8d484","resolution":{"observed_at":"2026-08-07T15:43:34.611405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-08-11T02:58:52.773885Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-07T15:43:33.968558Z","title":"aha moment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.968558Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:62b7c3dafe4a9d0596846ab34155f9277a78d7a839791a303e6bd8ba30dfd81a","observation_id":"52a61e03-e4ca-4a96-86a6-fee5261db3a2","resolution":{"observed_at":"2026-08-07T15:43:33.968558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03987","last_updated":"2025-03-06T00:19:54Z","snapshot_observed_at":"2026-08-07T17:26:11.719746Z","submitted_at":"2025-03-06T00:19:54Z","title":"RetinalGPT: A Retinal Clinical Preference Conversational Assistant Powered by Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03987","snapshot_observed_at":"2026-08-07T15:43:34.049540Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:34.049540Z"},"links":{"cited_paper":"/paper/2503.03987","citing_paper":"/paper/2505.13973"},"observation_digest":"sha256:64987ace3bdc071418793ec1f88b973f03ee99324d73cb78bbde9a780c29c558","observation_id":"247b3255-68d8-431b-8ceb-1ecf28d49abd","resolution":{"observed_at":"2026-08-07T15:43:34.049540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.13973","last_updated":"2025-05-20T06:12:20Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T12:36:53.738897Z","submitted_at":"2025-05-20T06:12:20Z","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2505.13973."}