{"as_of":"2026-08-19T19:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c609373168ca2a55bc4ecfef4ae3b9e7e75214f42aec71687cfb7ceedf10de40","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:06:46.943358Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:56:44.033301Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T13:56:45.816309Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"cited_work":{"arxiv_id":"2602.03300","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.03300","snapshot_observed_at":"2026-08-05T13:56:45.816309Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","venue":"cs.LG","work_id":"9fd55f14-4c40-43cf-9b97-26e87d34e057","year":2026},"citing_paper":{"arxiv_id":"2608.03733","last_updated":"2026-08-04T14:28:42Z","snapshot_observed_at":"2026-08-16T12:53:43.499091Z","submitted_at":"2026-08-04T14:28:42Z","title":"Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T13:56:44.033301Z"},"links":{"cited_paper":"/paper/2602.03300","citing_paper":"/paper/2608.03733"},"observation_digest":"sha256:a581540a3a8fcc63c3f459dbad6b689cb5b32927a0271acfcac5cd8d58e4b0b3","observation_id":"c3c1546c-e411-47a9-bb16-a3fd71806f16","resolution":{"observed_at":"2026-08-05T13:56:45.865689Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.03300/citation-record","integrity":"/paper/2602.03300/integrity","json":"/paper/2602.03300/citation-record.json","paper":"/paper/2602.03300"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T05:06:43.811080Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:43.811080Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:7cf5412510d61d11531e9b083fbfd1d4c1538739423486c926d6942a76296710","observation_id":"17697da4-e1db-493a-97b9-7fcc9dfb9c1f","resolution":{"observed_at":"2026-08-03T05:06:43.811080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T05:06:44.059719Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:44.059719Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:6dde50aef41351b063ec3a239da71177f4db0aeff2ad8935b81ebd3b6d4f9936","observation_id":"ec4a6470-c181-4530-a9a6-63935d15c1ff","resolution":{"observed_at":"2026-08-03T05:06:44.059719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07574","last_updated":"2023-02-15T06:26:38Z","snapshot_observed_at":"2026-08-18T05:41:28.555661Z","submitted_at":"2022-10-14T06:54:24Z","title":"Is synthetic data from generative models ready for image recognition?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07574","snapshot_observed_at":"2026-08-03T05:06:44.477234Z","title":"Is synthetic data from generative models ready for image recognition?arXiv preprint arXiv:2210.07574,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:44.477234Z"},"links":{"cited_paper":"/paper/2210.07574","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:c6001b57f3ac51d05fa82ed4eb48b23f9f0b5a4787dc5888d1526530b6e44590","observation_id":"aa159330-4121-4a8a-8e79-959a5537da5b","resolution":{"observed_at":"2026-08-03T05:06:44.477234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:06:44.649028Z","title":"Visual instruction tuning towards general-purpose multimodal large language model: A survey.International Journal of Computer Vision, 133 (11):8151–8189, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:44.649028Z"},"links":{"citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:84ec3da040f49835b65f7091c3a52919c50d8521e9e1edc88061376dc58c33c0","observation_id":"cf72144b-7df0-4ce3-86a4-f40582470776","resolution":{"observed_at":"2026-08-03T05:06:44.649028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.18588","last_updated":"2026-06-17T07:22:49Z","snapshot_observed_at":"2026-08-16T21:06:58.859545Z","submitted_at":"2025-09-23T03:15:53Z","title":"UniECG: Understanding and Generating ECG in One Unified Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.18588","snapshot_observed_at":"2026-08-03T05:06:44.804933Z","title":"Uniecg: Understanding and generating ecg in one unified model.arXiv preprint arXiv:2509.18588,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:44.804933Z"},"links":{"cited_paper":"/paper/2509.18588","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:2246fbc8bcc462e510a19419db1624a175fc0535dbe437ea79ae1b0d0b7bfb6e","observation_id":"68f0a91c-0dee-40ed-a57b-c99ac2814977","resolution":{"observed_at":"2026-08-03T05:06:44.804933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-03T05:06:44.871776Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:44.871776Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:711dd0dfd9f197c516bb693a9c165283dba0eef02ebd993650621c4a55beeb59","observation_id":"965a491d-2088-4e67-8a0e-2669f9c837a1","resolution":{"observed_at":"2026-08-03T05:06:44.871776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:06:44.938057Z","title":"Gem: Empowering mllm for grounded ecg under- standing with time series and images.arXiv preprint arXiv:2503.06073,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:44.938057Z"},"links":{"citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:0886a1a09c2ff4858a308b638a147e687d85099e3687284a74f1b4feabd396c0","observation_id":"7bfd4cd8-0a78-4151-99e0-3beed869f9b6","resolution":{"observed_at":"2026-08-03T05:06:44.938057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:06:44.994330Z","title":"Mmr1: Enhancing multimodal reasoning with variance- aware sampling and open resources.arXiv preprint arXiv:2509.21268,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:44.994330Z"},"links":{"citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:9ad2b2995ef8191905c9dd8358b3ffe4dfa0c23d6c2fe46bd2afe2cc65a05018","observation_id":"e695fbad-ccea-4b01-bdc7-1092f756f5ce","resolution":{"observed_at":"2026-08-03T05:06:44.994330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-03T05:06:45.072240Z","title":"Llava- onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:45.072240Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:beee95f6fc040f058ed9afa1e6506365bb707e88e48529436e234e3ce461b8ed","observation_id":"1f470398-3349-426e-897d-3bc00111618e","resolution":{"observed_at":"2026-08-03T05:06:45.072240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21307","last_updated":"2025-03-27T09:31:35Z","snapshot_observed_at":"2026-08-17T01:56:05.370315Z","submitted_at":"2025-03-27T09:31:35Z","title":"InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21307","snapshot_observed_at":"2026-08-03T05:06:45.171417Z","title":"Internvl-x: Advancing and accelerating internvl series with efficient visual token compression.arXiv preprint arXiv:2503.21307,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:45.171417Z"},"links":{"cited_paper":"/paper/2503.21307","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:ff96635b85fb079d6df3cb5a195d9570d1cea46e343a7d40d6603975c9d2c4ca","observation_id":"65c1534e-1b89-400c-b96a-1bbc0500d2d5","resolution":{"observed_at":"2026-08-03T05:06:45.171417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-03T05:06:45.322935Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:45.322935Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:22bff1939a924802d9041c04da7bb5d634bcc64cf82a16ba6505cd2aa85b5ec7","observation_id":"bc3aeafc-1426-42e2-80d4-9d567d253966","resolution":{"observed_at":"2026-08-03T05:06:45.322935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16352","last_updated":"2024-09-11T08:23:58Z","snapshot_observed_at":"2026-08-18T15:33:32.200970Z","submitted_at":"2024-02-26T07:17:25Z","title":"MathGenie: Generating Synthetic Data with Question Back-translation for Enhancing Mathematical Reasoning of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16352","snapshot_observed_at":"2026-08-03T05:06:45.572114Z","title":"Mathgenie: Generating synthetic data with question back-translation for enhancing mathemati- cal reasoning of llms.arXiv preprint arXiv:2402.16352,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:45.572114Z"},"links":{"cited_paper":"/paper/2402.16352","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:d0f9bd3ab77c18f06f5ec0ce16669d49022b3e064e12f5b10e811781d5a97bba","observation_id":"1f5682fd-b576-4ba5-be75-b908b83c5943","resolution":{"observed_at":"2026-08-03T05:06:45.572114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09583","last_updated":"2025-06-04T08:58:56Z","snapshot_observed_at":"2026-08-02T06:48:43.121988Z","submitted_at":"2023-08-18T14:23:21Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09583","snapshot_observed_at":"2026-08-03T05:06:45.671562Z","title":"Wizard- math: Empowering mathematical reasoning for large lan- guage models via reinforced evol-instruct.arXiv preprint arXiv:2308.09583,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:45.671562Z"},"links":{"cited_paper":"/paper/2308.09583","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:fed7b7450984c43b3fc7ea759887b0d0ccbcd8e10a638689ce011774cd232df8","observation_id":"da051922-2eb1-4dad-ab9b-78e5aad807db","resolution":{"observed_at":"2026-08-03T05:06:45.671562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-03T05:06:45.784740Z","title":"Mm-eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning.arXiv preprint arXiv:2503.07365,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:45.784740Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:849b7f31504e0075520a44ce8fdec1397818f08d2e1198eb8bef3eb777a3a2f6","observation_id":"0426af21-8af8-4ad0-bb22-8647ac544c3f","resolution":{"observed_at":"2026-08-03T05:06:45.784740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-03T05:06:45.899185Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models.arXiv preprint arXiv:2112.10741,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:45.899185Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:ab37f3b500bb76b9de3b52420ee75813d74783713bff25850f9d14bd402558d5","observation_id":"c8725eab-6f66-49ac-bad5-05a659a1356d","resolution":{"observed_at":"2026-08-03T05:06:45.899185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05599","last_updated":"2025-06-09T11:44:18Z","snapshot_observed_at":"2026-08-16T12:43:10.838199Z","submitted_at":"2025-04-08T01:19:20Z","title":"Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05599","snapshot_observed_at":"2026-08-03T05:06:46.007695Z","title":"Skywork r1v: Pioneering multimodal reasoning with chain-of-thought","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:46.007695Z"},"links":{"cited_paper":"/paper/2504.05599","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:b7ef235c3fce9bf07cfb338576374b44754c552c167d950fb9e66d65f8890dd8","observation_id":"80734e38-b2c9-4dda-acf6-17b720a4d969","resolution":{"observed_at":"2026-08-03T05:06:46.007695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:06:46.065196Z","title":"H., Fung, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:46.065196Z"},"links":{"citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:9d6460e996613e0fb6b7317b97f98961d59348a0360ef92056a98af417caedc6","observation_id":"95052162-93d6-465b-b5b6-70b34aee1fc5","resolution":{"observed_at":"2026-08-03T05:06:46.065196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T05:06:46.246364Z","title":"Deepseekmath: Push- ing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:46.246364Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:9e277b91aa6b613313bcbd035198605e1e494d8a5ea0cdcaa762a3ea16d3e090","observation_id":"2b013b36-0928-4115-bc33-ba8f96582e80","resolution":{"observed_at":"2026-08-03T05:06:46.246364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:06:46.270959Z","title":"Mathcanvas: Intrin- sic visual chain-of-thought for multimodal mathematical reasoning.arXiv preprint arXiv:2510.14958,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:46.270959Z"},"links":{"citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:56dc2035048df4f3d063c75ecd56b5f36f41f4ff898ad76feb20fa2f6f122e02","observation_id":"e97d76e5-79c5-4349-a417-00d673fa408c","resolution":{"observed_at":"2026-08-03T05:06:46.270959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-03T05:06:46.370801Z","title":"M., Hauth, A., Millican, K., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:46.370801Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:1bc95a34e0b58275619913e7f0e70b483b6a048060dffac0b339c0980507524e","observation_id":"f1084d84-77ae-41c2-b84b-f66cc494ec91","resolution":{"observed_at":"2026-08-03T05:06:46.370801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17195","last_updated":"2025-06-23T09:32:03Z","snapshot_observed_at":"2026-08-16T12:47:56.247725Z","submitted_at":"2025-03-21T14:43:23Z","title":"TreeSynth: Synthesizing Diverse Data from Scratch via Tree-Guided Subspace Partitioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17195","snapshot_observed_at":"2026-08-03T05:06:46.500989Z","title":"Treesynth: Synthesizing diverse data from scratch via tree-guided subspace partitioning.arXiv preprint arXiv:2503.17195, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:46.500989Z"},"links":{"cited_paper":"/paper/2503.17195","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:21383168d8a3bc2c91ed8833fcb87f3e6a634f450ffe44c36bb2df015c6eaa91","observation_id":"5894514a-0018-455e-9f0b-7cb375f7ce2f","resolution":{"observed_at":"2026-08-03T05:06:46.500989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05901","snapshot_observed_at":"2026-08-03T05:06:46.616733Z","title":"Valley2: Exploring multimodal models with scalable vision-language design","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:46.616733Z"},"links":{"cited_paper":"/paper/2501.05901","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:1e6f135b3bec5cada86428645eaf65b70189b81225b94bfb1f071c1e303e03e7","observation_id":"a8d4a86e-227e-4eb6-b32a-43cb1ac76d0b","resolution":{"observed_at":"2026-08-03T05:06:46.616733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-15T17:00:20.282987Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-03T05:06:46.661605Z","title":"Llava-cot: Let vision language models reason step-by- step, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:46.661605Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:291ddf84f34289bc34e83cc4a00128563a5370e0600256391c36b09d13d7675a","observation_id":"2c126139-4733-4df9-b69f-9a0686b97e27","resolution":{"observed_at":"2026-08-03T05:06:46.661605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-15T09:44:57.157415Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-03T05:06:46.742733Z","title":"R1-onevision: Ad- vancing generalized multimodal reasoning through cross- modal formalization.arXiv preprint arXiv:2503.10615, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:46.742733Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:c4f49fbdf913628abb98184c6e412f70da9ebe411acf4605ba662ffeb17e20fa","observation_id":"ebdaf347-1ef0-4878-9454-1c338d963c0d","resolution":{"observed_at":"2026-08-03T05:06:46.742733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-03T05:06:46.873839Z","title":"Zhan, Y ., Zhu, Y ., Zheng, S., Zhao, H., Yang, F., Tang, M., and Wang, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:46.873839Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:babac7e110eb6d58a37cbc6a6ebbc160193b7d3cd4220cc3c71518cb7c389930","observation_id":"65c49fc8-9273-4a28-b8b2-57b3a991ecdb","resolution":{"observed_at":"2026-08-03T05:06:46.873839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-13T01:30:54.104133Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-03T05:06:46.943358Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization.arXiv preprint arXiv:2503.12937, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:46.943358Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:2bf38838b62b789284d850c7ac12e2b82c632ab16610aea06e7cb6df02dbf466","observation_id":"73306920-f347-499a-a979-9995f2a2946d","resolution":{"observed_at":"2026-08-03T05:06:46.943358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T05:06:44.343829Z","title":"Deepseek-r1: In- centivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:44.343829Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:33967aa1cf1e74fa53ac36436608b5f94a00dfe871633845ed4c113cf437e07b","observation_id":"861ed301-16a0-4dfa-8d71-9e49c904e3d6","resolution":{"observed_at":"2026-08-03T05:06:44.343829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16514","last_updated":"2025-08-22T16:37:40Z","snapshot_observed_at":"2026-08-18T20:35:41.029931Z","submitted_at":"2025-08-22T16:37:40Z","title":"FLAMES: Improving LLM Math Reasoning via a Fine-Grained Analysis of the Data Synthesis Pipeline","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16514","snapshot_observed_at":"2026-08-03T05:06:46.167416Z","title":"Flames: Improving llm math reasoning via a fine-grained anal- ysis of the data synthesis pipeline.arXiv preprint arXiv:2508.16514,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:46.167416Z"},"links":{"cited_paper":"/paper/2508.16514","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:edd5f24357e984e0d7395260fef4f1eeb67d134d395cd96f6283f4571d9e4dda","observation_id":"fccf839b-370a-4c67-a2c1-ce69ca1812d9","resolution":{"observed_at":"2026-08-03T05:06:46.167416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-03T05:06:43.872810Z","title":"Llava- onevision-1.5: Fully open framework for democratized multimodal training.arXiv preprint arXiv:2509.23661,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:43.872810Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:8e7ce42f6f7d05de2226cb9f6f5969c22a83badae29d0f74e522049ca4d37bcf","observation_id":"349738ae-b01c-42f3-91c0-9874107e2033","resolution":{"observed_at":"2026-08-03T05:06:43.872810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-03T05:06:44.231599Z","title":"Gemini 2.5 flash image (nano banana), 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:44.231599Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:72581ed2af1852ef54fe9922ce715068fadc231321c0807c3209a9a98aeca9bf","observation_id":"144a3e77-020a-4d30-8563-7d187666c987","resolution":{"observed_at":"2026-08-03T05:06:44.231599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-03T05:06:43.939865Z","title":"anthropic.com/news/claude-4","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:43.939865Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:8cac8c2d8146268e04ccd992788ddb66536f56531c424f6752504e77af85f9c4","observation_id":"47a1da03-6225-4e4d-a2c4-691835633a38","resolution":{"observed_at":"2026-08-03T05:06:43.939865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2602.03300."}