{"as_of":"2026-08-09T20:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b865ae18ca7de5411b97e092f0f2c29de476172ed89801c5d286dc14dd8209af","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:12:30.679583Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.276573Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-08-08T12:12:30.679583Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07617","last_updated":"2026-05-31T18:45:03Z","snapshot_observed_at":"2026-08-08T12:06:14.483667Z","submitted_at":"2025-02-11T15:05:33Z","title":"Scaling Pre-training to One Hundred Billion Data for Vision Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T12:12:30.679583Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2502.07617"},"observation_digest":"sha256:2ee7569b4cd7a3cd5a93359400ecf1f0a40f4c345a79e1a57723b23d021ea32f","observation_id":"221fb2f8-0767-4ecc-b0ff-add9d8e1fe3e","resolution":{"observed_at":"2026-08-08T12:12:30.679583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":"2501.05952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-07-04T15:09:55.276573Z","title":"Scalable vision language model training via high quality data curation","venue":null,"work_id":"454a0bb0-39e7-41e0-9791-e92ea63dfd82","year":2025},"citing_paper":{"arxiv_id":"2503.02597","last_updated":"2026-05-15T01:15:57Z","snapshot_observed_at":"2026-08-03T04:26:47.170682Z","submitted_at":"2025-03-04T13:18:33Z","title":"Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T01:23:01.892612Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2503.02597"},"observation_digest":"sha256:a6e7c248814f806df649d412ee9634854ae0fe8cd8533a35751ab42fa0757446","observation_id":"99891245-cc99-4ab7-9a17-510f3a59453f","resolution":{"observed_at":"2026-05-23T01:25:16.423936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":"2501.05952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-07-04T15:09:55.276573Z","title":"Scalable vision language model training via high quality data curation","venue":null,"work_id":"454a0bb0-39e7-41e0-9791-e92ea63dfd82","year":2025},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:a83873a174fbe02ca02975d6a14f0fd449f8fcb7347583e2f1335cb4fee60b35","observation_id":"b2028d01-687a-41f2-a5b2-7f76926d2d2b","resolution":{"observed_at":"2026-05-22T14:21:39.726967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-08-07T11:59:52.599631Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00893","last_updated":"2025-08-02T10:06:31Z","snapshot_observed_at":"2026-08-07T12:18:52.747304Z","submitted_at":"2025-06-01T08:26:34Z","title":"Affordance Benchmark for MLLMs","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:52.599631Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2506.00893"},"observation_digest":"sha256:c930c562e712b7b02fa5d4a64c085f117016baf02ba8bfb715b80b384d943510","observation_id":"4b18d18c-0f14-454d-8fe6-7f82253a753c","resolution":{"observed_at":"2026-08-07T11:59:52.599631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":"2501.05952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-07-04T15:09:55.276573Z","title":"Scalable vision language model training via high quality data curation","venue":null,"work_id":"454a0bb0-39e7-41e0-9791-e92ea63dfd82","year":2025},"citing_paper":{"arxiv_id":"2506.11991","last_updated":"2026-05-01T04:30:18Z","snapshot_observed_at":"2026-08-02T17:00:42.491243Z","submitted_at":"2025-06-13T17:47:43Z","title":"VGR: Visual Grounded Reasoning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T09:11:00.295700Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2506.11991"},"observation_digest":"sha256:4d3a74c3f5a6a7eedc27f23d7f7efacb2c8a92168057eda87d4c86d844d2e0e4","observation_id":"53938199-ee10-439f-95ff-bb1581701a47","resolution":{"observed_at":"2026-05-19T09:12:14.410055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":"2501.05952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-07-04T15:09:55.276573Z","title":"Scalable vision language model training via high quality data curation","venue":null,"work_id":"454a0bb0-39e7-41e0-9791-e92ea63dfd82","year":2025},"citing_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T15:27:04.228144Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2506.20670"},"observation_digest":"sha256:ad44e6b25d9df71ec17a3effc7872bd9542c473e0eac03f4c2f515b94f42fe3d","observation_id":"e768521e-f731-4390-ba9b-14a09ac76714","resolution":{"observed_at":"2026-05-16T15:27:04.398232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-08-06T22:01:19.113047Z","title":"Scalable vision language model training via high quality data curation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:19.113047Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:7549a57fda16c6688797a8e111d4eb84b670dd7a78734c55ce354cd672ca2728","observation_id":"cda295d1-e7e2-4768-962b-fe867de61575","resolution":{"observed_at":"2026-08-06T22:01:19.113047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-08-06T20:53:02.977919Z","title":"Scalable vision language model training via high quality data curation.arXiv preprint arXiv:2501.05952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-09T03:13:28.261088Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:02.977919Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:68570728cb4aacd062eb891ece4a8eccd1008e10990ddf2bd9af2abc424a1d7c","observation_id":"bd0b9c54-068a-4ccd-8543-fb75e41684bd","resolution":{"observed_at":"2026-08-06T20:53:02.977919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-08-06T16:51:23.196657Z","title":"Scalable vision language model training via high quality data curation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-08T01:34:56.747369Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:23.196657Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:d2f5882268e71785b054ffcb5264fe82456ce7d1e29fd22d89800f561db20408","observation_id":"e726fda4-961a-49f9-9f94-11b812202f0d","resolution":{"observed_at":"2026-08-06T16:51:23.196657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":"2501.05952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-07-04T15:09:55.276573Z","title":"Scalable vision language model training via high quality data curation","venue":null,"work_id":"454a0bb0-39e7-41e0-9791-e92ea63dfd82","year":2025},"citing_paper":{"arxiv_id":"2511.14159","last_updated":"2026-07-17T15:39:00Z","snapshot_observed_at":"2026-08-03T21:43:56.189055Z","submitted_at":"2025-11-18T05:48:08Z","title":"MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T19:51:04.983299Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2511.14159"},"observation_digest":"sha256:072a001cf8e4e3305c4b8dfca38919d158537b3f078081ac181149c227487bad","observation_id":"b047048d-af23-46fa-a388-0d7e3eb87d20","resolution":{"observed_at":"2026-05-21T19:54:20.305212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-08-03T21:43:59.233138Z","title":"Scalable vision language model training via high quality data curation.arXiv preprint arXiv:2501.05952, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.14159","last_updated":"2026-07-17T15:39:00Z","snapshot_observed_at":"2026-08-03T21:43:56.189055Z","submitted_at":"2025-11-18T05:48:08Z","title":"MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T21:43:59.233138Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2511.14159"},"observation_digest":"sha256:4805b2243fcc1a2a3aff7b193b1cd07e16a42eaad3afab2548abd2c74633ac83","observation_id":"ffa74552-aa60-46b4-9ef2-edd80efcf464","resolution":{"observed_at":"2026-08-03T21:43:59.233138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":"2501.05952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-07-04T15:09:55.276573Z","title":"Scalable vision language model training via high quality data curation","venue":null,"work_id":"454a0bb0-39e7-41e0-9791-e92ea63dfd82","year":2025},"citing_paper":{"arxiv_id":"2604.16557","last_updated":"2026-07-30T13:33:20Z","snapshot_observed_at":"2026-08-09T11:29:22.831265Z","submitted_at":"2026-04-17T08:39:07Z","title":"S-GRPO: Unified Post-Training for Large Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T08:18:59.432486Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2604.16557"},"observation_digest":"sha256:6a260285cf27d15cbcd72846bc54ba6a71fa6732b24b694e214d49854e1c9580","observation_id":"d7a1f2b6-c17e-4c71-8291-0ba6d6dbdf98","resolution":{"observed_at":"2026-05-10T08:22:37.500851Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-08-02T16:10:54.128765Z","title":"arXiv preprint arXiv:2501.05952(2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.16557","last_updated":"2026-07-30T13:33:20Z","snapshot_observed_at":"2026-08-09T11:29:22.831265Z","submitted_at":"2026-04-17T08:39:07Z","title":"S-GRPO: Unified Post-Training for Large Vision-Language Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T16:10:54.128765Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2604.16557"},"observation_digest":"sha256:e60e07b643c8018973bfd9d6be7e416a3eae02f0afb88a79ce5e435347c1e064","observation_id":"b7b0dfae-f74c-4dfc-90af-709908f83d66","resolution":{"observed_at":"2026-08-02T16:10:54.128765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":"2501.05952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-07-04T15:09:55.276573Z","title":"Scalable vision language model training via high quality data curation","venue":null,"work_id":"454a0bb0-39e7-41e0-9791-e92ea63dfd82","year":2025},"citing_paper":{"arxiv_id":"2605.03547","last_updated":"2026-05-05T09:18:22Z","snapshot_observed_at":"2026-07-06T23:16:25.301792Z","submitted_at":"2026-05-05T09:18:22Z","title":"Erase Persona, Forget Lore: Benchmarking Multimodal Copyright Unlearning in Large Vision Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-07T17:58:17.879345Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2605.03547"},"observation_digest":"sha256:a4a7ac34d61de5b02cf7aa2f511c4a343828944aa812a9afe1b25fa0d7bb03f9","observation_id":"41f30715-eb9e-4cd9-a640-6df4c649d18f","resolution":{"observed_at":"2026-05-11T23:11:18.015960Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":"2501.05952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-07-04T15:09:55.276573Z","title":"Scalable vision language model training via high quality data curation","venue":null,"work_id":"454a0bb0-39e7-41e0-9791-e92ea63dfd82","year":2025},"citing_paper":{"arxiv_id":"2605.09271","last_updated":"2026-05-10T02:42:29Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T02:42:29Z","title":"Shaping Schema via Language Representation as the Next Frontier for LLM Intelligence Expanding","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-12T05:01:38.118237Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2605.09271"},"observation_digest":"sha256:59ab2575d07d82f848848835701540fce110c9ca06be267560388a1f8014d52d","observation_id":"44e3a5ec-46ba-42eb-af05-5908e7a706a5","resolution":{"observed_at":"2026-05-12T05:41:27.331648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":"2501.05952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-07-04T15:09:55.276573Z","title":"Scalable vision language model training via high quality data curation","venue":null,"work_id":"454a0bb0-39e7-41e0-9791-e92ea63dfd82","year":2025},"citing_paper":{"arxiv_id":"2606.20280","last_updated":"2026-07-04T09:32:50Z","snapshot_observed_at":"2026-07-12T13:16:44.503259Z","submitted_at":"2026-06-18T14:23:23Z","title":"ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T15:34:55.062016Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2606.20280"},"observation_digest":"sha256:d8f393d27a055f1854dd766cd4129a36385a60ac8e4d2018754976a7e904382f","observation_id":"daf12f4d-9e6c-4abf-8a53-bfab3084d48e","resolution":{"observed_at":"2026-07-04T05:49:36.502408Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":"2501.05952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-07-04T15:09:55.276573Z","title":"Scalable vision language model training via high quality data curation","venue":null,"work_id":"454a0bb0-39e7-41e0-9791-e92ea63dfd82","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":231,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:eeef7fa8b8b008726e97619f8bb023764db85c75a956a70d156454d9f8f2af04","observation_id":"6cf7d13e-e151-4f27-9c49-c120b048f620","resolution":{"observed_at":"2026-07-04T15:09:55.278258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.05952/citation-record","integrity":"/paper/2501.05952/integrity","json":"/paper/2501.05952/citation-record.json","paper":"/paper/2501.05952"},"outbound":[],"paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2501.05952."}