{"as_of":"2026-08-18T06:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97321e3d207fff288f4747c4a50e763d40ed9c08389f03a7e54afdf3493bcf8d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":42,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:54:10.967009Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":13,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-08-16T18:14:04.403890Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:3e02b8214673312317567ce1cc005d3c8273873cac95f0117afb60eafde54dc1","observation_id":"10fc5fcb-2c2c-449c-bf9d-7a35a5b434e0","resolution":{"observed_at":"2026-05-16T04:09:36.158828Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T13:10:19.972353Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2407.07726"},"observation_digest":"sha256:5b0ff6b0e96c3f4f59bde53ddb5571c1d3d0018955dd283d24ca554bae6383e8","observation_id":"5dfdbce2-9602-4248-8841-61d285c8c824","resolution":{"observed_at":"2026-05-11T13:10:21.058584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:3b663056f425a809be67e968df0c33484c8f3046e8686a637cf630f8e943793a","observation_id":"452d07d0-b83c-43a4-a3bf-d1f59e28ffea","resolution":{"observed_at":"2026-05-10T21:07:32.169541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-12T20:12:31.121001Z","title":"Efficient multimodal learning from data-centric perspective,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09933","last_updated":"2024-11-15T04:16:50Z","snapshot_observed_at":"2026-08-16T02:03:20.837751Z","submitted_at":"2024-11-15T04:16:50Z","title":"JRadiEvo: A Japanese Radiology Report Generation Model Enhanced by Evolutionary Optimization of Model Merging","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T20:12:31.121001Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2411.09933"},"observation_digest":"sha256:88cd18be1cb5378035dc39bab7a997f2c049ba6e4a87011e573591ee1c1c7f66","observation_id":"daddf052-2faa-4ec3-83a3-d312df0145b0","resolution":{"observed_at":"2026-08-12T20:12:31.121001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-12T16:19:45.669568Z","title":"Efficient mul- timodal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-15T10:04:00.606398Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.669568Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:a586b202a399400f3fd5c6405563dd792f34f09d175bd3db2ffe73ae9ffb6c7a","observation_id":"711b46af-a74a-47e0-a91f-b5a38aca166c","resolution":{"observed_at":"2026-08-12T16:19:45.669568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-12T15:28:29.462359Z","title":"Efficient multi- modal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14205","last_updated":"2024-11-21T15:13:38Z","snapshot_observed_at":"2026-08-16T23:38:35.730618Z","submitted_at":"2024-11-21T15:13:38Z","title":"Is this Generated Person Existed in Real-world? Fine-grained Detecting and Calibrating Abnormal Human-body","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:28:29.462359Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2411.14205"},"observation_digest":"sha256:949d4f1b04068781f3d609102d757ca3fae939f991a5f3669e4b44de4352ff65","observation_id":"34c35a34-0fa4-4e58-84df-5447a98f54df","resolution":{"observed_at":"2026-08-12T15:28:29.462359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-12T15:17:06.797919Z","title":"Efficient multimodal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-08-17T16:49:55.394145Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:06.797919Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2411.14432"},"observation_digest":"sha256:7bb38d66fe5def04b7a80b78f9af9c6db207050058eee919f650641ae4079dc4","observation_id":"5c86cc74-c1f6-4418-8184-75d4a576fdc4","resolution":{"observed_at":"2026-08-12T15:17:06.797919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-12T05:25:25.509406Z","title":"arXiv preprint arXiv:2402.11530 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00465","last_updated":"2024-12-21T16:18:42Z","snapshot_observed_at":"2026-08-14T14:44:08.360098Z","submitted_at":"2024-11-30T12:59:03Z","title":"AgriBench: A Hierarchical Agriculture Benchmark for Multimodal Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:25.509406Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2412.00465"},"observation_digest":"sha256:9c48a593a2fe8c2c640a80e7dff3f83e65f7d70bcf8327933914e8af1510b9de","observation_id":"98ace428-1e24-4cbc-9f80-160850e8a0ec","resolution":{"observed_at":"2026-08-12T05:25:25.509406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-11T22:01:53.047847Z","title":"Efficient multi- modal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03927","last_updated":"2024-12-05T07:06:17Z","snapshot_observed_at":"2026-08-15T20:31:20.953533Z","submitted_at":"2024-12-05T07:06:17Z","title":"MegaCOIN: Enhancing Medium-Grained Color Perception for Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:01:53.047847Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2412.03927"},"observation_digest":"sha256:dee3151a7731385f30e7bc0105aa5003757afce857f490ef3d930aaf284db6d9","observation_id":"4a2795e1-08c3-4929-849b-af1536e38e24","resolution":{"observed_at":"2026-08-11T22:01:53.047847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-11T21:15:45.276775Z","title":"Efficient multi- modal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-18T05:25:21.059219Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.276775Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:3c8662df34d05fa49ed1b5df82e529a20a41eed8e53ce8b46ca10ed3d70a795f","observation_id":"47b76b57-8d5f-4f02-a2b6-6ebd0eaad57c","resolution":{"observed_at":"2026-08-11T21:15:45.276775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-11T20:23:18.550329Z","title":"Efficient multi- modal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05819","last_updated":"2024-12-08T05:29:39Z","snapshot_observed_at":"2026-08-14T23:05:28.608576Z","submitted_at":"2024-12-08T05:29:39Z","title":"[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:23:18.550329Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2412.05819"},"observation_digest":"sha256:355e15f539968a0bebbccf70e630417716ca10040f10830190e955d4d87d6db5","observation_id":"5ca43d82-4d3f-4ee4-a754-c7936e043c96","resolution":{"observed_at":"2026-08-11T20:23:18.550329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-11T19:54:51.944375Z","title":"Efficient multi- modal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06293","last_updated":"2025-08-14T01:57:38Z","snapshot_observed_at":"2026-08-16T21:31:50.361344Z","submitted_at":"2024-12-09T08:36:10Z","title":"Mastering Collaborative Multi-modal Data Selection: A Focus on Informativeness, Uniqueness, and Representativeness","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:54:51.944375Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2412.06293"},"observation_digest":"sha256:d0e3233b6e8093e8cc0b4c546867a9b0849954c8bebdefc85549cf4a7c167eb0","observation_id":"81c01521-6f92-436a-b4cf-da09f337d506","resolution":{"observed_at":"2026-08-11T19:54:51.944375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-11T16:57:06.024131Z","title":"Efficient multimodal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09612","last_updated":"2025-04-01T21:08:07Z","snapshot_observed_at":"2026-08-18T01:48:53.175172Z","submitted_at":"2024-12-12T18:59:40Z","title":"Olympus: A Universal Task Router for Computer Vision Tasks","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T16:57:06.024131Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2412.09612"},"observation_digest":"sha256:8e4a98f7fb23f8ed8c5e4d66d0f7685685f13a5e1423710b67eb2b079f4d5686","observation_id":"f57083ff-43df-484f-8131-e01d1f431a9f","resolution":{"observed_at":"2026-08-11T16:57:06.024131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-11T13:49:12.542968Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12785","last_updated":"2025-03-21T07:53:51Z","snapshot_observed_at":"2026-08-14T01:19:41.888361Z","submitted_at":"2024-12-17T10:44:47Z","title":"Activating Distributed Visual Region within LLMs for Efficient and Effective Vision-Language Training and Inference","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T13:49:12.542968Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2412.12785"},"observation_digest":"sha256:9431a4f5ca2486a208c8ab7443a19c96477b9f5f9425f371807fb001bacab9ab","observation_id":"d25ff837-5e1c-4d99-b73a-745f915868a2","resolution":{"observed_at":"2026-08-11T13:49:12.542968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-10T19:20:24.129770Z","title":"He, M., Liu, Y ., Wu, B., Yuan, J., Wang, Y ., Huang, T., and Zhao, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10661","last_updated":"2025-01-18T05:43:17Z","snapshot_observed_at":"2026-08-15T08:29:06.112681Z","submitted_at":"2025-01-18T05:43:17Z","title":"Unveiling the Mystery of Weight in Large Foundation Models: Gaussian Distribution Never Fades","version":1},"reference_index":645,"source":"pdf_text","source_observed_at":"2026-08-10T19:20:24.129770Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2501.10661"},"observation_digest":"sha256:ac59c1471e68edc429ddaa3647c74ef7fd5897437e6554b3882567c0768d5ac0","observation_id":"85a81cd4-3ead-40de-8f05-9826301677fe","resolution":{"observed_at":"2026-08-10T19:20:24.129770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-10T14:18:17.531656Z","title":"Efficient multimodal learning from data-centric perspective.arXiv preprint arXiv:2402.11530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15513","last_updated":"2025-06-10T14:30:19Z","snapshot_observed_at":"2026-08-14T19:51:36.696522Z","submitted_at":"2025-01-26T13:10:12Z","title":"TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:17.531656Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2501.15513"},"observation_digest":"sha256:b4b4dc1858cdfa6a2ec99874b3b73c1c101dec6d27892fd3ab6bb4951def5379","observation_id":"94764db4-f09f-4834-9d11-812e5a47907d","resolution":{"observed_at":"2026-08-10T14:18:17.531656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-10T11:53:55.414957Z","title":"Efficient multimodal learning from data-centric perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16629","last_updated":"2025-01-28T02:05:38Z","snapshot_observed_at":"2026-08-17T14:47:34.195032Z","submitted_at":"2025-01-28T02:05:38Z","title":"CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T11:53:55.414957Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2501.16629"},"observation_digest":"sha256:844cad3922d1c08648c7550240e38b450e933b43a3a29f12c520b3062e61bba9","observation_id":"5052c314-ae4e-4cd6-8863-d79a84a42cae","resolution":{"observed_at":"2026-08-10T11:53:55.414957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-16T05:54:10.967009Z","title":"Effi- cient multimodal learning from data-centric perspec- tive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19514","last_updated":"2025-04-28T06:25:04Z","snapshot_observed_at":"2026-08-16T05:48:23.584921Z","submitted_at":"2025-04-28T06:25:04Z","title":"FSBench: A Figure Skating Benchmark for Advancing Artistic Sports Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T05:54:10.967009Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2504.19514"},"observation_digest":"sha256:220a1242791f89e5854b6dd5dfcc23f6dad4768f5d0631fc1e116637ab2a4357","observation_id":"54e2758a-eba0-4e40-b5fd-a0e98bd63d26","resolution":{"observed_at":"2026-08-16T05:54:10.967009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-07T15:21:03.895366Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-17T23:06:05.381506Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:03.895366Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:17dd0717155db002f11dd518c59e665d931d313ea170a298d42134d0df7e6953","observation_id":"2c8162b7-1d8f-42ab-954f-5ad194dd303f","resolution":{"observed_at":"2026-08-07T15:21:03.895366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-07T13:40:20.145924Z","title":"Efficient multimodal learning from data-centric perspective, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:20.145924Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:f993e55783593bf1246d737d0709ee7956bbdf6b72959b9dc356d515e92fd249","observation_id":"68ae5757-6f11-422c-a62d-ccb59f4426d7","resolution":{"observed_at":"2026-08-07T13:40:20.145924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-06T21:19:44.920866Z","title":"Efficient multi- modal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-15T20:28:40.863571Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.920866Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:a18f5266751ee5e456c6f6aea07837b0554152b7b453378f5b01cf2df6d4e17b","observation_id":"97b4e0f1-3f29-4140-b356-8d4085e4f5d3","resolution":{"observed_at":"2026-08-06T21:19:44.920866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-15T18:20:41.164283Z","title":"Efficient multimodal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18300","last_updated":"2025-07-24T11:05:24Z","snapshot_observed_at":"2026-08-17T22:35:22.675252Z","submitted_at":"2025-07-24T11:05:24Z","title":"LMM-Det: Make Large Multimodal Models Excel in Object Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:41.164283Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2507.18300"},"observation_digest":"sha256:b43c5b2be0607e0c231cf5058c26c01ee9fed7c6dbd0da8fdf1f2720d4654c66","observation_id":"344af88c-0b80-4af1-9c1c-219d6367009c","resolution":{"observed_at":"2026-08-15T18:20:41.164283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-06T13:22:45.165347Z","title":"arXiv preprint arXiv:2402.11530 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20749","last_updated":"2025-07-28T11:57:52Z","snapshot_observed_at":"2026-08-16T16:51:34.013065Z","submitted_at":"2025-07-28T11:57:52Z","title":"Investigating Structural Pruning and Recovery Techniques for Compressing Multimodal Large Language Models: An Empirical Study","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:22:45.165347Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2507.20749"},"observation_digest":"sha256:d69f9c7621305503e628d1b13f625b7ac5540fce9b2cf8399b92ded118be44c3","observation_id":"e6e16ed1-ea5d-45d0-a58b-b8b29de3acce","resolution":{"observed_at":"2026-08-06T13:22:45.165347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T14:49:35.876386Z","title":"Efficient multimodal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-17T19:19:33.792848Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.876386Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:32a998defcd8cf6faa54fe643afb49b0fec5895d19db3b869b47dd77dd4460fa","observation_id":"b3ce6c97-49e4-41d6-96eb-d9643dce6b3b","resolution":{"observed_at":"2026-08-05T14:49:35.876386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-03T23:35:18.894715Z","title":"Efficientmultimodal learning from data-centric perspective.arXiv preprint arXiv:2402.11530,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.894715Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:b04985758b1cbaedded8e7645e7c6f82d94e16c044359750dde0e725f25ab0fc","observation_id":"f088ccac-837a-4e8c-bd5f-478b8ee0fe35","resolution":{"observed_at":"2026-08-03T23:35:18.894715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-03T04:20:53.053118Z","title":"Efficient multimodal learning from data-centric perspective.arXiv preprint arXiv:2402.11530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-15T20:10:49.368970Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:53.053118Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:62f453699d602c6b0939da178fec107541373a8057d5843f2e7ecf9773c9de7f","observation_id":"82da0299-3d75-4c2d-ab49-b347be8f59b6","resolution":{"observed_at":"2026-08-03T04:20:53.053118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2602.07026","last_updated":"2026-06-05T02:27:27Z","snapshot_observed_at":"2026-08-10T18:38:03.471104Z","submitted_at":"2026-02-02T13:59:39Z","title":"Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:29.924860Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2602.07026"},"observation_digest":"sha256:65075c19e4f04cdaff5730bca32fe325eaa3ab7c4571580f6c49ba551798f669","observation_id":"453a9f6f-2842-496c-8795-b92fff2e9f58","resolution":{"observed_at":"2026-05-16T08:17:36.117667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-03T05:34:27.393703Z","title":"Efficient multimodal learning from data-centric perspective.arXiv preprint arXiv:2402.11530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07026","last_updated":"2026-06-05T02:27:27Z","snapshot_observed_at":"2026-08-10T18:38:03.471104Z","submitted_at":"2026-02-02T13:59:39Z","title":"Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T05:34:27.393703Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2602.07026"},"observation_digest":"sha256:b8cb87c379610a1a1db28c31e344aee34dac54bb1de2c6b9561305f6fd1fdaa2","observation_id":"53763547-4478-4476-bde3-62e380ba8eca","resolution":{"observed_at":"2026-08-03T05:34:27.393703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-07-13T09:18:06.363249Z","title":"arXiv preprint arXiv:2402.11530 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.05648","last_updated":"2026-06-19T12:00:19Z","snapshot_observed_at":"2026-08-15T05:43:48.635905Z","submitted_at":"2026-04-07T09:53:48Z","title":"Leaderless Collective Motion in Affine Formation Control over the Complex Plane","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-13T09:18:06.363249Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2604.05648"},"observation_digest":"sha256:d3323cd723317b778bb26e8a5f8dbba3bf846afe8d364a2381c680addb9d593b","observation_id":"5f13addc-ae1c-4578-a725-6069109847f4","resolution":{"observed_at":"2026-07-13T09:18:06.363249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2604.05649","last_updated":"2026-04-07T09:54:10Z","snapshot_observed_at":"2026-08-16T08:01:06.700730Z","submitted_at":"2026-04-07T09:54:10Z","title":"Analogical Reasoning as a Doctor: A Foundation Model for Gastrointestinal Endoscopy Diagnosis","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T20:01:47.592716Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2604.05649"},"observation_digest":"sha256:a4bcf4c2c437e5154e1eac87d349d2b9e9fe376b2c0c8da3a7ddbef85e09e8d0","observation_id":"079bb065-94a4-430c-97a7-a60729d7dc27","resolution":{"observed_at":"2026-05-10T22:15:51.452284Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2604.24380","last_updated":"2026-04-27T12:10:44Z","snapshot_observed_at":"2026-08-13T04:56:42.133140Z","submitted_at":"2026-04-27T12:10:44Z","title":"Structural Pruning of Large Vision Language Models: A Comprehensive Study on Pruning Dynamics, Recovery, and Data Efficiency","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T03:47:38.100037Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2604.24380"},"observation_digest":"sha256:80bcccaf11e69ed06cb74adf1260b10e1725102c826f984988e6c3f78d0186ef","observation_id":"e7156161-bfb2-415a-a446-535bd84dbd21","resolution":{"observed_at":"2026-05-11T21:56:14.224287Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2605.07825","last_updated":"2026-05-08T14:53:24Z","snapshot_observed_at":"2026-08-17T03:27:35.092518Z","submitted_at":"2026-05-08T14:53:24Z","title":"Anisotropic Modality Align","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T02:08:04.686087Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2605.07825"},"observation_digest":"sha256:64aa36ddc81a7cb22ad9fc5647d46908365ef41802dd9e3079ff1456b1fa67b2","observation_id":"bb565ed3-7b21-4339-a475-b697be2ce694","resolution":{"observed_at":"2026-05-11T03:55:56.270268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2605.10641","last_updated":"2026-05-11T14:28:44Z","snapshot_observed_at":"2026-08-11T14:36:53.845952Z","submitted_at":"2026-05-11T14:28:44Z","title":"LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T05:10:56.991368Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2605.10641"},"observation_digest":"sha256:024e7d4e4e0ae1814dddf6d511c9850667bf289798ab0031426615e918766827","observation_id":"94ba5713-8354-48f0-8240-1361bc146040","resolution":{"observed_at":"2026-05-12T05:31:25.660081Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2605.21300","last_updated":"2026-05-20T15:29:20Z","snapshot_observed_at":"2026-08-16T10:54:17.782632Z","submitted_at":"2026-05-20T15:29:20Z","title":"Reducing Object Hallucination in LVLMs via Emphasizing Image-negative Tokens","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T05:07:12.965100Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2605.21300"},"observation_digest":"sha256:881d016745713bc938cda0f982a6c24bc5529fd0fec3a4d06de7435aadb3f841","observation_id":"7fa6a991-7251-46d8-b2d6-952b5690e897","resolution":{"observed_at":"2026-05-21T05:09:38.521871Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2605.21300","last_updated":"2026-05-20T15:29:20Z","snapshot_observed_at":"2026-08-16T10:54:17.782632Z","submitted_at":"2026-05-20T15:29:20Z","title":"Reducing Object Hallucination in LVLMs via Emphasizing Image-negative Tokens","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T05:07:12.965100Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2605.21300"},"observation_digest":"sha256:b075bc260195f2be89283823146cc24413e426738e576c68ab35b1b0c0511490","observation_id":"ca881d48-ae33-4ddb-9937-4b00bb06aebe","resolution":{"observed_at":"2026-05-21T05:09:38.228602Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2605.25813","last_updated":"2026-05-25T13:08:20Z","snapshot_observed_at":"2026-08-12T17:22:45.772096Z","submitted_at":"2026-05-25T13:08:20Z","title":"Extending Embodied Question Answering from Perception to Decision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T21:30:40.182958Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2605.25813"},"observation_digest":"sha256:bdf7c53a1ed6afcb192aec2b5cc0929a81bb1d16c721bcf5373d07407b1866c9","observation_id":"252bcedb-73af-4ce7-9495-d38b11e74add","resolution":{"observed_at":"2026-06-29T21:33:59.009876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2606.11853","last_updated":"2026-06-10T09:30:25Z","snapshot_observed_at":"2026-08-02T20:07:37.622537Z","submitted_at":"2026-06-10T09:30:25Z","title":"Task-Aware Structured Memory for Dynamic Multi-modal In-Context Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T10:28:11.440915Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2606.11853"},"observation_digest":"sha256:9b8a976bf8fde08cfd79845060bef6e39ea4b787e3f09cc73bd90eae8127b53d","observation_id":"a4f72ba6-9734-4009-a020-ac34093c6fbe","resolution":{"observed_at":"2026-07-03T09:07:48.414077Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2606.12294","last_updated":"2026-06-10T16:32:30Z","snapshot_observed_at":"2026-08-08T09:11:59.913765Z","submitted_at":"2026-06-10T16:32:30Z","title":"Bridging the Modality Gap in Forensic Image Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T10:06:22.362644Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2606.12294"},"observation_digest":"sha256:d68c5a364d0efe7e405be3117e667724ce6f9dabbdcbdb95c17c08975ce2376c","observation_id":"7d997c3f-dce5-4477-9ff6-d92ba060c17d","resolution":{"observed_at":"2026-07-03T10:17:57.986808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":278,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:b6f824adb96dc06d74ae538a7b80b3b519145f17849bdbda5e0d147d850cf865","observation_id":"7f43068c-9afa-42d8-9621-b03a69f8ea93","resolution":{"observed_at":"2026-07-04T06:39:37.477800Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-01T14:39:52.576159Z","title":"arXiv preprint arXiv:2402.11530 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18709","last_updated":"2026-07-22T05:33:17Z","snapshot_observed_at":"2026-08-16T19:36:52.307904Z","submitted_at":"2026-07-21T05:05:01Z","title":"RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation","version":2},"reference_index":278,"source":"arxiv_source","source_observed_at":"2026-08-01T14:39:52.576159Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2607.18709"},"observation_digest":"sha256:cd2fce95bfbc3d757d6bc1d1cb7f6dd11fb1a14dd3c3d8ed259ee1ee76b24608","observation_id":"6edb94b7-7acc-4fc2-b394-41b60f279ce5","resolution":{"observed_at":"2026-08-01T14:39:52.576159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-01T16:07:55.017604Z","title":"arXiv preprint arXiv:2402.11530 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26432","last_updated":"2026-07-29T03:19:12Z","snapshot_observed_at":"2026-08-14T20:30:09.055650Z","submitted_at":"2026-07-29T03:19:12Z","title":"FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T16:07:55.017604Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2607.26432"},"observation_digest":"sha256:02b64c6f3a715ef7811c775290fdd3c023d6a46e2a665b70380173d29ad4afba","observation_id":"1373dba2-dee2-4b26-8797-591687a27972","resolution":{"observed_at":"2026-08-01T16:07:55.017604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-08T00:55:50.072148Z","title":"Efficient multi- modal learning from data-centric perspective.arXiv preprint arXiv:2402.11530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-17T21:53:40.246892Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.072148Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:a6802e88a703f85c0aee5d0324651d638a9485b8aa7f3ab05cda595c01ca0727","observation_id":"7e115841-d1f7-4f52-aae3-970b7392d232","resolution":{"observed_at":"2026-08-08T00:55:50.072148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.11530/citation-record","integrity":"/paper/2402.11530/integrity","json":"/paper/2402.11530/citation-record.json","paper":"/paper/2402.11530"},"outbound":[],"paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 42 inbound Pith citation observations for arXiv:2402.11530."}