{"as_of":"2026-08-09T18:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b82bda1b04a227c28fde8183a56618e520be1905e3d4b4d6a0f657a11913a1d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T00:12:36.489685Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-09T00:12:36.489685Z","title":"Eva-clip-18b: Scaling clip to 18 billion parameters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03950","last_updated":"2025-05-18T22:20:47Z","snapshot_observed_at":"2026-08-09T00:05:17.355061Z","submitted_at":"2025-02-06T10:40:42Z","title":"LR0.FM: Low-Res Benchmark and Improving Robustness for Zero-Shot Classification in Foundation Models","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-09T00:12:36.489685Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2502.03950"},"observation_digest":"sha256:15a896a7bbbf4006998268509e98597c6e4d2f07a002ed2c389919c534f594c2","observation_id":"95ad16bf-1e74-47a6-9bd8-d43c48855210","resolution":{"observed_at":"2026-08-09T00:12:36.489685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-08T14:57:12.636325Z","title":"Eva- clip-18b: Scaling clip to 18 billion parameters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06631","last_updated":"2025-07-22T14:31:49Z","snapshot_observed_at":"2026-08-08T14:49:15.966222Z","submitted_at":"2025-02-10T16:27:20Z","title":"Conformal Predictions for Human Action Recognition with Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T14:57:12.636325Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2502.06631"},"observation_digest":"sha256:b78631256115063b7921fcdd2a85196b4ce0bd8d52d2615ea5c7d7cd87996668","observation_id":"6bf53bbe-ea34-459b-95a4-8b2c145abedf","resolution":{"observed_at":"2026-08-08T14:57:12.636325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-08T14:25:55.850157Z","title":"EV A- CLIP-18B: scaling CLIP to 18 billion parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.850157Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:3f4b9af57408c8a8fbc17b720cfa2f433b903656b7df0e5c3c227851eaf774b7","observation_id":"20477537-a323-4c31-956e-b3057dc27188","resolution":{"observed_at":"2026-08-08T14:25:55.850157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2504.13181","last_updated":"2025-04-28T18:01:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T17:59:57Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","version":2},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-05-13T22:21:15.681336Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2504.13181"},"observation_digest":"sha256:76e06fd2f17abb74e91009ed0b5c9c8901b97b4841cfe5e1d0a1c287078876d9","observation_id":"761d635e-cc0e-4563-abd0-2d153a7b3767","resolution":{"observed_at":"2026-05-13T22:21:15.804400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-07T13:21:41.212978Z","title":"Eva-clip-18b: Scaling clip to 18 billion parameters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23828","last_updated":"2025-05-28T07:44:10Z","snapshot_observed_at":"2026-08-09T10:35:51.717096Z","submitted_at":"2025-05-28T07:44:10Z","title":"Spa-VLM: Stealthy Poisoning Attacks on RAG-based VLM","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:41.212978Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2505.23828"},"observation_digest":"sha256:2982fb67f7d577456e33b4f10989f35ba8eb5d0e90d68d10ddca283678994ba0","observation_id":"33163676-9942-43da-96e7-7883f6a5b377","resolution":{"observed_at":"2026-08-07T13:21:41.212978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-07T12:42:26.469919Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24073","last_updated":"2025-08-26T16:42:37Z","snapshot_observed_at":"2026-08-07T21:48:31.035838Z","submitted_at":"2025-05-29T23:32:03Z","title":"mRAG: Elucidating the Design Space of Multi-modal Retrieval-Augmented Generation","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:42:26.469919Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2505.24073"},"observation_digest":"sha256:273baffd7fa62d772508bf018d167a5edc81a65ff47c9842aedfc4947246cb7d","observation_id":"6141965c-c4e6-409f-9782-80e21e49fed8","resolution":{"observed_at":"2026-08-07T12:42:26.469919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-07T13:18:47.669708Z","title":"EV A-CLIP-18B: scaling CLIP to 18 billion parameters.CoRR, abs/2402.04252, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-07T13:09:47.854060Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:47.669708Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:4062585af9b6418ef755bfb7860b0374e71ac038083ebce67f1ede4e10dccbdc","observation_id":"4ac52ac6-a3b7-487b-a43c-42578b84fa9e","resolution":{"observed_at":"2026-08-07T13:18:47.669708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-06T23:20:52.199619Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01042","last_updated":"2026-07-13T08:14:05Z","snapshot_observed_at":"2026-08-06T23:24:25.104389Z","submitted_at":"2025-06-23T09:58:35Z","title":"Can Argus Judge Them All? Comparing VLMs Across Domains","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:52.199619Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2507.01042"},"observation_digest":"sha256:222dc7d7a30c9e6de2b8fad9b920998aeb9a534e0517a1957e0e9f4406e57ed7","observation_id":"b287334b-6846-47e4-9a02-02e8a143c3d6","resolution":{"observed_at":"2026-08-06T23:20:52.199619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-06T21:06:26.749785Z","title":"Eva-clip-18b: Scaling clip to 18 billion parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-09T02:09:40.214145Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.749785Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:1cde67b12352ec08fdcd3b1a777d5cc9a35a1cc7862f43aa1ca50ba07802e6e4","observation_id":"4d1c2b4e-a74b-4f70-8c1c-f0b2b2932a61","resolution":{"observed_at":"2026-08-06T21:06:26.749785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-06T17:55:45.406624Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09693","last_updated":"2025-07-13T16:09:58Z","snapshot_observed_at":"2026-08-09T02:39:23.430677Z","submitted_at":"2025-07-13T16:09:58Z","title":"ExpStar: Towards Automatic Commentary Generation for Multi-discipline Scientific Experiments","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:55:45.406624Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2507.09693"},"observation_digest":"sha256:79bac9726ff3cd99ed1f371fa3a235fdf38f2dd3280e3c787d12c7655bef9930","observation_id":"1e092c2f-2333-4d1d-849b-1b18121ed4e0","resolution":{"observed_at":"2026-08-06T17:55:45.406624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T13:59:44.047838Z","title":"EV A-CLIP-18B: scaling CLIP to 18 billion parameters.arXiv preprint arXiv:2402.04252, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00177","last_updated":"2025-08-29T18:24:38Z","snapshot_observed_at":"2026-08-05T13:59:37.413174Z","submitted_at":"2025-08-29T18:24:38Z","title":"Category-level Text-to-Image Retrieval Improved: Bridging the Domain Gap with Diffusion Models and Vision Encoders","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T13:59:44.047838Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2509.00177"},"observation_digest":"sha256:867425b6540b2c89ae03417080cb3a0fc9be8f836f1cceec0a643cb6d9977db9","observation_id":"5006196a-e851-43d4-b838-bb79c4440a6c","resolution":{"observed_at":"2026-08-05T13:59:44.047838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2509.24943","last_updated":"2026-05-06T06:07:38Z","snapshot_observed_at":"2026-07-06T22:31:05.409865Z","submitted_at":"2025-09-29T15:42:55Z","title":"Perceive, Verify and Understand Long Video: Multi-Granular Perception and Active Verification via Interactive Agents","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-18T12:40:19.544260Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2509.24943"},"observation_digest":"sha256:d29ed5c3c0be2f0049e5bdcda14a08464b95f367f091841a15c6d5160a9ee721","observation_id":"a5a8c8bd-7223-4a3f-a987-fd10e00d65c9","resolution":{"observed_at":"2026-05-18T12:41:22.579211Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2601.13856","last_updated":"2026-04-07T08:27:33Z","snapshot_observed_at":"2026-08-02T10:24:44.268835Z","submitted_at":"2026-01-20T11:08:33Z","title":"QKVQA: Question-Focused Filtering for Knowledge-based VQA","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T12:53:59.668663Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2601.13856"},"observation_digest":"sha256:b2cbcc020bd96f15a09f46ef14630dfcdb16219a3eed27c91ceb5fdd5be350e0","observation_id":"c74decde-c081-47ff-baf8-5c04afc10656","resolution":{"observed_at":"2026-05-16T12:57:54.033143Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-03T04:20:57.341823Z","title":"Eva-clip-18b: Scaling clip to 18 billion parameters.arXiv:2402.04252, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-08T17:38:17.395786Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.341823Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:cd255ac606239087cf62ea3aeecd7d6e8ce1277f9f16fc0f0626273905d6832e","observation_id":"24b1a7b5-fabe-48c9-99c0-5ccc3d4e1fe9","resolution":{"observed_at":"2026-08-03T04:20:57.341823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2603.11689","last_updated":"2026-07-01T08:11:59Z","snapshot_observed_at":"2026-07-14T22:43:17.174240Z","submitted_at":"2026-03-12T08:56:14Z","title":"Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T11:09:51.816554Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2603.11689"},"observation_digest":"sha256:b7c5891d469a2cd6b8d76016d0b79420bf6fb196d6bc1b7d74502fc7db15104a","observation_id":"210dbf3f-69e6-41c3-ba71-1ed8a84f9b3b","resolution":{"observed_at":"2026-05-21T11:10:02.006151Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-07-14T22:43:59.727378Z","title":"arXiv preprint arXiv:2402.04252 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.11689","last_updated":"2026-07-01T08:11:59Z","snapshot_observed_at":"2026-07-14T22:43:17.174240Z","submitted_at":"2026-03-12T08:56:14Z","title":"Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-14T22:43:59.727378Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2603.11689"},"observation_digest":"sha256:34b64e74aea73be71febc085a5aebeb6a416ea8e2d2969d1d7a376f63d97ac58","observation_id":"a43f5ecc-af12-4c0e-b663-17de2f84e7cd","resolution":{"observed_at":"2026-07-14T22:43:59.727378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2604.03231","last_updated":"2026-04-03T17:59:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T17:59:51Z","title":"CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T20:28:30.864143Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2604.03231"},"observation_digest":"sha256:f7bfcd741edf57a442d3635f47008ea4dc585b01db2eaa0b748d77c343ae9f79","observation_id":"ab31082e-b61d-4101-a65d-f26a4078c97f","resolution":{"observed_at":"2026-05-13T20:33:14.532847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2604.04969","last_updated":"2026-07-12T03:10:04Z","snapshot_observed_at":"2026-08-02T05:19:18.740150Z","submitted_at":"2026-04-04T07:14:01Z","title":"MG$^2$-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-13T17:12:38.618233Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2604.04969"},"observation_digest":"sha256:ab5b56fe8c9f1d1d7866fdca0e593335da7129eb3ef3d07f52a1d8bd181d72b0","observation_id":"e9dd7262-0e5a-42be-91d3-07b0c2fb289d","resolution":{"observed_at":"2026-05-13T17:13:00.915838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-07-14T19:54:25.294067Z","title":"arXiv preprint arXiv:2402.04252 (2024), https://arxiv.org/abs/2508.05318 MG2-RAG: Multi-Granularity Graph for MM-RAG 21","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.04969","last_updated":"2026-07-12T03:10:04Z","snapshot_observed_at":"2026-08-02T05:19:18.740150Z","submitted_at":"2026-04-04T07:14:01Z","title":"MG$^2$-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-14T19:54:25.294067Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2604.04969"},"observation_digest":"sha256:8f3782138e794b0b2bb77676c1f3baeb214c0729e9f83ab933ebf162666fa1db","observation_id":"58593182-a8bb-40e1-84b2-f315e94771f7","resolution":{"observed_at":"2026-07-14T19:54:25.294067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2604.12033","last_updated":"2026-04-13T20:22:22Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:22:22Z","title":"Benchmarking Deflection and Hallucination in Large Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:28:26.268341Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2604.12033"},"observation_digest":"sha256:18d4ec3ace65114e44579c0f29c37e1c4c7f4378cf407bb7e069deb4fb4539a6","observation_id":"3f1319da-4fef-4b53-9cca-409ce23938c0","resolution":{"observed_at":"2026-05-11T10:31:00.678352Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2604.12391","last_updated":"2026-04-14T07:26:23Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T07:26:23Z","title":"Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T16:16:51.109113Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2604.12391"},"observation_digest":"sha256:3d85dc831e22c39e9dca086d909d60d0be1f20c3953acf3d77ed86bbeac21440","observation_id":"1e3b25e8-7e0a-4d90-8e9a-b9b75bd515fe","resolution":{"observed_at":"2026-05-11T09:05:58.682843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2604.20760","last_updated":"2026-04-22T16:48:43Z","snapshot_observed_at":"2026-08-04T10:29:14.353844Z","submitted_at":"2026-04-22T16:48:43Z","title":"Exploring High-Order Self-Similarity for Video Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T00:59:03.890135Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2604.20760"},"observation_digest":"sha256:ec948cb46015d891e88249efe0a6b7e1204de1234857e8bd0b3a6a3cdff2b3cb","observation_id":"f31a42a9-3475-4e02-aa22-a9e3b35373a2","resolution":{"observed_at":"2026-05-10T00:59:49.461872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2604.21444","last_updated":"2026-04-23T09:04:32Z","snapshot_observed_at":"2026-08-06T20:54:24.378597Z","submitted_at":"2026-04-23T09:04:32Z","title":"HiCrew: Hierarchical Reasoning for Long-Form Video Understanding via Question-Aware Multi-Agent Collaboration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-09T21:55:35.699057Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2604.21444"},"observation_digest":"sha256:6a239d9fea2bda7ff070f0f98f1766535fed42a8895d018ab081128e2a057824","observation_id":"5ec127f8-c038-4205-9379-8c004079cb78","resolution":{"observed_at":"2026-05-11T14:26:02.222190Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2606.20104","last_updated":"2026-06-18T11:25:16Z","snapshot_observed_at":"2026-08-02T12:07:11.942278Z","submitted_at":"2026-06-18T11:25:16Z","title":"Sensorimotor World Models: Perception for Action via Inverse Dynamics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T18:21:51.580903Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2606.20104"},"observation_digest":"sha256:5099bc2728b914a174e6737ce47eddd3c222b3ffa500e97a54b4dc57e4ca3280","observation_id":"1219347e-580a-4b29-802e-2749de453990","resolution":{"observed_at":"2026-07-04T03:09:30.299865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2606.20280","last_updated":"2026-07-04T09:32:50Z","snapshot_observed_at":"2026-07-12T13:16:44.503259Z","submitted_at":"2026-06-18T14:23:23Z","title":"ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-26T15:34:55.062016Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2606.20280"},"observation_digest":"sha256:4e4193914b22ee0d5b36a484d788d70179082628b7823a96eacceff999bba62c","observation_id":"f7e01b75-078c-4ca5-8725-73c52626a467","resolution":{"observed_at":"2026-07-04T05:49:36.655493Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2606.23881","last_updated":"2026-06-22T19:27:00Z","snapshot_observed_at":"2026-08-03T12:04:36.736234Z","submitted_at":"2026-06-22T19:27:00Z","title":"Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-26T08:12:14.829556Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2606.23881"},"observation_digest":"sha256:c88f25bd7a7e111322bd9cbeb84cc84fdb3717dc759a8057354aecbf303d7819","observation_id":"7bafcb59-91f1-40f5-bec6-abf94911e215","resolution":{"observed_at":"2026-07-04T10:59:46.881141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2606.26794","last_updated":"2026-06-25T09:27:54Z","snapshot_observed_at":"2026-08-03T16:40:37.506200Z","submitted_at":"2026-06-25T09:27:54Z","title":"ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-26T05:03:15.044146Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2606.26794"},"observation_digest":"sha256:a7a032edae18f5da8cc52c94f15cce2c062cc4c1f50cefc79be8f0f4fbfc45cc","observation_id":"3c2d5fa3-575a-4d5f-a188-1c1710b824b6","resolution":{"observed_at":"2026-07-04T13:39:50.784830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2607.00159","last_updated":"2026-06-30T20:35:30Z","snapshot_observed_at":"2026-07-07T00:05:49.557137Z","submitted_at":"2026-06-30T20:35:30Z","title":"Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-02T19:13:44.015782Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2607.00159"},"observation_digest":"sha256:bf59885188e3b4ce3953517a55564956c917399d0d3a176783f31510754b755e","observation_id":"38118793-1777-41f9-b8f6-6a1acc7ce684","resolution":{"observed_at":"2026-07-02T19:17:17.749685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-06T00:31:17.047603Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-09T17:23:13.403863Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T00:31:17.047603Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:d09521096e45cad1baea611c0aa6c33a2012e647ee522674a17a8479011b6386","observation_id":"851cac4c-9e90-4435-b87d-30ba397117c2","resolution":{"observed_at":"2026-08-06T00:31:17.047603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-06T04:19:52.837353Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-09T17:23:13.403863Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.837353Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:cd8b20fd92cd6f36a83dd6f105e180bb73f1948299af74e124b042a7df062c48","observation_id":"353c7071-a8c2-4dbc-9acf-c8a45a9ce76c","resolution":{"observed_at":"2026-08-06T04:19:52.837353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.04252/citation-record","integrity":"/paper/2402.04252/integrity","json":"/paper/2402.04252/citation-record.json","paper":"/paper/2402.04252"},"outbound":[],"paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 30 inbound Pith citation observations for arXiv:2402.04252."}