{"as_of":"2026-08-09T19:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c19219deaddb60fbba5f8dee7940ed0f332fb74983c08000a6341da6176ce40","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T21:57:09.085648Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-24T04:48:54.299822Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":"2106.11097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","venue":null,"work_id":"8d25e9b6-c6a3-4d5e-986c-928a46f87903","year":2021},"citing_paper":{"arxiv_id":"2204.00598","last_updated":"2022-05-27T17:52:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-01T17:43:13Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-16T09:50:00.546571Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2204.00598"},"observation_digest":"sha256:31c2b5b92e56f5ef70f179881c4d0321f722018f8a1629fa82cdf5b78e3d4b58","observation_id":"d75c229d-e26a-4636-9a92-0421d108cc6f","resolution":{"observed_at":"2026-05-16T09:50:00.683764Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":"2106.11097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","venue":null,"work_id":"8d25e9b6-c6a3-4d5e-986c-928a46f87903","year":2021},"citing_paper":{"arxiv_id":"2401.07669","last_updated":"2026-05-25T19:17:10Z","snapshot_observed_at":"2026-08-01T15:10:33.776201Z","submitted_at":"2024-01-15T13:27:34Z","title":"SRL-CLIP: Efficient CLIP Video Adaptation via Structured Semantic Role Labels","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-24T04:46:18.542521Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2401.07669"},"observation_digest":"sha256:fed3ebbf53813063fc0e4b51dc8f33ac06ffbeafeb8d4206aec0cae43f8bb6b6","observation_id":"4a47bb5f-7b6b-42c4-8b69-3b555bf773fd","resolution":{"observed_at":"2026-05-24T04:48:54.303371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-08-08T21:57:09.085648Z","title":"Clip2video: Mastering video- text retrieval via image clip,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.15739","last_updated":"2025-02-07T06:21:43Z","snapshot_observed_at":"2026-08-08T21:49:23.871635Z","submitted_at":"2025-02-07T06:21:43Z","title":"Detecting Content Rating Violations in Android Applications: A Vision-Language Approach","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T21:57:09.085648Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2502.15739"},"observation_digest":"sha256:44399e9cb1dc3781be0864ea8da86a1424997b841133a3f28b75a9cb915f6a69","observation_id":"e210b03a-5f04-4acf-8706-2e12d001248a","resolution":{"observed_at":"2026-08-08T21:57:09.085648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":"2106.11097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","venue":null,"work_id":"8d25e9b6-c6a3-4d5e-986c-928a46f87903","year":2021},"citing_paper":{"arxiv_id":"2503.13821","last_updated":"2026-04-03T20:02:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T01:57:48Z","title":"Stitch-a-Demo: Video Demonstrations from Multistep Descriptions","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T00:30:55.729900Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2503.13821"},"observation_digest":"sha256:ef9d570f137cb0e4dc4d1e718682b5135aec7744c0e87c45d9db1f4bc41c274b","observation_id":"b372a1b7-fd12-4298-83af-85acfe7bdb65","resolution":{"observed_at":"2026-05-23T00:32:18.297596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-08-07T12:45:09.738221Z","title":"and Chen, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24134","last_updated":"2025-05-30T02:09:37Z","snapshot_observed_at":"2026-08-08T19:19:57.874384Z","submitted_at":"2025-05-30T02:09:37Z","title":"A Mathematical Perspective On Contrastive Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:09.738221Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2505.24134"},"observation_digest":"sha256:d0041faece3d479bc7937621597da46718dba676fe7e99d502259cf6401d2b63","observation_id":"06498fb3-0c1d-4cf3-921d-2ca0b4ee5cfb","resolution":{"observed_at":"2026-08-07T12:45:09.738221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-08-07T05:35:57.052410Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07572","last_updated":"2025-06-09T09:16:14Z","snapshot_observed_at":"2026-08-09T11:28:11.758236Z","submitted_at":"2025-06-09T09:16:14Z","title":"Learning Speaker-Invariant Visual Features for Lipreading","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:57.052410Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2506.07572"},"observation_digest":"sha256:87c175171ccb0cac4777bcbc57a4f96dcbc7cb3b82ea3a47e3f2d3e53540a03d","observation_id":"ddea426d-f18b-44c0-99df-70fe5494a31e","resolution":{"observed_at":"2026-08-07T05:35:57.052410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-08-06T15:36:27.471308Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15491","last_updated":"2025-07-21T10:46:49Z","snapshot_observed_at":"2026-08-06T15:28:26.370659Z","submitted_at":"2025-07-21T10:46:49Z","title":"Prompt-aware of Frame Sampling for Efficient Text-Video Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:27.471308Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2507.15491"},"observation_digest":"sha256:b61dc7e8cb376dee41fd2bc0b58d13bbf9cf14864b40463c0c121c0b5de59fba","observation_id":"475e19fe-8987-4049-afcf-545444f1c113","resolution":{"observed_at":"2026-08-06T15:36:27.471308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-08-06T13:12:39.766732Z","title":"Clip2video: Mastering video-text retrieval via image clip.arXiv preprint arXiv:2106.11097,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-09T01:06:46.947738Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:39.766732Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:675eaf2eca37aabed5ba5149f1e30d014b287f71f43be20e5291153466b70820","observation_id":"8adc1884-5841-4d92-9623-872b8dd0785b","resolution":{"observed_at":"2026-08-06T13:12:39.766732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":"2106.11097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","venue":null,"work_id":"8d25e9b6-c6a3-4d5e-986c-928a46f87903","year":2021},"citing_paper":{"arxiv_id":"2604.11043","last_updated":"2026-05-12T15:42:58Z","snapshot_observed_at":"2026-07-06T22:59:32.051572Z","submitted_at":"2026-04-13T06:15:11Z","title":"EmergentBridge: Improving Zero-Shot Cross-Modal Transfer in Unified Multimodal Embedding Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:51.162967Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2604.11043"},"observation_digest":"sha256:61e7516fdd0a4d4ad4c979e02ee7c562c1a41ffcce67d51781fdba5103de0a64","observation_id":"18390aa0-4e10-4ff7-94b5-3a14c7a0bbbc","resolution":{"observed_at":"2026-05-11T09:41:01.914340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":"2106.11097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","venue":null,"work_id":"8d25e9b6-c6a3-4d5e-986c-928a46f87903","year":2021},"citing_paper":{"arxiv_id":"2604.11043","last_updated":"2026-05-12T15:42:58Z","snapshot_observed_at":"2026-07-06T22:59:32.051572Z","submitted_at":"2026-04-13T06:15:11Z","title":"EmergentBridge: Improving Zero-Shot Cross-Modal Transfer in Unified Multimodal Embedding Models","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T07:16:15.202466Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2604.11043"},"observation_digest":"sha256:3c7452568888ae7fb5abccc120e2c706ca3d4ddbc2762557e61d79ab9803fa72","observation_id":"7bc0539d-8372-4464-8dcb-3e49fe2c6d7f","resolution":{"observed_at":"2026-05-13T07:17:28.665420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":"2106.11097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","venue":null,"work_id":"8d25e9b6-c6a3-4d5e-986c-928a46f87903","year":2021},"citing_paper":{"arxiv_id":"2605.00051","last_updated":"2026-04-29T15:29:19Z","snapshot_observed_at":"2026-08-02T05:45:46.015951Z","submitted_at":"2026-04-29T15:29:19Z","title":"Learning from the Unseen: Generative Data Augmentation for Geometric-Semantic Accident Anticipation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-09T20:04:39.623342Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2605.00051"},"observation_digest":"sha256:313c306abfc5b5f4f509e5aa11d3529a58854d4733b2ac9f7e4c3f5c41b30484","observation_id":"15cdf844-dbd2-4316-8418-c8d476152921","resolution":{"observed_at":"2026-05-11T15:26:08.314300Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":"2106.11097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","venue":null,"work_id":"8d25e9b6-c6a3-4d5e-986c-928a46f87903","year":2021},"citing_paper":{"arxiv_id":"2605.00826","last_updated":"2026-03-07T12:28:35Z","snapshot_observed_at":"2026-08-08T07:16:50.125784Z","submitted_at":"2026-03-07T12:28:35Z","title":"Understanding the Performance Plateau in Text-to-Video Retrieval: A Comprehensive Empirical and Linguistic Analysis","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-15T15:05:37.964883Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2605.00826"},"observation_digest":"sha256:7b87eaf39cd27b97be3977c8c645b9eade92b06b7f4cc18710c61e9eba987519","observation_id":"e7f17c4f-79fc-4248-98ae-e47fbf162147","resolution":{"observed_at":"2026-05-15T15:06:09.640974Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-07-13T04:19:16.924621Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09263","last_updated":"2026-07-10T10:26:38Z","snapshot_observed_at":"2026-08-09T14:32:44.942430Z","submitted_at":"2026-07-10T10:26:38Z","title":"Semantic Hardness Is Not Visual Hardness: Sign-Aware Hard Negative Mining for Sign Language Retrieval","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-13T04:19:16.924621Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2607.09263"},"observation_digest":"sha256:598d0b1c81c1b3f252c678ff55d134f8931f612553bb077fb3cc490ae7b3307c","observation_id":"599e28ca-8d4e-46ce-9590-96fdadc8c36b","resolution":{"observed_at":"2026-07-13T04:19:16.924621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-08-02T01:01:00.942499Z","title":"arXiv preprint arXiv:2106.11097 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14821","last_updated":"2026-07-16T10:39:22Z","snapshot_observed_at":"2026-08-07T23:46:00.212599Z","submitted_at":"2026-07-16T10:39:22Z","title":"Blurring Modal Boundaries: A Unified Survey from Single- to Multi-Modal Person Re-ldentification","version":1},"reference_index":154,"source":"pdf_text","source_observed_at":"2026-08-02T01:01:00.942499Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2607.14821"},"observation_digest":"sha256:c388437ce18f1d1815b575314ccfb86e5f0c4b9a20eff0bdf7e3abf8549ce84d","observation_id":"8de72bdb-d372-4f2c-9b39-7a4f0850d79a","resolution":{"observed_at":"2026-08-02T01:01:00.942499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2106.11097/citation-record","integrity":"/paper/2106.11097/integrity","json":"/paper/2106.11097/citation-record.json","paper":"/paper/2106.11097"},"outbound":[],"paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2106.11097."}