{"as_of":"2026-08-15T05:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8acbf7657c9f02095c9cf1e326cc329c520278b7c6ede67455d97d3542a80235","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:23:18.768419Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:09:15.255843Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2204.00598","last_updated":"2022-05-27T17:52:50Z","snapshot_observed_at":"2026-08-13T04:37:51.649726Z","submitted_at":"2022-04-01T17:43:13Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-16T09:50:00.546571Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2204.00598"},"observation_digest":"sha256:8b0629b6a4d63a2556c4a8acd08d1f9df46f7fea8b929e446c5fb2b2f67e7400","observation_id":"7e639819-48cb-481d-bca9-afea9da9f0da","resolution":{"observed_at":"2026-05-16T09:50:00.789565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-16T09:20:20.143143Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2309.16671"},"observation_digest":"sha256:f2456103ad5ff10280fa421086aeac102f260e7f8960b4d67e77e77551646983","observation_id":"d552b34c-5ce0-4e56-8486-79dd1ee6230b","resolution":{"observed_at":"2026-05-16T09:20:20.353154Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2401.07669","last_updated":"2026-05-25T19:17:10Z","snapshot_observed_at":"2026-08-13T04:42:48.186810Z","submitted_at":"2024-01-15T13:27:34Z","title":"SRL-CLIP: Efficient CLIP Video Adaptation via Structured Semantic Role Labels","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-24T04:46:18.542521Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2401.07669"},"observation_digest":"sha256:6680689503ce0e3d9d8242f9466cf5be32b17b7b874f8833e7ab93af21ae5ce3","observation_id":"e45785c1-8ef1-41aa-a520-d9f87f4335e9","resolution":{"observed_at":"2026-05-24T04:48:54.297379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"reference_index":210,"source":"arxiv_source","source_observed_at":"2026-05-10T23:20:32.330351Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2410.02713"},"observation_digest":"sha256:72c7b8c24ba51477c11b42635cc6b3c68837051e2881ac93abedd5ac04861cfe","observation_id":"a0f7aa7c-4b58-4382-9d42-9f1779120058","resolution":{"observed_at":"2026-05-10T23:20:33.141307Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-12T21:23:18.768419Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.08842","last_updated":"2024-11-13T18:20:29Z","snapshot_observed_at":"2026-08-12T21:13:54.192328Z","submitted_at":"2024-11-13T18:20:29Z","title":"AstroM$^3$: A self-supervised multimodal model for astronomy","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T21:23:18.768419Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2411.08842"},"observation_digest":"sha256:16795460d2c538a5bc311f30bf0f3bbaceea71537157f38b2c0937f8efc16fbf","observation_id":"3a1d64b6-eb39-477a-98f1-62d3e1a5c280","resolution":{"observed_at":"2026-08-12T21:23:18.768419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-12T15:06:04.988340Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-15T04:20:15.940552Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.988340Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:7840212253b2c3bd3c77ce923a3c4b38ceff39f15b2dd45f1d125bf0aedb636d","observation_id":"544c7b6c-8643-477f-b6c9-ee214541a8b9","resolution":{"observed_at":"2026-08-12T15:06:04.988340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-12T05:13:50.127973Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval.arXiv preprint arXiv:2104.08860, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00639","last_updated":"2025-06-02T15:22:19Z","snapshot_observed_at":"2026-08-14T04:28:00.211367Z","submitted_at":"2024-12-01T01:36:41Z","title":"Needle: A Generative AI-Powered Multi-modal Database for Answering Complex Natural Language Queries","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T05:13:50.127973Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2412.00639"},"observation_digest":"sha256:eaf2c88f7ac05bd1c8a52ded088d1856b727a0954e9da5261b5884fbd01aa3a8","observation_id":"8ea95b71-15e6-45ac-a3b7-82a473567ab1","resolution":{"observed_at":"2026-08-12T05:13:50.127973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-10T22:20:45.980215Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01950","last_updated":"2025-04-29T16:27:32Z","snapshot_observed_at":"2026-08-14T05:01:03.075515Z","submitted_at":"2025-01-03T18:54:26Z","title":"MADGEN: Mass-Spec attends to De Novo Molecular generation","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T22:20:45.980215Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2501.01950"},"observation_digest":"sha256:67e0f3b62fdda3fce6f779759e80ec46444460bb8e6558943848560d432f1bfb","observation_id":"0d5d01f8-1b03-425e-bab1-55dc2bbe0c20","resolution":{"observed_at":"2026-08-10T22:20:45.980215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-10T20:08:46.149164Z","title":"CLIP4Clip: An empirical study of clip for end to end video clip retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09425","last_updated":"2025-05-13T06:30:11Z","snapshot_observed_at":"2026-08-15T04:34:33.617262Z","submitted_at":"2025-01-16T09:55:42Z","title":"Vision-Language Models Do Not Understand Negation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:08:46.149164Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2501.09425"},"observation_digest":"sha256:b3b4a4019810a22d953d273dbbc115510dba0e5b4b5fd643127c534bd4e42502","observation_id":"92c26dc6-4b83-4553-a6ca-f3662ab335d6","resolution":{"observed_at":"2026-08-10T20:08:46.149164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-07T06:05:31.747047Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06144","last_updated":"2025-06-06T15:02:30Z","snapshot_observed_at":"2026-08-14T03:14:20.396841Z","submitted_at":"2025-06-06T15:02:30Z","title":"CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:31.747047Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2506.06144"},"observation_digest":"sha256:3000ff3458f92f10f19ae4ba8ef892e035a977ac6d73e5e71bdd81f117d21683","observation_id":"4a36bfaa-22be-4fb5-92c1-7335d9074463","resolution":{"observed_at":"2026-08-07T06:05:31.747047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-06T23:49:26.509966Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16258","last_updated":"2025-06-19T12:17:31Z","snapshot_observed_at":"2026-08-10T03:09:55.520770Z","submitted_at":"2025-06-19T12:17:31Z","title":"ViFusion: In-Network Tensor Fusion for Scalable Video Feature Indexing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:26.509966Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2506.16258"},"observation_digest":"sha256:53924adea85d2cb52aa0295b77ad87f567fca1ae666cabc9e019231538a2d21c","observation_id":"7b6c544f-d6ff-45c9-ac0f-04e709b8b115","resolution":{"observed_at":"2026-08-06T23:49:26.509966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-06T20:43:04.406744Z","title":"Clip4clip: An empirical study of clip for end-to-end video clip retrieval and captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-09T08:36:32.159136Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:04.406744Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:a21090fbcb3b15bf9f105bcafdeca1cea10e02fa73f18db4749db7caaa9155c3","observation_id":"17b3a461-14f7-47f8-a8ff-fbd05e9e0b22","resolution":{"observed_at":"2026-08-06T20:43:04.406744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-06T20:18:52.176751Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03330","last_updated":"2025-07-04T06:30:50Z","snapshot_observed_at":"2026-08-13T09:33:14.150255Z","submitted_at":"2025-07-04T06:30:50Z","title":"Exploring Object Status Recognition for Recipe Progress Tracking in Non-Visual Cooking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:18:52.176751Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2507.03330"},"observation_digest":"sha256:83f669c3cd660d088d303fca40cf757573134e5b962e0139fbbd23153dd91f76","observation_id":"97af0fe0-60ea-4c3a-b795-75a52cc6c807","resolution":{"observed_at":"2026-08-06T20:18:52.176751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-06T13:23:36.569663Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20745","last_updated":"2025-07-28T11:52:56Z","snapshot_observed_at":"2026-08-14T17:18:44.422047Z","submitted_at":"2025-07-28T11:52:56Z","title":"Regularizing Subspace Redundancy of Low-Rank Adaptation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:23:36.569663Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2507.20745"},"observation_digest":"sha256:be4d3706f50d88e0e146e45397805aaf52ec8350dafa0eb76efc13530968f30b","observation_id":"499b8bba-365c-49d0-80ec-fbbeb4520bba","resolution":{"observed_at":"2026-08-06T13:23:36.569663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-04T19:37:42.236365Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-09T17:50:11.271087Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":243,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:42.236365Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:2eefac3d99a446e6e1ac974daee9d740d0727eac75fa4f0778e29f19ca6cd042","observation_id":"a0f7ebcc-fc1a-409f-a5c6-ebf1340f57dd","resolution":{"observed_at":"2026-08-04T19:37:42.236365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-04T09:27:27.954552Z","title":"Clip4clip: An empirical study of CLIP for end to end video clip retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.15470","last_updated":"2025-10-17T09:26:28Z","snapshot_observed_at":"2026-08-13T16:18:50.395072Z","submitted_at":"2025-10-17T09:26:28Z","title":"MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T09:27:27.954552Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2510.15470"},"observation_digest":"sha256:0460814b437b64e37bc44da3663582f5cc698ba5dc7270fffca237fc56d759b2","observation_id":"f26efacf-4cd4-448b-b021-45248dea36ad","resolution":{"observed_at":"2026-08-04T09:27:27.954552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2512.13511","last_updated":"2026-05-01T11:23:38Z","snapshot_observed_at":"2026-08-13T14:28:42.446815Z","submitted_at":"2025-12-15T16:38:59Z","title":"Adapting MLLMs for Nuanced Video Retrieval","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T22:20:09.051957Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2512.13511"},"observation_digest":"sha256:2c2bdffd9a08cef13f42e0d194c59a7728f1e926dd20b34ca4835925b0f2e1aa","observation_id":"9ce8db31-0a39-4f83-822f-0b39afdb2979","resolution":{"observed_at":"2026-05-16T22:21:18.841437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2604.05418","last_updated":"2026-04-16T09:51:53Z","snapshot_observed_at":"2026-08-13T01:46:29.436206Z","submitted_at":"2026-04-07T04:26:59Z","title":"VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T19:15:02.124035Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2604.05418"},"observation_digest":"sha256:637ace63a9861341bec5192da69d736885960dff3e9ca5b61d45d8ed27a1ec43","observation_id":"b2eb13b6-a277-40e2-a154-7f6a4c60b214","resolution":{"observed_at":"2026-05-10T23:15:50.054638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2604.09088","last_updated":"2026-04-10T08:16:59Z","snapshot_observed_at":"2026-08-11T16:03:30.442738Z","submitted_at":"2026-04-10T08:16:59Z","title":"Memory-Efficient Transfer Learning with Fading Side Networks via Masked Dual Path Distillation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T16:45:36.306400Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2604.09088"},"observation_digest":"sha256:1f3d3c0c5ca483c5232e11c50644a87a72873bbf9eef762650ef50ceeda18134","observation_id":"586e7a31-488a-496e-9a38-222c98c78703","resolution":{"observed_at":"2026-05-11T08:15:58.956061Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2605.04058","last_updated":"2026-04-10T08:00:28Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T08:00:28Z","title":"MP-ISMoE: Mixed-Precision Interactive Side Mixture-of-Experts for Efficient Transfer Learning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-10T17:19:59.247074Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2605.04058"},"observation_digest":"sha256:1e8b9e4e1e52d93c6cb62029ba56d9c78b95b68f65d354f916e329cc67b47f70","observation_id":"5a9f84e7-0509-4cf8-a276-f9ec489e4730","resolution":{"observed_at":"2026-05-11T07:01:10.396147Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2605.06229","last_updated":"2026-05-07T13:21:11Z","snapshot_observed_at":"2026-07-06T23:18:46.145104Z","submitted_at":"2026-05-07T13:21:11Z","title":"Look Beyond Saliency: Low-Attention Guided Dual Encoding for Video Semantic Search","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T13:39:20.777029Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2605.06229"},"observation_digest":"sha256:b3917865c1ef5a611c00a5bf06cf6e4636e659e04fbad28408b7c58beadab9b7","observation_id":"e8c95ba4-e1e7-4552-aedb-8b882c9f613f","resolution":{"observed_at":"2026-05-11T18:51:07.810751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2605.12145","last_updated":"2026-05-13T09:22:06Z","snapshot_observed_at":"2026-08-15T04:22:00.403778Z","submitted_at":"2026-05-12T14:03:30Z","title":"Cross-Modal-Domain Generalization Through Semantically Aligned Discrete Representations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T07:20:46.651636Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2605.12145"},"observation_digest":"sha256:46a5e0589850dc448630884650eded06376ba417daca6b3b52f3f98a03ca8f52","observation_id":"87cfe60d-3ef6-44fe-9c5a-546387cc0ee6","resolution":{"observed_at":"2026-05-13T07:22:28.874868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2605.12145","last_updated":"2026-05-13T09:22:06Z","snapshot_observed_at":"2026-08-15T04:22:00.403778Z","submitted_at":"2026-05-12T14:03:30Z","title":"Cross-Modal-Domain Generalization Through Semantically Aligned Discrete Representations","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T21:52:31.915302Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2605.12145"},"observation_digest":"sha256:eb0a82d11b50272829f1f4f33edba2fd1d98efb65a739d859844e9cf4b414572","observation_id":"ba1939d0-95c7-4c34-8bab-9027a636fa86","resolution":{"observed_at":"2026-05-14T21:53:02.073515Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2605.26641","last_updated":"2026-05-26T07:26:23Z","snapshot_observed_at":"2026-08-06T17:24:19.284916Z","submitted_at":"2026-05-26T07:26:23Z","title":"OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-29T18:08:50.574960Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2605.26641"},"observation_digest":"sha256:0087ef208f3dd1d61c0a1e1c216aad787e14beaa289ec25963c72e684bac8559","observation_id":"9764b215-1560-48d0-ab4e-fc4cabaa5b5c","resolution":{"observed_at":"2026-06-29T18:13:48.561178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2606.17298","last_updated":"2026-06-15T21:06:53Z","snapshot_observed_at":"2026-08-14T06:21:26.829057Z","submitted_at":"2026-06-15T21:06:53Z","title":"Reasoning Text-to-Video Retrieval for Operating Room Clips via Action-Driven Digital Twins","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T03:26:49.843308Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2606.17298"},"observation_digest":"sha256:1e1542fac69cd252a9c3eca9681ce00fec83774e80c341982fda84060eb86caf","observation_id":"d78b6606-e4de-4570-a2a5-daa99bb65ab7","resolution":{"observed_at":"2026-07-03T17:58:47.526835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2606.18885","last_updated":"2026-06-17T10:00:33Z","snapshot_observed_at":"2026-08-04T13:33:45.473188Z","submitted_at":"2026-06-17T10:00:33Z","title":"LARE: Low-Attention Region Encoding for Text-Image Retrieval","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-26T21:25:12.373068Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2606.18885"},"observation_digest":"sha256:ba4eb138d017aaf18f2fc3dd9399e6c6c27e7b54d4b2f42e2b36efdd296865e0","observation_id":"52547ef6-7fe1-4c88-a9a0-ab204e70d174","resolution":{"observed_at":"2026-07-04T00:09:15.257933Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":"2104.08860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-04T00:09:15.255843Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","venue":null,"work_id":"9bcbae39-2c12-483e-8791-ff87989bd877","year":2021},"citing_paper":{"arxiv_id":"2607.00446","last_updated":"2026-07-01T04:59:24Z","snapshot_observed_at":"2026-08-13T20:56:12.287244Z","submitted_at":"2026-07-01T04:59:24Z","title":"VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-02T15:09:47.855795Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2607.00446"},"observation_digest":"sha256:8b95a999978e96f83a482531619e7088cb8046194d94554169b0a478e45c3593","observation_id":"76321b28-b6b5-4d49-8a86-e750b1d2fd32","resolution":{"observed_at":"2026-07-02T15:17:07.335570Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-11T08:55:44.783824Z","title":"arXiv preprint arXiv:2104.08860 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05093","last_updated":"2026-07-07T12:28:04Z","snapshot_observed_at":"2026-08-12T08:26:25.735657Z","submitted_at":"2026-07-06T13:52:46Z","title":"Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-11T08:55:44.783824Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2607.05093"},"observation_digest":"sha256:fd9f136dacb1342572602e7dbb8cc147b8d8278dfb9f4fcf5cb7c2d690e763d6","observation_id":"eb3295a6-4ac8-4ff7-b996-ca452ecc1e35","resolution":{"observed_at":"2026-07-11T08:55:44.783824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2104.08860 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-14T13:32:54.252108Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:48d9662ad1cccbfe027ab0cf541669b4b48d7ae8451ccd2bc8a7f4700f62af67","observation_id":"559a8468-8043-4bd0-ad4b-54f04ec750ab","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-02T01:01:00.937550Z","title":"arXiv preprint arXiv:2104.08860 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14821","last_updated":"2026-07-16T10:39:22Z","snapshot_observed_at":"2026-08-13T21:05:03.889015Z","submitted_at":"2026-07-16T10:39:22Z","title":"Blurring Modal Boundaries: A Unified Survey from Single- to Multi-Modal Person Re-ldentification","version":1},"reference_index":153,"source":"pdf_text","source_observed_at":"2026-08-02T01:01:00.937550Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2607.14821"},"observation_digest":"sha256:8558c7c0d369f0fcc995426887987dde2f52923cea2f65b814d4452b61b9a887","observation_id":"371c535c-6c7c-4f15-b28d-535a3c791952","resolution":{"observed_at":"2026-08-02T01:01:00.937550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-01T23:14:55.353507Z","title":"arXiv preprint arXiv:2104.08860 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15491","last_updated":"2026-07-16T22:39:19Z","snapshot_observed_at":"2026-08-13T21:26:59.532899Z","submitted_at":"2026-07-16T22:39:19Z","title":"Trajectory-aware Cross-view Geo-localization with Sequential Observations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T23:14:55.353507Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2607.15491"},"observation_digest":"sha256:41112e2f89f880a1ada203766edd025c9e5de17869d696dac832b1f3d110eaed","observation_id":"879e6ef0-36cd-460b-ab67-452bc62fe40c","resolution":{"observed_at":"2026-08-01T23:14:55.353507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-01T11:30:56.884700Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19889","last_updated":"2026-07-22T08:20:52Z","snapshot_observed_at":"2026-08-14T01:38:06.673381Z","submitted_at":"2026-07-22T08:20:52Z","title":"LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T11:30:56.884700Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2607.19889"},"observation_digest":"sha256:9f4a53f7fb9ce8fc6f78bcbb6c71fc80ad30ab2774e410527e2c7c29bc31575e","observation_id":"482c4a35-b131-4ba4-a023-80cb7c0e3616","resolution":{"observed_at":"2026-08-01T11:30:56.884700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-01T03:02:39.899176Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26097","last_updated":"2026-08-04T07:44:31Z","snapshot_observed_at":"2026-08-10T18:12:16.741162Z","submitted_at":"2026-07-28T03:54:27Z","title":"Knowledge-guided Disentanglement with Atomic Actions for Action Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T03:02:39.899176Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2607.26097"},"observation_digest":"sha256:9db819c6430b8147686f9fb88307385381d5b718d0e622625fe22aea9e3293bb","observation_id":"3c406d12-39be-46f6-a23c-b57b58c50c7c","resolution":{"observed_at":"2026-08-01T03:02:39.899176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2104.08860/citation-record","integrity":"/paper/2104.08860/integrity","json":"/paper/2104.08860/citation-record.json","paper":"/paper/2104.08860"},"outbound":[],"paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T19:37:56.020112Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2104.08860."}