{"as_of":"2026-08-13T12:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:10cac7030afceb1644adb81aed26d3c87799b2cb9b09510c4c8b85e7f7a8bce3","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:04:38.641568Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08887/citation-record","integrity":"/paper/2506.08887/integrity","json":"/paper/2506.08887/citation-record.json","paper":"/paper/2506.08887"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.099416Z","title":"Localizing mo- ments in video with natural language","venue":null,"work_id":"3066ff7a-fc50-4a48-a8ba-4058a7a948a7","year":2017},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.504246Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:5f19c811e5a0eba4fcc45a273c6e95a2b0306e3e812d5a7364cf30fa6090842d","observation_id":"69266413-019c-46c6-9327-ef3c60df9862","resolution":{"observed_at":"2026-08-07T05:04:39.101686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.093662Z","title":"Vqa: Visual question answering","venue":null,"work_id":"3151278e-62ad-4277-b98a-8e829ff3d45e","year":2015},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.507071Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:3c02ccadf5cab5a2f869adc5d034658a9444231dc2c14e894065318f27308d61","observation_id":"8819666a-0375-46b3-b42a-42f9bb34c443","resolution":{"observed_at":"2026-08-07T05:04:39.095804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.087712Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"379c6afe-0763-4837-a653-779f63be6c95","year":2021},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.509532Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:1dbd6939445ac0805b9efc2a67356d1f625d48dbf26da47e317d4769f7b1797a","observation_id":"4628a9ca-b838-4b54-b7ce-56bd9964f1c3","resolution":{"observed_at":"2026-08-07T05:04:39.089994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.081119Z","title":"Cross modal retrieval with querybank normalisation","venue":null,"work_id":"73a03b12-9a63-463d-9061-68112ab7c610","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.512142Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:83912bff22a35564144c9bd153a2806f1b0e1c427536a7c873e350005e144afd","observation_id":"0b308772-8625-4b7a-b330-03ca9c3b1748","resolution":{"observed_at":"2026-08-07T05:04:39.083821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.074602Z","title":"RAP: Efficient text-video retrieval with sparse-and- correlated adapter","venue":null,"work_id":"3c8c3d20-8ad8-4657-ab4f-58aeadbf022d","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.514579Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:1e424d6991097672fb58dee468b8129905612f55b0d35b2107dfdd800a69c234","observation_id":"dc198174-2b83-4f14-a585-9fe2ece5a579","resolution":{"observed_at":"2026-08-07T05:04:39.077014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.068169Z","title":"Adaptformer: Adapt- ing vision transformers for scalable visual recognition.Ad- vances in Neural Information Processing Systems, 2022","venue":null,"work_id":"30f8513f-3cae-4145-a265-f1cfff0d04a2","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.516855Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:b3c0d53f02f7c659518fc30f0460379ddfe037f1177ce11070b156f9cbf22c4b","observation_id":"b5ee4d76-0774-4ee6-9b80-77e60927dd13","resolution":{"observed_at":"2026-08-07T05:04:39.070737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.062123Z","title":"Vast: A vision-audio-subtitle-text omni-modality foundation model and dataset.Advances in Neural Information Processing Sys- tems, 2023","venue":null,"work_id":"c0c7b4af-cbc8-4776-944f-6ac02b1ea0a8","year":2023},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.519656Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:ad82c41ddf549d073856b12a52fe8d474323568c977ad524384682fd4375031f","observation_id":"23c14efb-88db-425d-b8a0-770b3f7f91d7","resolution":{"observed_at":"2026-08-07T05:04:39.064336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.04290","last_updated":"2021-11-22T09:35:30Z","snapshot_observed_at":"2026-08-12T09:10:48.303238Z","submitted_at":"2021-09-09T14:10:43Z","title":"Improving Video-Text Retrieval by Multi-Stream Corpus Alignment and Dual Softmax Loss","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.04290","snapshot_observed_at":"2026-08-07T05:04:38.521872Z","title":"Improving video-text retrieval by multi-stream corpus alignment and dual softmax loss.arXiv preprint arXiv:2109.04290, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.521872Z"},"links":{"cited_paper":"/paper/2109.04290","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:bb4bf0dee27614c6f4a85537592b8b1120ad250329356ed983822c3d6bb3d531","observation_id":"32d8a49a-cd82-4d9a-ac3e-fd9236325f46","resolution":{"observed_at":"2026-08-07T05:04:38.521872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.055866Z","title":"Prompt switch: Efficient clip adaptation for text-video re- trieval","venue":null,"work_id":"5c3c9b4c-edc7-49f9-9413-b18935ae80c0","year":2023},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.524699Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:f00e7957bb3919ef216f8f8c8a727e5ca1f5237e5fc2f7346188d364e8c5ea77","observation_id":"f48e58cb-3cbe-4924-ba15-f4b2fe443d8c","resolution":{"observed_at":"2026-08-07T05:04:39.058173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.049025Z","title":"Acnet: Strengthening the kernel skeletons for powerful cnn via asymmetric convolution blocks","venue":null,"work_id":"1e009285-dabb-489e-b43d-cd35fb7d5cf4","year":2019},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.526766Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:36ddf7221b8de2ebb889f8c30777fa3667fe01981ace2d2acaaffa0331633c72","observation_id":"97dfb5ab-823f-42b0-a475-1ea517437e7a","resolution":{"observed_at":"2026-08-07T05:04:39.051684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.042470Z","title":"Repvgg: Making vgg-style convnets great again","venue":null,"work_id":"19842ed0-3501-4a58-bb60-0a5f62a6eff1","year":2021},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.529008Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:e21b3b721efbd5a1c277002aa968d909e08a686f2b56ff340965a7f53619c693","observation_id":"41a91c59-7797-47da-890b-a138a5bbbdcf","resolution":{"observed_at":"2026-08-07T05:04:39.044688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.036038Z","title":"Improving clip training with language rewrites.Advances in Neural Information Processing Sys- tems, 2024","venue":null,"work_id":"52872c65-6d75-4831-b20d-7ceb67ea04c1","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.531373Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:ad0425d4f548a3035aeee2deae188728fe59cd3e05a52f7fc0469541276647fc","observation_id":"1a91173e-b2c3-4f50-a64c-20c3fbbf3af1","resolution":{"observed_at":"2026-08-07T05:04:39.038445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.029574Z","title":"Multi-modal transformer for video retrieval","venue":null,"work_id":"dc06819a-0437-4d5d-b247-9fe7b124bc4c","year":2020},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.533670Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:e81fee678ec48bdf112841b3650a51e8639a28417d339a22e8dd4c1925614fc9","observation_id":"32c04091-3f0f-4b2c-8cd5-ef0c393c6c98","resolution":{"observed_at":"2026-08-07T05:04:39.031867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.022945Z","title":"X-pool: Cross-modal language-video attention for text- video retrieval","venue":null,"work_id":"49f07794-fc77-4887-a188-4012ffecb3d8","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.535876Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:220702b6a0032e55570288e67b455feb67b316ad7577e52a6c15b8ee9875295a","observation_id":"9f8a736e-eac1-4dc4-acbb-27e3224e3cfe","resolution":{"observed_at":"2026-08-07T05:04:39.025277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-07T05:04:38.538033Z","title":"Accurate, large mini- batch sgd: Training imagenet in 1 hour.arXiv preprint arXiv:1706.02677, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.538033Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:21dc0ca57bfe0583c9566850f1bd34089e15ab583127f207e7b076d7bf93fb4f","observation_id":"093d98e5-9f5f-4bc0-af90-1ad33cb684ec","resolution":{"observed_at":"2026-08-07T05:04:38.538033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.016375Z","title":"Framewise phoneme classification with bidirectional lstm and other neural net- work architectures.Neural Networks, 2005","venue":null,"work_id":"dedfd61f-d50a-479d-b6f8-c054424a83b4","year":2005},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.540500Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:f8ba83a409cf639764fa71c1024f26bb7f70cd5101469f23ad1114f316d19228","observation_id":"55a5bf61-fbbc-45a9-8b9b-848a786f3dde","resolution":{"observed_at":"2026-08-07T05:04:39.018752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.542644Z","title":"Towards a unified view of parameter-efficient transfer learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.542644Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:9a529e82597cc873ad14907793f39d666ef6875d2b238ca46f1f79c1e99fa4e2","observation_id":"57571e0b-2ffa-47b9-996f-bb3704489bd4","resolution":{"observed_at":"2026-08-07T05:04:38.542644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:39.005692Z","title":"Secret: Self-consistent pseudo label refinement for unsupervised domain adaptive person re-identification","venue":null,"work_id":"7c67bd42-dc1f-41ec-8d2a-a03b721f2b12","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.544754Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:246be5cb1e4de18514795a428fd13c5361082f3c8958d655dafee4f318965749","observation_id":"63af92d2-9708-40f8-bd12-91613cb213f3","resolution":{"observed_at":"2026-08-07T05:04:39.008141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T05:04:38.546950Z","title":"Gaussian error linear units (gelus).arXiv preprint arXiv:1606.08415, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.546950Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:8bedf76f3b8a98e600e59183a8e6ad1073fae220bc4cdd0d9457d220e6718b86","observation_id":"3e4554c0-31bb-48be-b182-ab87fffcf3f1","resolution":{"observed_at":"2026-08-07T05:04:38.546950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.999111Z","title":"Parameter-efficient transfer learning for nlp","venue":null,"work_id":"398e632d-8cbb-4a8f-81f3-59d97427abdd","year":2019},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.549128Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:5264114b7738e3aa56a0d8f80dd528fcac751f0a1fc3ebe83fa7b06566197e24","observation_id":"82e4b745-76e2-4cf8-b463-6c323e630f29","resolution":{"observed_at":"2026-08-07T05:04:39.001674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T05:04:38.551012Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.551012Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:6831c1f067ef5a07fe0bfce27867710841b608137f6d4b4de53e61a4b1264643","observation_id":"6625c00c-b459-4507-a833-94e918b277d1","resolution":{"observed_at":"2026-08-07T05:04:38.551012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.992073Z","title":"V op: Text-video co- operative prompt tuning for cross-modal retrieval","venue":null,"work_id":"3a6bbd1b-846f-4206-b9bd-6990bc6e7b7f","year":2023},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.553091Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:c91926b63e87e6387cec1bd0f94bd9a417da92742857a5cab0a9406324083d29","observation_id":"0329a248-4f29-4b20-8274-a3a2a8f55253","resolution":{"observed_at":"2026-08-07T05:04:38.994442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.985583Z","title":"Vi- sual prompt tuning","venue":null,"work_id":"8befc7e4-7fb1-4af7-a268-adf578ab0921","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.555136Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:ef172d1f82671a5d4ebb2a6eeb5935c04433b7e603d3aa18b286bb8c9f5196f3","observation_id":"1c1c649c-d85c-4583-90dc-8678cbbb7fbd","resolution":{"observed_at":"2026-08-07T05:04:38.987864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.977870Z","title":"Video- text as game players: Hierarchical banzhaf interaction for cross-modal representation learning","venue":null,"work_id":"12984ad9-b86a-4203-8003-144b9c3d9580","year":2023},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.557171Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:7693635e852971b1add69f8a8ea3db405938a53d8e20d24f0661534bc98903d3","observation_id":"e48bacc2-7389-4021-ac23-3c6a801563a9","resolution":{"observed_at":"2026-08-07T05:04:38.981161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.970350Z","title":"Mv-adapter: Multimodal video transfer learning for video text retrieval","venue":null,"work_id":"dc406a7d-59d2-4261-af0b-22d47ce77637","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.559599Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:8c79575c69f74501d0d2c00de2c684539be22ecb24854c7954cec11eb2a912e4","observation_id":"c79fb09d-18d4-46c3-8db5-a85b3247de15","resolution":{"observed_at":"2026-08-07T05:04:38.973336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.963618Z","title":"Deep visual-semantic align- ments for generating image descriptions","venue":null,"work_id":"326abadd-5380-456f-93ad-a43e2692bb57","year":2015},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.561792Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:08f65151d1a910f131d16f571929e6458f9674d50e86220b0372934528547ece","observation_id":"903f48d1-5eee-4799-b8b3-5b30427eb340","resolution":{"observed_at":"2026-08-07T05:04:38.966127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.956834Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":"15844ece-9377-4fb3-97b3-41b06d54ea41","year":null},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.563869Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:f3ed736fcbcc5002f924d51dd0a4e5b1087efd29de8e10cb311ab6c5dc52ead5","observation_id":"66598c33-e1f8-43e7-8b1e-b96415f926ba","resolution":{"observed_at":"2026-08-07T05:04:38.959199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.949514Z","title":"Self-regulating prompts: Foundational model adaptation without forgetting","venue":null,"work_id":"7c439413-1e57-4f6b-ae5e-5c6ff26e7065","year":2023},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.566045Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:bb8305dcb56ec9ce9d5b217873aa86a88abf4078c272ffc94bf88baaf3021e4b","observation_id":"e1b60c54-ab64-4a65-b8c8-ddbdc45a349a","resolution":{"observed_at":"2026-08-07T05:04:38.952290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.941608Z","title":"Dense-captioning events in videos","venue":null,"work_id":"42f366b0-0d1e-4e1e-a2bf-73991fb712ad","year":2017},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.568125Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:924c066110309891f55b58200656fc444fcef643ed270c4c230e88e84ac137fa","observation_id":"be6e81ff-b0a4-4c84-96dd-753df8724479","resolution":{"observed_at":"2026-08-07T05:04:38.945206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.570005Z","title":"Courier Corporation, 1997","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.570005Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:a60243c0589e981a64a1b79deb605acb5302c83b31b0c194d88ddada5f296da9","observation_id":"37d14fd7-c852-4144-b417-c8a86a2965dd","resolution":{"observed_at":"2026-08-07T05:04:38.570005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.930151Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling","venue":null,"work_id":"1c5ed20d-4972-411a-9196-2bc11ee25c3a","year":2021},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.571998Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:b04696a4f0d0dc724e7803c1fbe9756478db8bddf52fe404e40b36f9a5c7f439","observation_id":"0a4cfc7b-c815-4033-bf1b-934abdf1bb8f","resolution":{"observed_at":"2026-08-07T05:04:38.932510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.923165Z","title":"Align before fuse: Vision and language representation learn- ing with momentum distillation.Advances in Neural Infor- mation Processing Systems, 2021","venue":null,"work_id":"37ec0590-f7f9-4e3f-b693-75794cbc0143","year":2021},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.573993Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:e953e00d2c5a758a136678a7b6ac4d62246508320a76c0674bd22b99a79cccce","observation_id":"92789e07-17c7-4199-bb2a-94da68badea5","resolution":{"observed_at":"2026-08-07T05:04:38.925580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.576455Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.576455Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:7b9eccd2f0e2365608a5aade346d13ddd90de089aea499964ac1bf9c3cb7de3e","observation_id":"6669b5e9-2724-497d-9548-25bcd1d9e577","resolution":{"observed_at":"2026-08-07T05:04:38.576455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.911887Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"2d923333-4041-4437-82a8-494cb250b428","year":2023},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.578756Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:00c73cee29571a64372a395e9866df579284af0b74e360b93830a0f708ee6aa3","observation_id":"472df5ca-6f3a-4ae8-8f94-535037418fd3","resolution":{"observed_at":"2026-08-07T05:04:38.914431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.904416Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"dfdbb8ae-7501-4f53-aff4-e1a84b44c0d0","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.580758Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:cc317e4db4372a3993f7ad2d07679e196ef99d3c51e13951bd7602c6c6eba015","observation_id":"2470c477-442b-4551-8d82-6811e1f69e24","resolution":{"observed_at":"2026-08-07T05:04:38.907185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.897567Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":"b34ec202-057f-4e37-8c27-ea17bb263b2e","year":2016},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.583189Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:588511e45dba4da6959708bbf79352e93336bd0c4c79961f27d3a4829e7810ff","observation_id":"c4330bd7-a4c8-4b56-b714-198727c40189","resolution":{"observed_at":"2026-08-07T05:04:38.900181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.890414Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning.Neu- rocomputing, 2022","venue":null,"work_id":"e065e1eb-a5f9-4a9c-8769-2f4f05016afd","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.585284Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:11bd7469d0177f2f0ac641e1fbca92191cec7672c051b57084ba3ff4f6957b08","observation_id":"e6db3627-e858-42d0-b83d-3907c87c4145","resolution":{"observed_at":"2026-08-07T05:04:38.893052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.883654Z","title":"Ea-vtr: Event-aware video-text retrieval","venue":null,"work_id":"7a984df3-bcc0-4e23-97cc-9e5f7dcdcb5d","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.587649Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:c4ac9a00633dbc85c3bc77899415dc7d561d8567caa440d2bf3431989cfa2894","observation_id":"d1a8c765-90e9-45e0-8f5a-0a79c9e6f4c4","resolution":{"observed_at":"2026-08-07T05:04:38.886181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.876394Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"164c2d54-1b1d-459f-9d3e-9f6170c37ef8","year":2019},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.589815Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:824f7f84a8605a4df91ec920fc9159c1ab37d525b94bd7789c325ce765f2b3ca","observation_id":"675359d4-1a39-4b9f-b23d-8ee148482d73","resolution":{"observed_at":"2026-08-07T05:04:38.879247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T05:04:38.591729Z","title":"Repre- sentation learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.591729Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:540285c37343017f09192c01bf510d5de9828908a12908602d42ebdff28c08af","observation_id":"cb69a46c-7eb6-4721-ab43-ac139614fd12","resolution":{"observed_at":"2026-08-07T05:04:38.591729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.594112Z","title":"Language models are unsu- pervised multitask learners.OpenAI blog, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.594112Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:d90fdb0f5f36eb24245f9c36436b88f92ed7dccf9d30e4752976d49b7b85e120","observation_id":"e4603b17-f9ba-4280-bf00-2e3f29eb956a","resolution":{"observed_at":"2026-08-07T05:04:38.594112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.865086Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"d092dad0-b9da-4738-9b92-974859ddaabb","year":2021},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.595898Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:278e7ee33540ab02649f9fe54eb3f70f072df734e13bca46c8c5015f9718709b","observation_id":"f5a8f1e4-476f-4dbb-aadf-fa421504ecd9","resolution":{"observed_at":"2026-08-07T05:04:38.868194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.857033Z","title":"The long-short story of movie description","venue":null,"work_id":"b9fc4706-4fdc-4ed8-91ae-6bbd715e474d","year":2015},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.597925Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:a7a1cf0aee2250cb41ebde9ca6d143fed441a2848519a0ec8c205f257e48cc3d","observation_id":"3ddc66e8-4b1c-40f1-a540-51cc0dec58eb","resolution":{"observed_at":"2026-08-07T05:04:38.859860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-08-12T22:53:08.708305Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-07T05:04:38.599960Z","title":"Tempme: Video temporal token merging for efficient text-video re- trieval.arXiv preprint arXiv:2409.01156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.599960Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:f5d1ae42b5b07a47c24dd990cb3cd5137d09c7f20e7f23777e36f06683ad5ecc","observation_id":"20943e42-6839-4b62-ad48-600cbe32f003","resolution":{"observed_at":"2026-08-07T05:04:38.599960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.849734Z","title":"X-reid: Cross-instance transformer for identity-level person re- identification","venue":null,"work_id":"64498e88-51f1-40f3-828c-481aec074ba6","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.602395Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:55edebf8f852e1cce48256c2f6d669c636a042389f83c5e00aa3133bbfa9bc47","observation_id":"5050387a-a682-48d0-87e4-b2319976e873","resolution":{"observed_at":"2026-08-07T05:04:38.852437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.841235Z","title":"Zerocap: Zero-shot image-to-text generation for visual- semantic arithmetic","venue":null,"work_id":"a5baa023-6484-46b6-a99e-57a797468d15","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.604375Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:f8d3e3a1abd140ad236d5b7cbfe49339a126116d3ceb4c17ded976d2e56d1814","observation_id":"a487edaf-4706-4cd6-8dc1-127138457d33","resolution":{"observed_at":"2026-08-07T05:04:38.845005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.834458Z","title":"Yolov10: Real-time end-to-end object de- tection.Advances in Neural Information Processing Systems,","venue":null,"work_id":"85a3dd15-779c-4e96-9774-6574a4ae562b","year":null},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.606186Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:cc473ebe2b1fc08e7b594afb5b4ede2c56e5b151656db79596cb69b88b3f0ae5","observation_id":"f644fda7-d10d-4b96-8176-32ee03ac7e91","resolution":{"observed_at":"2026-08-07T05:04:38.837245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.825066Z","title":"Text is mass: Modeling as stochastic embedding for text-video retrieval","venue":null,"work_id":"f6a11fbd-5979-40b6-8aae-3756aa8e99b8","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.608355Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:3e24ff5dcb9969e3a16b77d14b25b4598220c476780c0a81b13c66e90297e03a","observation_id":"aaef0ede-80b5-4deb-9093-06115b7bdf9d","resolution":{"observed_at":"2026-08-07T05:04:38.828037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07111","last_updated":"2022-03-14T13:55:33Z","snapshot_observed_at":"2026-08-06T20:50:04.667147Z","submitted_at":"2022-03-14T13:55:33Z","title":"Disentangled Representation Learning for Text-Video Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07111","snapshot_observed_at":"2026-08-07T05:04:38.610482Z","title":"Disentangled representation learning for text- video retrieval.arXiv preprint arXiv:2203.07111, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.610482Z"},"links":{"cited_paper":"/paper/2203.07111","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:de2fc59e734dec0c6a8d46628a7340e79cc6cf82e342c1332307f65e2803f85e","observation_id":"318d79f3-c194-4bb6-a2ea-277328ae9909","resolution":{"observed_at":"2026-08-07T05:04:38.610482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T05:04:38.612750Z","title":"Internvideo: General video foundation models via generative and discriminative learning.arXiv preprint arXiv:2212.03191, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.612750Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:14579412a4917b5a17a696422c1a72c5aa88f5f28f9b092fac0d3310fc548d62","observation_id":"300d6d22-2ed4-4a14-89bc-5e3f9fe69607","resolution":{"observed_at":"2026-08-07T05:04:38.612750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.817108Z","title":"Cap4video: What can auxiliary captions do for text-video retrieval? InProceedings of the IEEE Confer- ence on Computer Vision and Pattern Recognition, 2023","venue":null,"work_id":"f305dc79-d1f8-45f4-8fac-b9345789fa6f","year":2023},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.614769Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:a6fb303d353b736b4b22bba1b03d381cf3461aaf9d6148fce54ad159c9d11d4f","observation_id":"13d9f64f-a526-4fb3-8666-890cc69a6917","resolution":{"observed_at":"2026-08-07T05:04:38.820295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.807755Z","title":"Demystifying clip data","venue":null,"work_id":"df147d7e-5e1c-418b-a58c-bf90abc3d4ab","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.616890Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:d7a4c7c3f77fbd19f50dcad9a217edfa16066db180b66d153f4f99b891248ef6","observation_id":"d3bb257c-fec5-4d6a-b455-d1824b8df63d","resolution":{"observed_at":"2026-08-07T05:04:38.810675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.798864Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"5aeef146-68a8-4205-ba5e-bf5614126e59","year":2016},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.618838Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:1ef363c59b85202721a6718f34f35d86adb5b6e7313e411f5b65c692a04475f3","observation_id":"62a76fcd-6b96-400d-a602-ea4d4ecd08fa","resolution":{"observed_at":"2026-08-07T05:04:38.802277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.791075Z","title":"Show, attend and tell: Neural image caption gen- eration with visual attention","venue":null,"work_id":"172fa46e-ac80-46e5-8158-a84d026f41ac","year":2015},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.620852Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:68561a74fb5c6567e32502d4ca1075cc6e907df3999a6a626a8f7813c33e5baf","observation_id":"a2d4fc0f-88d0-4624-877e-0ea3b83a0e31","resolution":{"observed_at":"2026-08-07T05:04:38.794086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.782417Z","title":"Clip-vip: Adapting pre-trained image-text model to video-language alignment","venue":null,"work_id":"15f88510-09cd-4719-8897-1adc1933fe80","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.623017Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:ebe7f55e4ee9b83065e780b8a05bf1a97360b6edb1be347b360b165c8d5f974d","observation_id":"ac8193da-961f-4068-b1fb-a10e92076d7c","resolution":{"observed_at":"2026-08-07T05:04:38.785496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07422","last_updated":"2025-02-13T09:32:44Z","snapshot_observed_at":"2026-08-12T23:03:49.662697Z","submitted_at":"2024-08-14T10:00:16Z","title":"LLMI3D: MLLM-based 3D Perception from a Single 2D Image","version":2},"cited_work":{"arxiv_id":"2408.07422","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.07422","snapshot_observed_at":"2026-08-07T05:04:38.677859Z","title":"LLMI3D: MLLM-based 3D Perception from a Single 2D Image","venue":"cs.CV","work_id":"fb4e934a-3912-4af7-81fe-b5e991a7abad","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.625078Z"},"links":{"cited_paper":"/paper/2408.07422","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:325ef1959bb4142a9fd0f72f0dab5036b4af9aafee7f6ec9f70ea9ae4fb7cd9b","observation_id":"4429bc67-e6b9-413d-8cfc-0eeb2161aa64","resolution":{"observed_at":"2026-08-07T05:04:38.682071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17261","last_updated":"2025-05-30T15:15:51Z","snapshot_observed_at":"2026-08-12T17:00:33.392243Z","submitted_at":"2024-11-26T09:37:59Z","title":"HEIE: MLLM-Based Hierarchical Explainable AIGC Image Implausibility Evaluator","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17261","snapshot_observed_at":"2026-08-07T05:04:38.627382Z","title":"Heie: Mllm-based hierarchical explainable aigc image implausibil- ity evaluator.arXiv preprint arXiv:2411.17261, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.627382Z"},"links":{"cited_paper":"/paper/2411.17261","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:f7be391e0cf27765e9e38ced03b808b503237f4183e0943d2a1420a5a52c895a","observation_id":"c7252e5e-663e-4109-b549-6fbcafb3c3dd","resolution":{"observed_at":"2026-08-07T05:04:38.627382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.775209Z","title":"Dgl: Dynamic global-local prompt tuning for text-video re- trieval.Proceedings of the AAAI Conference on Artificial Intelligence, 2024","venue":null,"work_id":"f3b2321d-1294-4b33-aad9-eeca914fa6d1","year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.629860Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:177ea3522624a9b5be214541c21562368ab6df971df48b84d4cb321a6c7e3a5e","observation_id":"cbdea981-e643-4f0b-9a62-f98e4d62c816","resolution":{"observed_at":"2026-08-07T05:04:38.777722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.768423Z","title":"Cross-modal and hierarchical modeling of video and text","venue":null,"work_id":"a7d197b2-7782-4ac6-b55f-78973db55b62","year":2018},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.631911Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:9432dcb348c77629f48d230195977240f7e91b1c200c06738f938c6de5795e61","observation_id":"e338126f-3b20-4a2c-813f-89a4f1771003","resolution":{"observed_at":"2026-08-07T05:04:38.770886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04673","last_updated":"2022-06-14T12:15:55Z","snapshot_observed_at":"2026-08-11T03:48:11.885296Z","submitted_at":"2022-06-09T17:59:58Z","title":"Neural Prompt Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04673","snapshot_observed_at":"2026-08-07T05:04:38.634022Z","title":"Neural prompt search.arXiv preprint arXiv:2206.04673, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.634022Z"},"links":{"cited_paper":"/paper/2206.04673","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:a595fe6bff639451628bc0cbdcb1830b1db767ac00fadef162a814c74186eab6","observation_id":"d77fac82-44a4-4399-8190-8b237b154d11","resolution":{"observed_at":"2026-08-07T05:04:38.634022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.761346Z","title":"Conditional prompt learning for vision-language mod- els","venue":null,"work_id":"125416a8-16a1-4c8b-8de2-da37b45cfe72","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.636387Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:f4c376ca0c12b21a74bad27e8bc6c4c490c14e1ec829b1a9a134e1cd7d76cd6a","observation_id":"7e438381-88ec-420d-8564-76c6862d6121","resolution":{"observed_at":"2026-08-07T05:04:38.763763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.752382Z","title":"Learning to prompt for vision-language models.Inter- national Journal of Computer Vision, 2022","venue":null,"work_id":"2bc5a9ff-72ca-48e6-bab8-17bde715aa7c","year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.638481Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:535268d4619d9d5941c8a92145b5840d76a15cd31ba570483c165d5611484a48","observation_id":"60c6db4a-d10a-4ccb-b7c0-3814677297bb","resolution":{"observed_at":"2026-08-07T05:04:38.755584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:38.744979Z","title":"14,αandβare set to0.3and1.0, respectively","venue":null,"work_id":"09c190b8-09d4-4ba1-9551-e45d586bbf76","year":null},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.641568Z"},"links":{"citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:e0ea62c89be9302c9366f49348f5aedffcacae19036d64edcc2994f09a9b4ec0","observation_id":"207f0633-d482-4615-9278-a64b4d1f201a","resolution":{"observed_at":"2026-08-07T05:04:38.747510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T09:06:58.049593Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":48},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2506.08887."}