{"as_of":"2026-08-16T08:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4fc761f6642eff82ee5b03c7e5cc7e1234e32a45a3bdad7aa2ae5a914681fbca","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T10:40:01.902254Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.20597/citation-record","integrity":"/paper/2601.20597/integrity","json":"/paper/2601.20597/citation-record.json","paper":"/paper/2601.20597"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f38fcb04-8510-4d54-aaaa-32b96f9c4487","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:aaf293cbf3cbf06e906695cc3acd86a11704b5c73d33ffc72d09ab01b2243b0b","observation_id":"1116804f-5659-4cc0-9b45-1d9667496262","resolution":{"observed_at":"2026-05-16T10:40:51.709794Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ashok, K","venue":null,"work_id":"3f8330f8-18da-4ed7-8d95-25be01ca6a6e","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:16335842c0527e2281c3ded013829ee787e7b57ecd534f1ad677134ae8e31439","observation_id":"4f82f5e7-7c65-4c5d-9e40-dee810632c0d","resolution":{"observed_at":"2026-05-16T10:40:51.714676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"56020771-2490-4ac2-849d-1b7866e9b9ce","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:8ce50ebec5caf18a3211531ff9124878fb9fecb5a0dca2537e23916680711378","observation_id":"6e0b33d6-b5fd-43b8-860c-b96508f0c9e3","resolution":{"observed_at":"2026-05-16T10:40:51.707392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Non-autoregressive cross- modal coherence modelling","venue":null,"work_id":"c72334bb-f015-4091-990e-054c3fa1024a","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:24f934a1c6c5ecb09aeb3295fc076c0cbccc20cca7012d63b069cced80c65f19","observation_id":"37f15509-ad8c-4d42-87e0-b2800cb4290c","resolution":{"observed_at":"2026-05-16T10:40:51.716828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"5053359d-2a0b-4732-8e7d-e1d4a7d54093","year":2015},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:e98aa7b7e3084478ea812c0b718f289b5bdc5544a75e8b9d27fb87f4ed7f2413","observation_id":"1982bc2e-ebc8-4b69-9931-0a75c947a475","resolution":{"observed_at":"2026-05-16T10:40:51.705324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online fast adaptation and knowledge accumulation (osaka): A new approach to continual learning.Advances in Neural Information Processing Systems, 33:16532–16545","venue":null,"work_id":"efab7ea7-900e-42ed-a967-1b6be72ef8af","year":2020},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:5ca8fe0f5bd1b43789d51b7bf795e1087625d9524d6c76f82f2a53f89eb8a5c9","observation_id":"fdc776cf-03f6-418a-a7fd-e847250d8444","resolution":{"observed_at":"2026-05-16T10:40:51.709995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clumo: Cluster- based modality fusion prompt for continual learning in visual question answering.Journal of Artificial Intelligence Research, 83","venue":null,"work_id":"529f91f0-8c9c-4110-9170-a82254120b30","year":2025},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:681cdbffd78c83443e84ea4933f3efa25b493efdcb04933eb855c5a1aa8f5bd4","observation_id":"dcab8dd2-25f9-4a20-9dff-5d406f0fad9e","resolution":{"observed_at":"2026-05-16T10:40:51.712837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Castro, Manuel J","venue":null,"work_id":"9774654a-e3eb-4a3b-8ab5-9d2bf9da31bd","year":2018},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:2175016219e6ccae1ed70be05b3a5d25e4526f9585562e0012799ea22b2dd711","observation_id":"7681fd1e-64b4-4899-8472-6a0cfa999907","resolution":{"observed_at":"2026-05-16T10:40:51.701475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-grained video-text retrieval with hierarchical graph reasoning","venue":null,"work_id":"d18dc915-d054-40cd-b05e-90be61475d2a","year":2020},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:bd04133a34daa8a18cc54b4a7668bb7e25518b857e2f445e0b37cef5b77119d4","observation_id":"3b2f0bbb-149a-4ba9-8c8a-369115acf023","resolution":{"observed_at":"2026-05-16T10:40:51.694266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision- sensor attention based continual multimodal egocentric ac- tivity recognition","venue":null,"work_id":"3fb5bcb2-d976-40c0-9711-8f55c3bd74f1","year":2024},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:1c890f0a8fc99119816f2971e9617d2e421437b8de93232fa7aeb914026d1ffe","observation_id":"da9974f5-19a1-4cfb-9e61-c1b7a53ee94f","resolution":{"observed_at":"2026-05-16T10:40:51.703508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teachtext: Cross-modal generalized distillation for text-video retrieval","venue":null,"work_id":"c7813ecd-8ed1-48b0-93e2-e70490ea9820","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:4595e93cbdf3aa450304e1c76a192e3bf563d7b1db5e682954032b61f74801d4","observation_id":"169e921f-6c01-41e7-abb1-4d21d640f6a5","resolution":{"observed_at":"2026-05-16T10:40:51.705551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.09248","last_updated":"2022-07-20T02:21:33Z","snapshot_observed_at":"2026-08-13T15:00:50.966429Z","submitted_at":"2022-07-19T13:03:14Z","title":"Don't Stop Learning: Towards Continual Learning for the CLIP Model","version":2},"cited_work":{"arxiv_id":"2207.09248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.09248","snapshot_observed_at":"2026-06-29T23:14:01.248032Z","title":"Don’t stop learning: Towards continual learning for the clip model","venue":null,"work_id":"444360a3-7095-4848-bde3-b9e0a8f6828f","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"cited_paper":"/paper/2207.09248","citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:9b183258ec75e9a55c7bc05b1e8aa2a5f21ee6ffce5bd61798054f5ed69fd14d","observation_id":"8c686c0e-6338-41a2-9249-55373b401d8d","resolution":{"observed_at":"2026-05-16T10:40:50.904706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Podnet: Pooled outputs distillation for small-tasks incremental learning","venue":null,"work_id":"ce4fe070-55d2-4292-b719-723dad1be60f","year":2020},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:83e3db691e7a38b7cda7b240b62f6ec2172ffee6a3f46ca4dfead5890e8c2c18","observation_id":"227e82ff-e973-409c-b3cb-f3a67b75ef71","resolution":{"observed_at":"2026-05-16T10:40:51.696497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A feature- space multimodal data augmentation technique for text- video retrieval","venue":null,"work_id":"1c6fb986-1824-44cd-a9e6-eb6ad78787ef","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:601fbe8b0ed9813e18a1cab7a898ddcfd52362d1fc94e4abb10739589f5b05aa","observation_id":"d136fbec-b734-4c12-aa50-905633e73a58","resolution":{"observed_at":"2026-05-16T10:40:51.598654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uatvr: Uncertainty-adaptive text-video retrieval","venue":null,"work_id":"b2ca7630-a7e7-40f8-a3c1-c97d8a6aeede","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:12118fdf55bdf20acc344d3b805ec5c754cc46f700363819c9585b7facf956ef","observation_id":"cd9416df-fac6-48d9-91d0-cdce30f56e10","resolution":{"observed_at":"2026-05-16T10:40:51.600733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transferring image-clip to video-text retrieval via temporal relations.IEEE Transactions on Multimedia, 25:7772–7785","venue":null,"work_id":"3d06e8bf-ec8e-4a30-b035-3f50569d73be","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:6f107f32838251f7c1ac56acad7d083354deb55a4a7c06cf264581dee8a02ee8","observation_id":"c99db1a2-c20f-4648-a484-33184fd37811","resolution":{"observed_at":"2026-05-16T10:40:51.618257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-modal transformer for video retrieval","venue":null,"work_id":"b1cfbced-5efd-494c-9895-ea84f2e681a6","year":2020},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:3a2415288a7c6ce4a7c79b018d07b9ebf0ad4416ea81dd11bb8d67feda7b7833","observation_id":"c0b5fd60-b1d3-4dee-b8fa-af287fae4eef","resolution":{"observed_at":"2026-05-16T10:40:51.620652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X-pool: Cross-modal language-video attention for text- video retrieval","venue":null,"work_id":"9e37a8f3-a150-46a1-870c-dae272dd1ba3","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:ab30bee071051d117391db8e992da93730d3f0d1c61c3e1b12446f364096daa7","observation_id":"52c14299-a180-40fa-93af-00ca30203a9a","resolution":{"observed_at":"2026-05-16T10:40:51.625377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dyson: Dynamic feature space self- organization for online task-free class incremental learning","venue":null,"work_id":"788e01db-c57b-4a80-9a17-8f073d6eade2","year":2024},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:494bf27af5754e8916e4ba30ebb7d1568bcccb88d5a898f65af5fd96c17526d5","observation_id":"ea1e9ff3-71d0-499b-b885-fedd0577eae9","resolution":{"observed_at":"2026-05-16T10:40:51.630233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning a unified classifier incrementally via rebalancing","venue":null,"work_id":"04cc1a49-178b-4524-bb6e-c9a264b37940","year":2019},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:9370923bd1668a98fc69319104f8347a715939ce94bd565894b9b2c2829f3681","observation_id":"235bf544-8942-41bd-9e04-cc4ce4c8aa7b","resolution":{"observed_at":"2026-05-16T10:40:51.639797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Curiosity-driven class- incremental learning via adaptive sample selection.IEEE Transactions on Circuits and Systems for Video Technology, 32(12):8660–8673","venue":null,"work_id":"d5df7971-2ab7-40c6-83d7-c1cbbba46923","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:da50e7270c573469fa91fba6e3b4733d4e146ee7311a8b51a6ffa073011db8af","observation_id":"23e57aa6-d95f-4629-a46d-21e504b01840","resolution":{"observed_at":"2026-05-16T10:40:51.635083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distilling causal effect of data in class-incremental learning","venue":null,"work_id":"94673169-104d-4b9c-911c-015fdd9d259e","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:a797acf64beb14c1253100882bd3ec9b1be02eca527f3efce1e908b6f25b9ea4","observation_id":"e604ae7e-8b2e-4f53-a92d-f059bf6d3837","resolution":{"observed_at":"2026-05-16T10:40:51.675445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural collapse inspired federated learning with non-iid data","venue":null,"work_id":"98d6bab4-6d2c-4c0d-83cf-f8e515810942","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:705125de6d58b30be43dfd557850c17f1c32bda8f78b53fd9c9f25312810830a","observation_id":"8480298d-d87b-4d0b-b8ea-1a0e5e4af4bf","resolution":{"observed_at":"2026-05-16T10:40:51.609558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cfc59e08-cc10-4942-856b-f8371186a551","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:d38278708eab11acba3aa7d88a5d4176257bbafc55baa07094a03c816e284bfc","observation_id":"4dfa2c9d-afc7-46a9-8162-c85451acfb4f","resolution":{"observed_at":"2026-05-16T10:40:51.582087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"97003b38-28b1-431b-ad1b-b9f362d6a34b","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:2ef0be944a4712a5963f5589fa06aa61e67c1300b17e2973e55844368d030605","observation_id":"8b9fcda3-507a-41ba-92c2-0993e30f8931","resolution":{"observed_at":"2026-05-16T10:40:51.573147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hybrid-tower: Fine-grained pseudo-query interaction and generation for text-to-video retrieval","venue":null,"work_id":"16d3be4b-77b4-42fc-83a9-2cd1d0355424","year":2025},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:d90ab5d0f85eb8dc8017eb8dbe800be54d81de06c0aa816539486f51c71d0c55","observation_id":"ddb1b485-f960-4d80-b661-c6fd3649bfd3","resolution":{"observed_at":"2026-05-16T10:40:51.567018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bakker, Nicu Sebe, and Michael S","venue":null,"work_id":"f41c6581-a72e-48df-a7c0-9de9fb623f63","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:fce64657150ea8e40e2d951ab5ab3685e47d63613cefc174ad043d7f98e89baf","observation_id":"ab85f800-dd7a-4da5-a188-4f29c50e368d","resolution":{"observed_at":"2026-05-16T10:40:51.569168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic integration of task-specific adapters for class incremental learning","venue":null,"work_id":"3a7bbe08-bca3-4bb9-9bb9-28221b527f1d","year":2025},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:4738c2f8cac78452c2fded042f830ea5512483cbd0730a7645d5ed6c058ec979","observation_id":"afe372b3-fb8c-47ef-b4ee-d415d6312775","resolution":{"observed_at":"2026-05-16T10:40:51.576420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-modal inductive framework for text-video retrieval","venue":null,"work_id":"58038497-2a42-4135-8e85-3c4b38d5ea2c","year":2024},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:5d49a6e913c0d2479341661eb7d6e93923013683681edb57f25b1ccf63f37cf5","observation_id":"a2dd7117-829c-4ad6-ba6f-a74700987012","resolution":{"observed_at":"2026-05-16T10:40:51.658278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning without forgetting","venue":null,"work_id":"72a5f71b-35e8-4c91-8397-86baf20b32a6","year":2017},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:e18963ba4528b26c1d7f99f8f956460600fed56c53e6d5906f2c0342b50dc99a","observation_id":"3bcd1dc6-93b9-493d-8c62-a0ebf4ce32be","resolution":{"observed_at":"2026-05-16T10:40:51.663084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anchor assisted experience replay for online class- incremental learning.IEEE Transactions on Circuits and Systems for Video Technology, 33(5):2217–2232","venue":null,"work_id":"fec18764-cd4d-40f8-9d45-3211cfcc6c28","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:26b313964f1a788097a8d0a4c0ed8d370416a27cb1b748b5db41d894ff21384c","observation_id":"edebad7e-2da5-4a8d-9e83-d68f5976bc11","resolution":{"observed_at":"2026-05-16T10:40:51.667584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing.ACM Computing Surveys, 55(9):1–35","venue":null,"work_id":"d2cf53d5-c804-4235-9ce4-f4894e2367b3","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:6c3ae9ead90802ce9a0c472ccc7024b1f59172f6edc9dce2538d6c29f038f4f3","observation_id":"b3b04c33-f98c-4d7e-b06a-1c2d3b4ab5ff","resolution":{"observed_at":"2026-05-16T10:40:51.687741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Use what you have: Video retrieval using representations from collaborative experts","venue":null,"work_id":"5c6da124-f566-43e2-b173-3b42d5d695c3","year":2019},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:a5b042ed1e4bc224aeca5efa00d99c8501e6c1512c6d149a21796547a64ecddc","observation_id":"6f9179a4-001e-4107-967b-5669b4a120f1","resolution":{"observed_at":"2026-05-16T10:40:51.645249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptive aggregation networks for class-incremental learning","venue":null,"work_id":"36339042-ac9b-4a85-8e95-43a01cbca58c","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:cc3ad4d026863a4fbcb26fd0da5e57bcb032514e14b590919aef4e9b3af3bdd2","observation_id":"eb99e289-a5c8-44d6-bc01-1f01e42901f9","resolution":{"observed_at":"2026-05-16T10:40:51.647251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ts2-net: Token shift and selection transformer for text-video retrieval","venue":null,"work_id":"2a1cab95-c028-441c-a011-fe6cfdd8fc9b","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:83286e47f9f7904c90a40dc194660199b528a87582527439c2d368a3770a752c","observation_id":"dd4eb987-5ff5-4cc8-8321-8b6609bd0d7d","resolution":{"observed_at":"2026-05-16T10:40:51.640901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning","venue":null,"work_id":"8f668226-b0fe-4998-9eb6-f8779a97ca53","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:b07ecdce79f5e406bf4c8c0ad1535027b9f4a39f47d49549418393ece4996c79","observation_id":"a06aaf53-a0db-4a1f-8699-a4c9bf11e4e1","resolution":{"observed_at":"2026-05-16T10:40:51.643129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X-clip: End-to-end multi-grained contrastive learning for video-text retrieval","venue":null,"work_id":"c10bfd44-6482-49fb-8edc-c392d8332fcc","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:1d3260690ad3d1098f6d703cd379a4124f9364dee82e738149010753efe17b5f","observation_id":"b9c1695b-e4ae-4135-9907-1c55d730415a","resolution":{"observed_at":"2026-05-16T10:40:51.649523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Packnet: Adding multiple tasks to a single network by iterative pruning","venue":null,"work_id":"c5673c99-891c-41af-85e5-022e14f099f0","year":2018},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:cf5a1a6b1e6a468767f453709e290bcf81a1435d41aea243ee0573806ca367c9","observation_id":"cc713bd8-6722-4803-9dcb-d562db5fcfc9","resolution":{"observed_at":"2026-05-16T10:40:51.674326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prevalence of neural collapse during the terminal phase of deep learning training.Proceedings of the National Academy of Sciences, 117(40):24652–24663","venue":null,"work_id":"b405f0f0-bcc6-4255-a4d8-8cceed530f4e","year":2020},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:dfe9d91a7240721c9f4a3a041e173b51fbb0e8643877547134654e9ca959206d","observation_id":"69ef110c-35c8-4964-b321-bec612227c23","resolution":{"observed_at":"2026-05-16T10:40:51.661076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prabhu, P","venue":null,"work_id":"e5d7f7c6-bcda-48a7-8997-08f71151f48d","year":2020},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:c18de892875a959b2f188747b4de676e4b02ba2d832dd741c659183b54b6dfa7","observation_id":"ca335b31-e5ac-4caf-8464-f3fcb3b3b882","resolution":{"observed_at":"2026-05-16T10:40:51.591003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"8c07e7e3-72c8-49a2-afed-1913d7898042","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:7d9558573ed6dbc0a2c22ba175b70f49afea1f93944e0de35a1519e82ef63a9b","observation_id":"396540dc-c96c-4a1c-9ffd-0ff774ac9832","resolution":{"observed_at":"2026-05-16T10:40:51.605292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"De Melo, Benjamin Van Durme, and Rama Chellappa","venue":null,"work_id":"3e70e44c-f519-4883-ab4f-3399b60bd089","year":2025},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:62f5bbee0c853e1cc602c383d9e2f261754cb6f70c33632ea52b67a540ce436e","observation_id":"c2124e43-fd82-4aff-86a1-65bc36a5367d","resolution":{"observed_at":"2026-05-16T10:40:51.620155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"28643026-4fb2-43d6-860a-0e094be0fd66","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:42d37fa232f3d017fd6940238c812c144041f2dfb7ad173b8df8e9199eb52ee3","observation_id":"db425f6b-aa98-4063-b043-ce955592cef6","resolution":{"observed_at":"2026-05-16T10:40:51.591571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Relation triplet construction for cross-modal text-to-video retrieval","venue":null,"work_id":"8991e47b-9616-4d99-9c7a-9416c0546329","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:41645068b11c5978a73e7cc47957572b6176b41a8d94684f8a13d357076aac6b","observation_id":"01acc3f3-6af0-4b52-971d-ed6d2bd58277","resolution":{"observed_at":"2026-05-16T10:40:51.661864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatial-temporal graphs for cross-modal text2video retrieval","venue":null,"work_id":"28581551-b298-490a-b208-7402322b3f94","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:7fe50b18726dc04bcd06ea328f25dc0d399565273dd21e3f3635c887914167b9","observation_id":"1e61f864-8c9c-446a-8fd5-297b26d80f5d","resolution":{"observed_at":"2026-05-16T10:40:51.666346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning endogenous attention for 12 incremental object detection","venue":null,"work_id":"0e3d138f-dd49-4d28-b862-c42a97c4204a","year":2025},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:35b4c3fcf5bef8d2a918a4215e4f45ad44f7b63ffe481b0fd96126805806d08c","observation_id":"1921058a-4e86-402b-8514-441de59d9813","resolution":{"observed_at":"2026-05-16T10:40:51.648600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal continual learning using online dictionary updating.IEEE Transactions on Cognitive and Developmental Systems, 13(1):171–178","venue":null,"work_id":"50c2e798-fc5a-4cfd-b53e-70558f950d64","year":2020},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:695bb3117419a14e0664a624f9fe479a0feb38ac8cab7738812897ab135928f3","observation_id":"a58a7f6e-660d-4dac-b416-4111b8a21b09","resolution":{"observed_at":"2026-05-16T10:40:51.651198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9f5a82dd-5678-4ee5-aec3-a2cc1a15933a","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:242a03c0b553a9e578ec4f4576c09fb1b52d9f7afa5c68f960340346471260a7","observation_id":"3fdd9fa0-b3d5-4eb6-b708-802f7c1f237c","resolution":{"observed_at":"2026-05-16T10:40:51.669820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Topology-preserving class-incremental learning","venue":null,"work_id":"487b2e6f-34e2-49aa-8036-084958391a54","year":2020},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:a0c567db607b781f442252d39f9789d030c378ccb30a3158091d3a0c176d19b6","observation_id":"8f1985a2-8ea5-4538-ae4f-cee317aeadb9","resolution":{"observed_at":"2026-05-16T10:40:51.670974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"new” while consolidating “known","venue":null,"work_id":"d2dedaca-b2b6-473f-93a8-8fd72870a3ad","year":2020},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:ac1a601752d83edaee8085cef9062d52db00613f76e469bcf8adda15ae69bb63","observation_id":"b7428cfb-c325-49d1-b8a4-7d36a9a4d9cf","resolution":{"observed_at":"2026-05-16T10:40:51.682933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Holistic features are almost sufficient for text-to- video retrieval","venue":null,"work_id":"dbda30de-ebd4-4c60-b754-619192667634","year":2024},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:f278a6a8f5cb66a28fe5f9ab7d25e3a3285863853961c6c8e0a90a7e055622b4","observation_id":"e983ac38-969c-421f-ace1-8e98a8a855b8","resolution":{"observed_at":"2026-05-16T10:40:51.615710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dualcp: Rehearsal- free domain-incremental learning via dual-level concept prototype","venue":null,"work_id":"df8892db-6fa6-48c0-a543-065f6b14e9aa","year":2025},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:474e4da4d0437748782adb7d580e4b713d0d5f6362d49f740c6d23be9da98a4a","observation_id":"c3ecd1c6-91d7-406b-82a4-28246964eb74","resolution":{"observed_at":"2026-05-16T10:40:51.636271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semantic knowledge guided class-incremental learning.IEEE Transactions on Circuits and Systems for Video Technology, 33(10):5921–5931","venue":null,"work_id":"1affd163-12a6-493a-8079-97f0d35797ef","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:a508c90c4668101b4a66a5a3a52b2de30402d1bd6b9e86770a1c02802a496947","observation_id":"2ef25a4f-1dcc-43b9-b5cd-c8d759a4a279","resolution":{"observed_at":"2026-05-16T10:40:51.679224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Non-exemplar class-incremental learning via adaptive old class reconstruction","venue":null,"work_id":"dc331865-353c-4f2b-9bf4-2fb7d48d836f","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:9e4bfda172682ab61b4e6d09bd51e6af4173ec9869c3f470825d5c94df597e43","observation_id":"5be729ff-f5be-4411-86c5-2238436c0c81","resolution":{"observed_at":"2026-05-16T10:40:51.676623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T2vlad: Global-local sequence alignment for text-video retrieval","venue":null,"work_id":"47f913dd-37b4-43d5-a694-8902a0f8df4e","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:9d8155f311fd0f99f1490c0e898a085f442d6472ab47e799d9507a8ee705cd51","observation_id":"b24ac00e-0264-4a54-9f7b-0aca9746794b","resolution":{"observed_at":"2026-05-16T10:40:51.663904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8d20fb2f-f2dc-4e50-afba-77f42465fcc5","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:9b5fd72428218806ec5e2d75ed9cd665382573bd1f34174f217dc60ecd0739fd","observation_id":"2a1936ad-5e4f-43f7-9ece-dedbc41a08e5","resolution":{"observed_at":"2026-05-16T10:40:51.609246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unified coarse-to-fine alignment for video-text retrieval","venue":null,"work_id":"837bcd87-12ff-4113-8a5f-53079ee8e77a","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:67247230d56c9fd322cc214305af5aa58201ecaeaa0f7c412afeee9bf45c52b2","observation_id":"37d9e1c2-d717-4481-b2c1-fdb53fc4fe02","resolution":{"observed_at":"2026-05-16T10:40:51.624099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d33fe565-7a18-43d2-baaa-6eeab399bf59","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:daa7cb5bc39ae33c0d798c5cfb19423f56199564717344859bb1713b90b29ec5","observation_id":"72e1b749-ee1a-482f-8266-452eb054661d","resolution":{"observed_at":"2026-05-16T10:40:51.683137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"316bac61-de3e-462a-8b65-b77a344c4202","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:6b9c51852c9b3e558afaa118e5d037c7f54d37b4727b312be1eeaf60793e972b","observation_id":"f599089f-2aec-42db-b05b-dcf40d1976cc","resolution":{"observed_at":"2026-05-16T10:40:51.681235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Striking a balance between stability and plasticity for class-incremental learning","venue":null,"work_id":"0156f2c7-274b-44b4-a52f-d86da8330710","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:253f6507e46830bd9dfbf70067e8eff002d8dc5efcf18015c3ba7966b3e60cb9","observation_id":"8575d487-c113-46d4-b50c-953a9fb3053d","resolution":{"observed_at":"2026-05-16T10:40:51.622234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large scale incremental learning","venue":null,"work_id":"24d5dd27-0c0a-4cc3-9584-9d7129ede3ca","year":2019},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:b6d6ece1ecad6910817bb42197cd2b70ff845714760372540a7efbcffb643e16","observation_id":"bf5cbcf8-e89d-44a7-b88a-955fb23350a6","resolution":{"observed_at":"2026-05-16T10:40:51.628196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"4fd033ba-face-4254-a3a8-1608ec2a8dac","year":2016},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:871ff3ba0c9e7bf19420ff52dd6de7a689996b80b321cefa67d331ce23ceae00","observation_id":"76bf1e52-9479-4f74-ad57-51d64cfcb98e","resolution":{"observed_at":"2026-05-16T10:40:51.638408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip-vip: Adapting pre- trained image-text model to video-language alignment","venue":null,"work_id":"e801a8a6-d9d6-488d-9563-76a2cf98ee55","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:1e5c9880ab69d3cf8db80f6daf2c9ba98a3e41954eb7b4ecf086d4c87c24dab8","observation_id":"323b25a9-ab67-4122-84d9-172ef450bf81","resolution":{"observed_at":"2026-05-16T10:40:51.618052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Der: Dynamically expandable representation for class incremental learning","venue":null,"work_id":"9d2ec520-b18f-44aa-9a6c-36a1e3e37cf2","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:9406c014c3dd872bf8bba0712d2b04be072a3add82097db7e5df0b078e2e6949","observation_id":"3a3e8bb0-5807-46a3-bcf9-5b05ae7d85a1","resolution":{"observed_at":"2026-05-16T10:40:51.632232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Low-rank prompt interaction for continual vision-language retrieval","venue":null,"work_id":"dd0118b3-9bb4-40af-9e16-f37d9335982f","year":2024},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:8325507b862cf1ee98382b79bf2adb17d206773b19ede821878d315b4b4139c8","observation_id":"293d60e1-c208-42ac-b50e-fd430be27fa1","resolution":{"observed_at":"2026-05-16T10:40:51.685321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic support network for few-shot class incremental learning.IEEE Transactions on Pattern Analysis and Machine Intelligence","venue":null,"work_id":"523917f7-50e8-4506-b346-4cc96335a160","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:07090881a8fd92de3ba6ac2c0bfc38ed53fe778f85a546e9228f1fcb5303260b","observation_id":"e20f0040-64d1-4218-bc02-81aef12cc4ae","resolution":{"observed_at":"2026-05-16T10:40:51.673508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taco: Token-aware cascade contrastive learning for video-text alignment","venue":null,"work_id":"09c2bd4b-7651-4216-9edd-1417c0af8e9f","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:3f2e075dafe8beb4001bcddef41cc59ea85ec970e309098e911a7d9ab443e444","observation_id":"e9a3d12a-91c7-4c8e-ab7f-6b50dee6a5ed","resolution":{"observed_at":"2026-05-16T10:40:51.680932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.05352","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recent advances of multimodal contin- ual learning: A comprehensive survey","venue":null,"work_id":"26297c61-8333-4a32-a4d0-46a1ea24e3c7","year":2025},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:0993904fdf9d10492ad7fed3af062a0db96c7f52809eafd84d67b3aaa63ae790","observation_id":"e30ce547-9178-4dd1-8db6-b74f4d7e132e","resolution":{"observed_at":"2026-05-16T10:40:50.901410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Boosting continual learning of vision-language models via mixture-of-experts adapters","venue":null,"work_id":"f62b4c3b-52b9-4f73-b1a7-e645781e1f97","year":2024},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:a44b415f00bf106ac7f010a9804369e471b0a66d8dedfdd745e2ed8cd472fb8c","observation_id":"254ee880-1289-427b-92b8-a25f65be6876","resolution":{"observed_at":"2026-05-16T10:40:51.659474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A joint sequence fusion model for video question answering and retrieval","venue":null,"work_id":"5ebb6d6c-b5e3-4faf-9a6b-95af7e780da6","year":2018},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:35ea51042859374e773232f20170f2498f04b293bc4dbcdbc8665db3ba6ef4fe","observation_id":"08d621ff-ad31-4363-b78a-363b35155a17","resolution":{"observed_at":"2026-05-16T10:40:51.602712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quantifying and narrowing the unknown: Interactive text-to-video retrieval via uncertainty minimization","venue":null,"work_id":"8af28e55-dbda-40b2-a942-d07a1cbf9c77","year":2025},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:443ff2e8e3121a42f15425d238b7aecb3d30d3806b793e861db8fbb838c241b9","observation_id":"30180881-0e62-4084-8fc1-e23f12b15cf6","resolution":{"observed_at":"2026-05-16T10:40:51.611791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mpt: Multi-grained prompt tuning for 13 text-video retrieval","venue":null,"work_id":"309ab5a1-74d4-4a36-9379-36ff4672c037","year":2024},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:ae858d9c0e80d57cf7a5315ba94b833099fe9068598f253ff19b436f3ddb3ebe","observation_id":"b71c631a-5f11-4577-89f4-5fa686a4dc94","resolution":{"observed_at":"2026-05-16T10:40:51.655518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vqacl: A novel visual question answering continual learning setting","venue":null,"work_id":"f9568e3a-a775-4627-85a2-14dc27cebd45","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:91ceb406b9dce74103da0354df6365b9d7757b18c548fabfabe8c290e310fb8b","observation_id":"01de61a7-4be2-4976-a52d-d3be55779950","resolution":{"observed_at":"2026-05-16T10:40:51.602711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mgsvf: Multi-grained slow versus fast framework for few-shot class-incremental learning.IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(3):1576–1588","venue":null,"work_id":"69f5be2a-00a6-4fb2-8951-2ccf30e4c938","year":2024},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:0429418676dafdbf531720e2d38302190da06859c8cd526898bed609c1b8de9a","observation_id":"ecf872ac-51ad-464d-8f45-838e029c0fbf","resolution":{"observed_at":"2026-05-16T10:40:51.690142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Centerclip: Token clustering for efficient text-video retrieval","venue":null,"work_id":"f3456a90-0062-4471-9aa7-f5670197b1e6","year":2022},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:c097efc74d82bf9ce50db88463b770547e8e9db3416441c0749de1720d4e963b","observation_id":"c018a695-a164-4cdd-a9e8-4969c9698d9b","resolution":{"observed_at":"2026-05-16T10:40:51.672177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual text-to-video retrieval with frame fusion and task-aware routing","venue":null,"work_id":"16a483ca-85a6-48f9-933a-c8d50f642250","year":2025},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:471414af134c65eff0b2549023cb53ab1820c731b20892656071890a526a938d","observation_id":"5282bee4-e656-420a-bff7-aebc91fd4343","resolution":{"observed_at":"2026-05-16T10:40:51.651540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Preventing zero-shot transfer degradation in continual learning of vision-language models","venue":null,"work_id":"f9224c66-c7a2-4c1d-ae51-47ce80bb8817","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:514a086a9243c2086c8c1c24c2a83956c8ff549b5c2814db5aa27fc9aa674b0b","observation_id":"30e8075a-d419-4b5c-8dd1-9e0ea72e66f0","resolution":{"observed_at":"2026-05-16T10:40:51.653601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding imbalanced semantic segmentation through neural collapse","venue":null,"work_id":"75fab212-a95c-4a79-8cf9-54c6fa76593d","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:f5d0e5445002662a93595288f1c5bb68f764cc975b683f03341dee8ece7e9b89","observation_id":"0e8f7948-cea6-4260-ad51-2af72f224ec2","resolution":{"observed_at":"2026-05-16T10:40:51.665178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1473d04c-37b6-4b6d-96be-f02a4d0f3921","year":2024},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:a9a0318eda5d56098616ea61b82958be481605a6a8c651498babd17ae070bebb","observation_id":"fc92ad12-59cd-4713-ab6a-5ddf29ecbce1","resolution":{"observed_at":"2026-05-16T10:40:51.678753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"79d67096-4364-4145-ac80-ce4db14cb13e","year":2021},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:3f93cb8dcf876d6570ba6469c99c17e266de76cd8d17538edec50dfc5a1a7e32","observation_id":"f406e808-57cf-4780-88ec-ec31b8bf628e","resolution":{"observed_at":"2026-05-16T10:40:51.626212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Complementarity- aware space learning for video-text retrieval.IEEE Transactions on Circuits and Systems for Video Technology, 33(8):4362–4374","venue":null,"work_id":"77f4a213-4872-481d-9b96-fdeb03b1a932","year":2023},"citing_paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-16T10:40:01.902254Z"},"links":{"citing_paper":"/paper/2601.20597"},"observation_digest":"sha256:9a5c2b2e2fef75c181b4ce53cbbf79dd5e64f8a2b12dfb1437a529d056e7ed1b","observation_id":"68c220ba-d509-46e9-b739-cd48f2e79ba2","resolution":{"observed_at":"2026-05-16T10:40:51.614174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2601.20597","last_updated":"2026-04-25T09:40:43Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T05:48:46.302977Z","submitted_at":"2026-01-28T13:34:44Z","title":"StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":69},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 0 inbound Pith citation observations for arXiv:2601.20597."}