{"as_of":"2026-08-14T07:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3292e955e04dfd69771ae36aefa2530694d93d4673a85ae59a477927b81fee03","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:51:56.884183Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12585/citation-record","integrity":"/paper/2506.12585/integrity","json":"/paper/2506.12585/citation-record.json","paper":"/paper/2506.12585"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1609.08675","last_updated":"2016-09-27T21:21:49Z","snapshot_observed_at":"2026-08-13T15:03:48.028924Z","submitted_at":"2016-09-27T21:21:49Z","title":"YouTube-8M: A Large-Scale Video Classification Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08675","snapshot_observed_at":"2026-08-07T00:51:56.633975Z","title":"Youtube-8m: A large- scale video classification benchmark","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.633975Z"},"links":{"cited_paper":"/paper/1609.08675","citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:22150db8664c51ece77d94ee3c490954c57a0b60197b5688ae446692089e67d0","observation_id":"b67e59df-72e3-4759-8e5a-2bb81e2eef98","resolution":{"observed_at":"2026-08-07T00:51:56.633975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.520522Z","title":"Timesformer-base-finetuned-ssv2","venue":null,"work_id":"08c00ad0-5af4-4de9-81d0-74aabca576c1","year":2021},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.642321Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:4e8fbbaebec1403621cd63c1bc1dbc11198268ac02387157a72ed8f243c17347","observation_id":"8ab1f47e-37e1-492d-ba82-f1c039c19797","resolution":{"observed_at":"2026-08-07T00:51:57.525211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:56.648106Z","title":"Vivit: A video vision transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.648106Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:e2e51148457c28fb59b93bbaee4ed1989169cfc7a68ed9cbed0192064a35e5fc","observation_id":"658d9a26-9c3b-4d8d-aab3-e2817319650d","resolution":{"observed_at":"2026-08-07T00:51:56.648106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00075","last_updated":"2018-10-31T19:24:20Z","snapshot_observed_at":"2026-08-10T23:37:46.162225Z","submitted_at":"2018-10-31T19:24:20Z","title":"The UEA multivariate time series classification archive, 2018","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00075","snapshot_observed_at":"2026-08-07T00:51:56.654307Z","title":"The uea multivariate time series classification archive, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.654307Z"},"links":{"cited_paper":"/paper/1811.00075","citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:935b9a76b7efe5dcce235bffb8eebf5376d55a532e685b5d3b72dffc6b11deed","observation_id":"0e6c9a0d-4b2b-4063-b9ca-347ec6f49e00","resolution":{"observed_at":"2026-08-07T00:51:56.654307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.494760Z","title":"Using dynamic time warping to find patterns in time series","venue":null,"work_id":"ce6da1de-7ac8-4645-9940-864ff583c9e5","year":1994},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.662898Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:f4695030a648fd018d1a4f29dff6fd1172c5b67256b26c2fe17f92c6d983dced","observation_id":"5bbfc546-cf26-442b-a620-80a9224747a0","resolution":{"observed_at":"2026-08-07T00:51:57.499531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.478903Z","title":"Is space-time attention all you need for video understanding? In International Conference on Machine Learning , pages 813–824","venue":null,"work_id":"8e62bf43-3b77-457c-a9eb-6e6ba1aa7752","year":2021},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.669434Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:d305ce25fa18630145bf10951979c8ce9594c7ec36b493f51f543f5275b07c10","observation_id":"1d43921f-e6c8-4bf0-80f9-0808086775e4","resolution":{"observed_at":"2026-08-07T00:51:57.484306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.463649Z","title":"Dtwnet: a dynamic time warping network","venue":null,"work_id":"73043a81-b4b0-4ffa-ab4d-d3d41812d5c8","year":2019},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.675610Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:16d27588e33f238e0f70590eab3a1028a2306865f7c2532e1fc84daae30ea865","observation_id":"cf12174a-9605-4cc6-94ec-25092be3717a","resolution":{"observed_at":"2026-08-07T00:51:57.468495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.448639Z","title":"Few-shot video classification via tem- poral alignment","venue":null,"work_id":"cadab136-3728-405f-889c-5f59faa3acf8","year":2020},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.683460Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:53941a5fd0c635c694f81d19a1d7046783e16757e38dc6bd1de6aebc92d39fc8","observation_id":"b4090e4c-e43c-4145-bfb2-a4b89ad4c28f","resolution":{"observed_at":"2026-08-07T00:51:57.453503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.432546Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"b2ba7690-06bf-4c63-883d-1a229d6598c7","year":2017},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.689715Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:3da161e9801e25de07ba4e4355d70af9cc17677bd8a0c421e30e5c1e2919e953","observation_id":"09578d25-841b-4bdb-bc52-a50e17681f84","resolution":{"observed_at":"2026-08-07T00:51:57.437285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.416806Z","title":"D3tw: Discriminative differentiable dy- namic time warping for weakly supervised action alignment and segmentation","venue":null,"work_id":"fa64e6de-5307-4cd0-81a9-255e953534ac","year":2019},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.696692Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:7ca4f70109279c8dbbdc0776c6a25932433e3a4f100f40f10f6bcfa1622bf485","observation_id":"315ad924-60b3-4429-8890-1adac7358998","resolution":{"observed_at":"2026-08-07T00:51:57.421567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.399607Z","title":"Soft-dtw: a differen- tiable loss function for time-series","venue":null,"work_id":"0b11c68c-65f3-49dd-84b4-a25e1ddf3914","year":2017},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.702587Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:d7984da869d85cb37cfd5ea390cde5e7ab2c1c5457d336e94e0a83785114b4d2","observation_id":"72fb712a-6387-4227-928a-1b4aa814a023","resolution":{"observed_at":"2026-08-07T00:51:57.405107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T00:51:56.708585Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.708585Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:b8cf918ca2116ccdb3d6714025470b0eebf824820e46da40c6e607d128fe0bcf","observation_id":"49b76c07-5636-4dec-89ea-cc453d97ef29","resolution":{"observed_at":"2026-08-07T00:51:56.708585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.382993Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"06435b6b-885a-46bc-833a-28f561871a49","year":2019},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.714671Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:de89b775cac1a1a59eeb7dbf31eaee78f3a9f4fc4009a9aa64e60278d67537b9","observation_id":"459a09dc-828e-4b8a-b759-e4ff64da2bcb","resolution":{"observed_at":"2026-08-07T00:51:57.388333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.367058Z","title":"Fine- grained temporal contrastive learning for weakly-supervised temporal action localization","venue":null,"work_id":"9583fbc7-dcba-4cb9-8037-dbb80e9fc131","year":2022},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.720485Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:be5342a5ff75357425031f79d0cc6c97cb043a13e29ea5461319ee357d5379ad","observation_id":"7f00da72-1183-46ff-a8af-06f48485d2fe","resolution":{"observed_at":"2026-08-07T00:51:57.372011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.351000Z","title":"Video action transformer network","venue":null,"work_id":"93c98a91-f694-4996-bc68-bdd91e229840","year":2019},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.727998Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:2c18a164dd53f3274c041181abd0e336460461c05e869d6558434e4fb733207b","observation_id":"bfe652ce-9907-4a39-815b-03c21ce5086d","resolution":{"observed_at":"2026-08-07T00:51:57.355791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.335363Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":"6ee458bb-873e-411d-821e-ba3c0232940f","year":2017},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.734194Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:1225ed73a5c9d6038cdfe157d99feb1533aa29b43158f7f48c340462828aaf02","observation_id":"5b31ee90-1947-4b84-ad02-bb3848c92ffa","resolution":{"observed_at":"2026-08-07T00:51:57.340875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.320112Z","title":"Large-scale video classification with convolutional neural networks","venue":null,"work_id":"5cea6be5-c054-40d3-8c7c-1942bf117674","year":2014},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.740138Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:f721ad99f080a17d6ba89abfcda5ab93450d5677669d6033bca91f9c2d0ac2e2","observation_id":"d22e2b74-cc59-435e-b28f-a9c623386500","resolution":{"observed_at":"2026-08-07T00:51:57.325267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T00:51:56.746645Z","title":"The kinetics hu- man action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.746645Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:d51c17fa1e1bf0b0a820a2bc69166b3dc628a1d0fc87b066228ebb9a7a93ed56","observation_id":"9f767076-8961-46d2-b541-d5fefcb44829","resolution":{"observed_at":"2026-08-07T00:51:56.746645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:56.753566Z","title":"Imagenet classification with deep convolutional neural net- works","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.753566Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:8631a507433dd96532261ea5bb00aac2e4f5721d245a6da43f5bcbf4fe98c5bd","observation_id":"10b678ad-36a8-44d2-9eda-b472ec2b4779","resolution":{"observed_at":"2026-08-07T00:51:56.753566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.293989Z","title":"Hmdb: a large video database for human motion recognition","venue":null,"work_id":"4bdff457-f1f5-4244-8a78-856b74b36b0c","year":2011},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.761485Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:46f19dd194fda443945b780afc854f38d2b638a565393d1ac4d1fa449a3bc490","observation_id":"aca566b0-fae4-45de-9ee6-402a446ed581","resolution":{"observed_at":"2026-08-07T00:51:57.299267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.278462Z","title":"Tam: Temporal adaptive module for video recog- nition","venue":null,"work_id":"ab986574-e776-4dae-83d2-d9e81b0d8ed1","year":2021},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.767773Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:0e35bef4f85270050be2e387d025a85272045e838edd4a1e39496344842d9bc0","observation_id":"b22a03c0-d157-4d0d-a430-b76faa09ebf0","resolution":{"observed_at":"2026-08-07T00:51:57.283560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.263122Z","title":"Action recognition on something-something v2 leaderboard","venue":null,"work_id":"720f27ee-cfdf-4fe5-b8fd-aa4c0c048cb8","year":null},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.773604Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:b3fac2a96c304d0f3208931d908df048bdab3e74703cf64cf712bed9ebc08b8c","observation_id":"7b9f8c0d-00dc-4b12-90ab-d2b9395b7587","resolution":{"observed_at":"2026-08-07T00:51:57.267961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.230231Z","title":"A global averaging method for dynamic time warping, with ap- plications to clustering","venue":null,"work_id":"5fb5dd35-a7ee-4ab3-8404-dfa462d7f517","year":null},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.786601Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:360b4bec720061172d8a7337017ca4d31b7c36fd8167f8f11ca1b5b313923bc7","observation_id":"b2429d20-ce5a-4c9a-a0f7-4a670b37a1d8","resolution":{"observed_at":"2026-08-07T00:51:57.235229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.214919Z","title":"Re- thinking video vits: Sparse video tubes for joint image and video learning","venue":null,"work_id":"16e11ca1-fcea-42e8-9a50-2454df59bbb7","year":2023},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.793063Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:69660468829641577ffd0aacf3f411c140f798f829d307576324caaac3472465","observation_id":"7b01e21c-c369-4531-94f8-37af1feec1cf","resolution":{"observed_at":"2026-08-07T00:51:57.220040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.199873Z","title":"Vivit-b-16x2-kinetics400","venue":null,"work_id":"3b38002b-2d9b-4ebb-8605-8a632b4f0448","year":2021},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.799549Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:3d15e4343cdbcecd4b9a3a00cd3a27576aa2c61dd052a790502f54ef69316a2e","observation_id":"d893f334-bfab-4f78-a694-2d4300b22767","resolution":{"observed_at":"2026-08-07T00:51:57.204661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.184939Z","title":"Dynamic time warping algorithm review","venue":null,"work_id":"0fec7af3-1d52-49ec-a720-61278fa76ca1","year":2008},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.805951Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:eb5c30b951cd5505948942c30b38cc674d68fe43e6989d767a54c2b22b01d2de","observation_id":"1d9f18c2-6219-4efa-8109-9b06d1675cbd","resolution":{"observed_at":"2026-08-07T00:51:57.189675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.169304Z","title":"The move-split-merge metric for time series","venue":null,"work_id":"c5b0daef-4a0c-4bf7-8396-3cc361740606","year":2012},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.813505Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:7eedb0f4a4715daeb85e566dd560b6765cb26fd16e54bee81b7d7e35cf2d809c","observation_id":"d83b47c6-d347-44ad-bc5b-bf406b750fb4","resolution":{"observed_at":"2026-08-07T00:51:57.173908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:56.820397Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.820397Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:545719e30011462e07aeba000bd75ebd0adeed1adcc13bc0b4a3b4565c28bceb","observation_id":"ae3fccc3-ab4b-497c-936e-f4bdbf6f40cc","resolution":{"observed_at":"2026-08-07T00:51:56.820397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.143287Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":"6592eb58-0125-44a9-a40d-eb17bdfb7304","year":2015},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.826935Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:0ff7cc581f46cc9435fc75aab625ab3b0357f32e5d454bf2f2a0d95daf8e3258","observation_id":"4ca14107-601d-42f1-8128-b6e559cacf50","resolution":{"observed_at":"2026-08-07T00:51:57.148604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.127068Z","title":"Implicit temporal modeling with learn- able alignment for video recognition","venue":null,"work_id":"5c583f08-820b-4e70-b6f2-ef45de9ee4eb","year":2023},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.833801Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:422e80ae1022dcd11f38069420d57320937cccfbe983de3376be666b77b15ac9","observation_id":"a39310a2-bc76-415a-9f7a-b977ed6debc5","resolution":{"observed_at":"2026-08-07T00:51:57.132257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.110600Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"3abf8bc8-2a94-4127-9634-106a480614b8","year":2023},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.839546Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:be5dfde86821cad63baf0deed3e30128866404ead49ba3563cb7f70707729c53","observation_id":"9a368ee8-8e1b-4778-a037-9852857ffb9b","resolution":{"observed_at":"2026-08-07T00:51:57.116076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.094884Z","title":"Masked video distillation: Rethinking masked feature mod- eling for self-supervised video representation learning","venue":null,"work_id":"8c336e7b-dc7b-4035-85c2-f5cfbe7cdd33","year":2023},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.845472Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:23f9f70970eac482a0ae1a036b6cee76ea905d8e2d0bc7c5eea0bd236bed8e6c","observation_id":"5838d60d-65ef-43e8-9612-0def7432d396","resolution":{"observed_at":"2026-08-07T00:51:57.099790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-13T00:47:41.087976Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-08-07T00:51:56.851307Z","title":"Internvideo2: Scaling video foundation mod- els for multimodal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.851307Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:b45f83ff9874eadb3f13b8dccaea2cdf8db2cd49338fd2a213181791dc08fa39","observation_id":"30471e61-9c6b-4718-a4bb-197fbf6e0fd0","resolution":{"observed_at":"2026-08-07T00:51:56.851307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.078543Z","title":"What can simple arithmetic oper- ations do for temporal modeling? In Proceedings of the IEEE/CVF International Conference on Computer Vision , pages 13712–13722, 2023","venue":null,"work_id":"48aa57cd-21ff-4944-8599-d1d19553d2cb","year":2023},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.857324Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:2d832a0bb64b1f534f2f741e47b3ff0f917d08efee6cae4bc929f91aba5c6acb","observation_id":"cc167c16-f907-46f5-bfd2-fbe96b8520ef","resolution":{"observed_at":"2026-08-07T00:51:57.083923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.063911Z","title":"Multiview transformers for video recognition","venue":null,"work_id":"20758cc5-bcdd-4a55-baa1-cdef6c52999d","year":2022},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.863125Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:d7b08501a654d94d511e380bebe8fba3b4fe3c2b2fe5e7da8efd8366f6815bb7","observation_id":"f5639af5-dde6-4f43-9e8d-c87a9a7145d7","resolution":{"observed_at":"2026-08-07T00:51:57.068465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.049149Z","title":"Scaling vision transformers","venue":null,"work_id":"d1df8986-f98e-4d13-aae2-44fd03dda964","year":2022},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.872058Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:bdf9e5ab1fd5fbf429eafeb2516c7cbdfc6f2b11f1192d29dd5b96b452e75a6b","observation_id":"253a879a-021b-469c-92db-e516a989b60c","resolution":{"observed_at":"2026-08-07T00:51:57.053463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.031452Z","title":"We now describe our choice of the temporal sliding win- dow widths and strides","venue":null,"work_id":"0d721786-ef03-4bde-bfb2-73f2b1b68f87","year":null},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.877590Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:1b023ab246a45fc40af25522df33d0cc8c5a1f00c2c3a22972ec08a5bad0db1c","observation_id":"a61480f8-53da-4da3-a8c4-5ff66ee9bd86","resolution":{"observed_at":"2026-08-07T00:51:57.038230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.013130Z","title":null,"venue":null,"work_id":"47433fc2-d555-4951-a94d-a96cc75b04b1","year":null},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.884183Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:dc99b0ff4d86450ee6c1d65b45973c0e8a42a751afb32eb5565314499a6ba93a","observation_id":"edd693eb-2acf-46f2-9be7-970f10af564f","resolution":{"observed_at":"2026-08-07T00:51:57.019889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:51:57.246646Z","title":null,"venue":null,"work_id":"9e022908-a788-4a27-95a0-15a84f9f702c","year":2024},"citing_paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:56.781033Z"},"links":{"citing_paper":"/paper/2506.12585"},"observation_digest":"sha256:abca662da661a33d830aaee2b5066d11d0b2d09af1fc501438933f288e559f15","observation_id":"05b6330b-9b7a-4205-9ffd-8f9f28183805","resolution":{"observed_at":"2026-08-07T00:51:57.251878Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12585","last_updated":"2025-06-14T17:39:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T09:55:36.457643Z","submitted_at":"2025-06-14T17:39:03Z","title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":9,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2506.12585."}