{"as_of":"2026-08-14T15:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a21c9f3e72037c4c12a417e97147b49b2a9a719e2e385c7140bbc638c5251ba1","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:27:00.912867Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05543/citation-record","integrity":"/paper/2506.05543/integrity","json":"/paper/2506.05543/citation-record.json","paper":"/paper/2506.05543"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.06907","last_updated":"2023-10-10T18:03:41Z","snapshot_observed_at":"2026-08-13T05:52:46.566559Z","submitted_at":"2023-10-10T18:03:41Z","title":"Self-supervised Object-Centric Learning for Videos","version":1},"cited_work":{"arxiv_id":"2310.06907","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.06907","snapshot_observed_at":"2026-08-07T10:27:03.163967Z","title":"Self-supervised Object-Centric Learning for Videos","venue":"cs.CV","work_id":"587af088-b3da-4a40-a987-3ac1f1dd28e0","year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:56.075692Z"},"links":{"cited_paper":"/paper/2310.06907","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:0346040f776db533b6bcc8fcb68ca2256ec4ec98eabf18be659b641232f41307","observation_id":"3747041c-8cd9-492d-be05-5258c858e53d","resolution":{"observed_at":"2026-08-07T10:27:03.244802Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.09549","last_updated":"2021-12-01T19:21:43Z","snapshot_observed_at":"2026-08-09T20:55:53.808974Z","submitted_at":"2016-06-30T16:00:43Z","title":"Fully-Convolutional Siamese Networks for Object Tracking","version":3},"cited_work":{"arxiv_id":"1606.09549","doi":null,"metadata_source":"pith","pith_arxiv_id":"1606.09549","snapshot_observed_at":"2026-08-07T10:27:03.015453Z","title":"Fully-Convolutional Siamese Networks for Object Tracking","venue":"cs.CV","work_id":"bf69cd29-ff59-4edc-b237-ba8d2b6ef361","year":2016},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:56.143077Z"},"links":{"cited_paper":"/paper/1606.09549","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:56cb6ffa8fafcf663c93ef4e256b5b73df9c2ff861740b7441b952b986daaeb2","observation_id":"dec122db-7350-433f-8049-759b4eb3a591","resolution":{"observed_at":"2026-08-07T10:27:03.060266Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.999675Z","title":null,"venue":null,"work_id":"b9b540e1-b88f-4b3a-bd95-82feb7fe2a3f","year":2008},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:56.207833Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:a26695f2ba5c24a9c0e07ada5cd5737147e3278572ddee5f606569852fdea222","observation_id":"241f286c-143a-41d6-aad5-4fc4f5104a5b","resolution":{"observed_at":"2026-08-07T10:27:04.002367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14294","last_updated":"2021-05-24T17:49:18Z","snapshot_observed_at":"2026-08-04T11:32:10.695202Z","submitted_at":"2021-04-29T12:28:51Z","title":"Emerging Properties in Self-Supervised Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14294","snapshot_observed_at":"2026-08-07T10:26:56.327573Z","title":"Caron, H","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:56.327573Z"},"links":{"cited_paper":"/paper/2104.14294","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:aad89d49d4c28035d4c9f520bef29d29aceef70b80917c1d025c3c33c99af20b","observation_id":"9d7786a1-03c0-4b7c-9345-89b60baab0f6","resolution":{"observed_at":"2026-08-07T10:26:56.327573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05709","last_updated":"2020-07-01T00:09:08Z","snapshot_observed_at":"2026-08-02T19:54:26.138356Z","submitted_at":"2020-02-13T18:50:45Z","title":"A Simple Framework for Contrastive Learning of Visual Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05709","snapshot_observed_at":"2026-08-07T10:26:56.430091Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:56.430091Z"},"links":{"cited_paper":"/paper/2002.05709","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:552881c0f535fa37d345f64c7580bf9a8fba0c67a351d35a067f4357f054a696","observation_id":"136b593e-054b-40c0-8cba-1e6c5ac50521","resolution":{"observed_at":"2026-08-07T10:26:56.430091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.10566","last_updated":"2020-11-20T18:59:33Z","snapshot_observed_at":"2026-08-14T07:19:32.096028Z","submitted_at":"2020-11-20T18:59:33Z","title":"Exploring Simple Siamese Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.10566","snapshot_observed_at":"2026-08-07T10:26:56.652735Z","title":"Chen and K","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:56.652735Z"},"links":{"cited_paper":"/paper/2011.10566","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:c0b83d3b5d6fceeb62c38b6daa713d182bd20aed089647a2508e7071d1a10acb","observation_id":"5c9830a1-1da1-4750-ab2b-2dfec7727654","resolution":{"observed_at":"2026-08-07T10:26:56.652735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03903","last_updated":"2023-09-07T17:59:41Z","snapshot_observed_at":"2026-08-13T10:18:19.697368Z","submitted_at":"2023-09-07T17:59:41Z","title":"Tracking Anything with Decoupled Video Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03903","snapshot_observed_at":"2026-08-07T10:26:56.755323Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:56.755323Z"},"links":{"cited_paper":"/paper/2309.03903","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:b76b64a5588caed047d168b6e800addc37ba380d428c5a411af342ef5e13dbc9","observation_id":"cca99645-80ee-476b-819f-e7e2ec483e01","resolution":{"observed_at":"2026-08-07T10:26:56.755323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12982","last_updated":"2024-04-11T22:47:39Z","snapshot_observed_at":"2026-08-13T05:45:08.636404Z","submitted_at":"2023-10-19T17:59:56Z","title":"Putting the Object Back into Video Object Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12982","snapshot_observed_at":"2026-08-07T10:26:56.844695Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:56.844695Z"},"links":{"cited_paper":"/paper/2310.12982","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:f6cecdf9f033caa38b48f053f5767bd829639e763d5667e231af951539194e0c","observation_id":"f613318c-2866-40df-a95f-55976169af5f","resolution":{"observed_at":"2026-08-07T10:26:56.844695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.991384Z","title":null,"venue":null,"work_id":"ecec68dc-2811-4b19-8d55-aa91ba0df888","year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:56.935230Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:6afbf3c4a7f3ce99f5a6fe013d050ba8208863ce9ef5f50abcbf04734a12aa4d","observation_id":"8272b971-cc30-4a9e-b18a-7d640c83a150","resolution":{"observed_at":"2026-08-07T10:27:03.994420Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.983044Z","title":"Doersch, A","venue":null,"work_id":"1f650bc8-8734-4015-be26-1eaf8097d214","year":2015},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.058328Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:71249c3d2479e07e02dcce3dc0254f59cc00f22f2477a25338fd70dd82e2189d","observation_id":"8725609c-f12c-4f4b-882d-156bb4d77ae9","resolution":{"observed_at":"2026-08-07T10:27:03.985668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.974811Z","title":"Eymaël, R","venue":null,"work_id":"fefdf809-3779-4c7b-8745-95d6e6caa67d","year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.154505Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:649268428ae4550a68425ddffa10356d2c625496182e35a10c287372854aa56f","observation_id":"0433ac2b-f287-49f3-a4bf-5ea004b69a6b","resolution":{"observed_at":"2026-08-07T10:27:03.977742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14558","last_updated":"2021-04-29T17:59:53Z","snapshot_observed_at":"2026-08-09T21:00:52.232677Z","submitted_at":"2021-04-29T17:59:53Z","title":"A Large-Scale Study on Unsupervised Spatiotemporal Representation Learning","version":1},"cited_work":{"arxiv_id":"2104.14558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.14558","snapshot_observed_at":"2026-08-07T10:27:02.747459Z","title":"A Large-Scale Study on Unsupervised Spatiotemporal Representation Learning","venue":"cs.CV","work_id":"40f34868-2033-4d31-9232-ba586aa5df07","year":2021},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.235226Z"},"links":{"cited_paper":"/paper/2104.14558","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:94ffb79029be02ee9b21561483042dc4266d02be435d612c5a4f6b5166181b9a","observation_id":"e26bfb12-99b0-4ff8-91e5-7094c69b37fa","resolution":{"observed_at":"2026-08-07T10:27:02.867254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.965905Z","title":"Grauman, A","venue":null,"work_id":"36233c2e-fd55-4f1b-af21-16adf9faa1bc","year":2021},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.306125Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:929afa23ce79d447f52ee4f27039e83dc2df4aff1139a6523ebae1e6866d2a9e","observation_id":"ce2c6fce-6f4e-4aac-82f3-a201add82bc6","resolution":{"observed_at":"2026-08-07T10:27:03.968950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.957101Z","title":"Gupta, J","venue":null,"work_id":"1fcfd291-d7e9-4ac0-a691-64d6456044f8","year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.390376Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:82d100ca463f644b325913baae8f5f786cde2dc2174bb981fc3c57857fa1c704","observation_id":"6d00ed5d-2980-49be-8e70-6a311b2d186d","resolution":{"observed_at":"2026-08-07T10:27:03.960068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05722","last_updated":"2020-03-23T18:36:55Z","snapshot_observed_at":"2026-07-06T08:36:48.869880Z","submitted_at":"2019-11-13T18:53:26Z","title":"Momentum Contrast for Unsupervised Visual Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05722","snapshot_observed_at":"2026-08-07T10:26:57.500232Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.500232Z"},"links":{"cited_paper":"/paper/1911.05722","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:4123b56b8f611c407b062b011e06b414cda0d18203d2960079c5e9907f2d5839","observation_id":"a4c8d04b-9d96-4fb1-af2c-d3cdb9c0ef66","resolution":{"observed_at":"2026-08-07T10:26:57.500232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.948363Z","title":null,"venue":null,"work_id":"3ebb27a6-19c7-4167-aa25-abddac3e5341","year":2020},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.569273Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:c54d9a2c88ae43ca7c84fbfbafd2e7b1bc614b8660a0ff03138cb4d8a1ecc04c","observation_id":"f4ab7a08-36a7-4184-bfe3-f99d8183d1d3","resolution":{"observed_at":"2026-08-07T10:27:03.951006Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.940037Z","title":null,"venue":null,"work_id":"65970ad4-f3bc-476a-85ca-9cc62281249d","year":null},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.640645Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:421c0973d203b833574766917b59a0ce9ea5ebd0789fb065461282dcc8039666","observation_id":"e4a6811e-1fd1-463e-b401-2314274aeabd","resolution":{"observed_at":"2026-08-07T10:27:03.942775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14613","last_updated":"2020-12-03T18:59:03Z","snapshot_observed_at":"2026-08-10T06:31:08.358351Z","submitted_at":"2020-06-25T17:56:05Z","title":"Space-Time Correspondence as a Contrastive Random Walk","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14613","snapshot_observed_at":"2026-08-07T10:26:57.863321Z","title":"Jabri, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.863321Z"},"links":{"cited_paper":"/paper/2006.14613","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:bdb67067b54d74b8820620d295dd60629d1083c88e325f072bdc189f52357ac6","observation_id":"15ee4353-4502-46f3-b31a-18fb3f4163e9","resolution":{"observed_at":"2026-08-07T10:26:57.863321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:26:57.927831Z","title":"Jhuang, J","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.927831Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:ea21e124ca48835b18c67ccf15f6cd3204cac8cbe0b56200dcd3208eb75ea8c5","observation_id":"f54fb717-9f43-494a-948f-8ae6e567440a","resolution":{"observed_at":"2026-08-07T10:26:57.927831Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07635","last_updated":"2024-10-01T13:15:53Z","snapshot_observed_at":"2026-08-13T10:55:12.508649Z","submitted_at":"2023-07-14T21:13:04Z","title":"CoTracker: It is Better to Track Together","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07635","snapshot_observed_at":"2026-08-07T10:26:57.990243Z","title":"Karaev, I","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.990243Z"},"links":{"cited_paper":"/paper/2307.07635","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:9818f5dd6757f719f10de4b170e95b0bdf20ef3fe9f295c831ec57eece0eed24","observation_id":"63aa4cfe-383e-47b3-849f-dd5d24a31edf","resolution":{"observed_at":"2026-08-07T10:26:57.990243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T10:26:58.052557Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.052557Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:84f0af213d76a2085f9a57e05b3bb1cbab11eb1dba4d0a380e1467fa3abfc933","observation_id":"d94900eb-8934-406d-93ce-d7c2fc3a4cfe","resolution":{"observed_at":"2026-08-07T10:26:58.052557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.01826","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:02.528296Z","title":"Khosla, S","venue":null,"work_id":"1d4276af-86c1-47f9-bbdf-ea68d732dbcb","year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.101630Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:e679f83aad8253fbcb8ee7cd94015b9cc45dc77046f58c32e74ced93c2d872ce","observation_id":"61509798-0e3f-4c3b-b2ff-d3fa8e119566","resolution":{"observed_at":"2026-08-07T10:27:02.610398Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-07T10:26:58.145168Z","title":"Kirillov, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.145168Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:f1ce8b4d844ba1bc073a3c79a18d0a508b6f007c32a230116627cf8f91608524","observation_id":"3fd45c79-3869-4050-b1c2-fc2e153ac534","resolution":{"observed_at":"2026-08-07T10:26:58.145168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:26:58.201275Z","title":"Kuehne, H","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.201275Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:6e123f634ff227d3fdda8d7170cb074e2b249a09659aeeee5929e86616524c0b","observation_id":"2daaabb7-c22a-41f2-8edf-9f8b1818bb7e","resolution":{"observed_at":"2026-08-07T10:26:58.201275Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11895","last_updated":"2019-09-26T05:11:26Z","snapshot_observed_at":"2026-08-11T11:47:29.933343Z","submitted_at":"2019-09-26T05:11:26Z","title":"Joint-task Self-supervised Learning for Temporal Correspondence","version":1},"cited_work":{"arxiv_id":"1909.11895","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.11895","snapshot_observed_at":"2026-08-07T10:27:02.271689Z","title":"Joint-task Self-supervised Learning for Temporal Correspondence","venue":"cs.CV","work_id":"b7f1704b-bd86-4c9c-a28a-c496dd4bd6fe","year":2019},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.239798Z"},"links":{"cited_paper":"/paper/1909.11895","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:f7268c8f43dae4622d8deb3fec7d99e7031e8ee264673a1f2f1660422b572d62","observation_id":"344394e4-3429-49a4-89a9-158b4aaa81a7","resolution":{"observed_at":"2026-08-07T10:27:02.318566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.931883Z","title":null,"venue":null,"work_id":"683719ac-805e-4af5-9e52-35a8941a4e6c","year":2019},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.315087Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:8d6fd886745ec67f11a82f68f7e9753a5fa4741ad10425e7fa4685f604ef83ee","observation_id":"afe415da-e1c5-4bf7-9549-add591fc2b49","resolution":{"observed_at":"2026-08-07T10:27:03.934310Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:26:58.347979Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.347979Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:5c3f448ad9345ee2b1e64535d6921bf6464cf8a3660063cb28e45c22d6d7e76f","observation_id":"5d8db677-0ef6-42f1-8878-dd5e2aada7c8","resolution":{"observed_at":"2026-08-07T10:26:58.347979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.924202Z","title":"Misra, C","venue":null,"work_id":"4d840bf0-3a54-4580-acaa-ef83b20af815","year":2016},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.418402Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:425816ef8576f475bb4949c86fe968fe140ba9cec9eba4641a5d5392bbb4bb67","observation_id":"916fd0e2-a0a5-4594-bcf8-77e410fa51c5","resolution":{"observed_at":"2026-08-07T10:27:03.926676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T10:26:58.495985Z","title":"Oquab, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.495985Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:8b0486e1dec4fc85272069259beb76b0344c272f0e2eb1026eccaf6aea3216fd","observation_id":"3b7a744a-7df0-48b2-b03e-9fbcea87adef","resolution":{"observed_at":"2026-08-07T10:26:58.495985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-07T10:26:58.556924Z","title":"Pont-Tuset, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.556924Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:6362b8a75177ceb76c5bd059879392a76ed1f770f5d3143d99753273e5a64b72","observation_id":"42c73411-c453-4acc-be82-4f89be80b56f","resolution":{"observed_at":"2026-08-07T10:26:58.556924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.915846Z","title":null,"venue":null,"work_id":"dd6ed747-09ad-4a02-96f7-8aaddb06d845","year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.650435Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:bbb674c8a1fb6b370a7b0e6e190f7441819eded2de6e377b8232866de6d65b10","observation_id":"76778535-a78d-40ee-991e-bd8795000eb3","resolution":{"observed_at":"2026-08-07T10:27:03.918396Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-07T10:26:58.719677Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.719677Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:fdb02c84aad01d298883d94939cc40975c3c6a39ee2ae141a8316f6d76853327","observation_id":"c6cc08d7-bbfa-4765-9ecf-de748d330a6f","resolution":{"observed_at":"2026-08-07T10:26:58.719677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.907289Z","title":"Ranasinghe, M","venue":null,"work_id":"3c037d3e-3026-4e33-b0ff-4c5ed2ee836c","year":2022},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.802843Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:16752befa499132902530db6ce1026955d89af17257a534685ff93b9f54888ff","observation_id":"12096951-7ea5-481a-97c3-1c5b1f02b4f4","resolution":{"observed_at":"2026-08-07T10:27:03.910214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.898920Z","title":"Ranzinger, G","venue":null,"work_id":"b46fabf7-22f2-435b-9db4-cc661c357a83","year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.847210Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:12fa1cdf3b690ae7c37097b8e28349eec8f39b9eeb17c32feca262d072f385e6","observation_id":"652e3848-feb2-48d4-a04c-a985cb022826","resolution":{"observed_at":"2026-08-07T10:27:03.901689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03640","last_updated":"2023-03-26T11:40:16Z","snapshot_observed_at":"2026-08-13T13:27:08.195314Z","submitted_at":"2022-12-06T18:59:58Z","title":"Fine-tuned CLIP Models are Efficient Video Learners","version":3},"cited_work":{"arxiv_id":"2212.03640","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.03640","snapshot_observed_at":"2026-08-07T10:27:02.056985Z","title":"Fine-tuned CLIP Models are Efficient Video Learners","venue":"cs.CV","work_id":"618cf4e9-5952-4d4b-962c-8e19b85e8745","year":2022},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.906976Z"},"links":{"cited_paper":"/paper/2212.03640","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:3c378a34bed690976b31d1eb412523d7532ad3dc675f9498beaafc03a3b7e9b6","observation_id":"7a21a2bd-f4da-43b5-b5d5-203e765557a6","resolution":{"observed_at":"2026-08-07T10:27:02.098834Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.890700Z","title":null,"venue":null,"work_id":"2e7340a3-29ff-4e68-8b4b-be9df25394a6","year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:58.961025Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:f542ce351841a529a26d267363cc7a1fd9f057afa700d41350e8bf9e494ed894","observation_id":"cd207a04-67fe-4ffa-a901-cf4d916bc411","resolution":{"observed_at":"2026-08-07T10:27:03.893723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T10:26:59.026576Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.026576Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:106efac498d39cdaac3dc14fdaddda04b1a4d1dafef4f4a4441cc0e821c100fd","observation_id":"59beb273-b3c3-423f-9071-09fde54c3d36","resolution":{"observed_at":"2026-08-07T10:26:59.026576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.882725Z","title":"Salehi, E","venue":null,"work_id":"0e979f9b-4ca9-4b56-bffa-0118a4de1982","year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.099479Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:dacd0243d9f4c9252db0fa82c45670b473bc8b0b350be6ab5c9a3afc44deb64d","observation_id":"608eebaa-edbd-464e-950f-02c5d95ccf1d","resolution":{"observed_at":"2026-08-07T10:27:03.885315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.874167Z","title":"Sameni, K","venue":null,"work_id":"b0385511-b801-43ce-9fb9-d3163dfa8ea7","year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.204553Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:e1f4abfe3b95336b741e0d4557dabe749d8c621e377f84d0d4c1fad2ddf36c41","observation_id":"1ce80e29-79f4-4392-8aa9-50d17e1f2385","resolution":{"observed_at":"2026-08-07T10:27:03.877127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06888","last_updated":"2018-03-20T01:02:45Z","snapshot_observed_at":"2026-08-06T23:17:14.219606Z","submitted_at":"2017-04-23T06:03:56Z","title":"Time-Contrastive Networks: Self-Supervised Learning from Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.06888","snapshot_observed_at":"2026-08-07T10:26:59.275835Z","title":"Sermanet, C","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.275835Z"},"links":{"cited_paper":"/paper/1704.06888","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:59478f5b1e2e7547b0fd50fb36e48401e9a285e0d2f32eb62fd4848542bd01d3","observation_id":"b57555d6-8a01-4aba-bf93-5214b165c6dc","resolution":{"observed_at":"2026-08-07T10:26:59.275835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02352","last_updated":"2024-06-09T23:21:28Z","snapshot_observed_at":"2026-08-13T04:27:32.750906Z","submitted_at":"2024-02-04T05:33:04Z","title":"Region-Based Representations Revisited","version":4},"cited_work":{"arxiv_id":"2402.02352","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.02352","snapshot_observed_at":"2026-08-07T10:27:01.853821Z","title":"Region-Based Representations Revisited","venue":"cs.CV","work_id":"3b15c0c3-db35-4d77-a610-7a776ba0c263","year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.295328Z"},"links":{"cited_paper":"/paper/2402.02352","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:3724935a81ac90dbe4de08b2da287cc27562792094c11695c5d7aadc5c9aaa04","observation_id":"0621d52f-41f0-41d0-9c51-022ea67875d6","resolution":{"observed_at":"2026-08-07T10:27:01.941110Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-13T22:00:40.727122Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T10:26:59.394650Z","title":"Soomro, A","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.394650Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:f7c211c4527083a4db5bb0d2fda2ab328e4a1d58ec967614c29a91e6b1d5676b","observation_id":"1c7a520e-a0e3-412a-ba9e-825a4f371110","resolution":{"observed_at":"2026-08-07T10:26:59.394650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-07T10:26:59.459159Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.459159Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:cc4b337d008cb285361ea3aa5d97e33825f73a1acadfa326f75773c1303cc7d8","observation_id":"3a3ce278-b861-4ab0-a19b-46b89a94b4c6","resolution":{"observed_at":"2026-08-07T10:26:59.459159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14548","last_updated":"2024-07-11T11:47:26Z","snapshot_observed_at":"2026-08-13T00:48:31.035055Z","submitted_at":"2024-03-21T16:49:20Z","title":"DINO-Tracker: Taming DINO for Self-Supervised Point Tracking in a Single Video","version":2},"cited_work":{"arxiv_id":"2403.14548","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14548","snapshot_observed_at":"2026-08-07T10:27:01.637889Z","title":"DINO-Tracker: Taming DINO for Self-Supervised Point Tracking in a Single Video","venue":"cs.CV","work_id":"9acee603-919a-404d-bc9f-664dceda1c9b","year":2024},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.573734Z"},"links":{"cited_paper":"/paper/2403.14548","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:f2280860a67e29ffe0ce07d1de5198f3a7369fc95c0612264182bda7a623e357","observation_id":"fb5b97ec-663e-4590-9d54-37f6a8ed3860","resolution":{"observed_at":"2026-08-07T10:27:01.699803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr.2017.531","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Valmadre, L","venue":null,"work_id":"88f82f58-cdc2-4ce7-a879-3efcf34dadac","year":2017},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.674156Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:30d1bc5f099499bc8761905f9ef1e79c6413ff0bb1579a55f22da4ed746f3f98","observation_id":"2f9870ff-2b68-403d-8327-29aecad9838a","resolution":{"observed_at":"2026-08-07T10:27:01.113263Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-08-13T18:09:42.014649Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-07T10:26:59.796244Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.796244Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:9f47e51b80ba6f0a9560516e6f37671f465b8251acd77828201e9749eeaf921c","observation_id":"f133875f-465d-4055-a12b-a1b2bf6f951e","resolution":{"observed_at":"2026-08-07T10:26:59.796244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.731320Z","title":null,"venue":null,"work_id":"7e21bfb0-f567-4143-b329-d93623a25150","year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.872388Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:66fd676240f36841644409a324016287e79f3fe2517376f3b908578468865f4c","observation_id":"2dc564fe-bf92-48f4-99b6-c24d41690e48","resolution":{"observed_at":"2026-08-07T10:27:03.854216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.550347Z","title":null,"venue":null,"work_id":"48d47269-3855-474b-85e1-cb6b814de028","year":2019},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.957771Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:602516b4529989b500239d1b2d2e1dbba96fc97220aedcf51d40b7b6d20c98c5","observation_id":"f4b16e50-ff0d-48d3-86ab-c1d5d1630fc5","resolution":{"observed_at":"2026-08-07T10:27:03.635499Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:03.358371Z","title":null,"venue":null,"work_id":"547bf98d-1371-4a04-a651-d08acb69a8e3","year":2022},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:00.064803Z"},"links":{"citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:80b74c1d396e8021e79370c3816c948d41547536ece691c4e710c50b72187285","observation_id":"66795952-0924-49bf-8abd-8f5f9b65fd93","resolution":{"observed_at":"2026-08-07T10:27:03.472517Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18954","last_updated":"2023-10-29T09:55:28Z","snapshot_observed_at":"2026-08-13T05:38:13.492721Z","submitted_at":"2023-10-29T09:55:28Z","title":"Mask Propagation for Efficient Video Semantic Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18954","snapshot_observed_at":"2026-08-07T10:27:00.201356Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:00.201356Z"},"links":{"cited_paper":"/paper/2310.18954","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:279f313cbed3fda031d21800f0f83909ed542ba6006a85e0be820f3d970b37a7","observation_id":"89638095-e7d9-4b61-9ddd-6e42162a3f61","resolution":{"observed_at":"2026-08-07T10:27:00.201356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.05659","last_updated":"2021-03-18T21:08:52Z","snapshot_observed_at":"2026-08-13T21:52:27.044485Z","submitted_at":"2020-08-13T03:02:32Z","title":"What Should Not Be Contrastive in Contrastive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.05659","snapshot_observed_at":"2026-08-07T10:27:00.313883Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:00.313883Z"},"links":{"cited_paper":"/paper/2008.05659","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:a105a20f2459ef339463d2619be4e0aa2e523176023c96e7f5e363382663b15e","observation_id":"ff2ce6b6-5e65-47c3-b5fe-22e9f8f83219","resolution":{"observed_at":"2026-08-07T10:27:00.313883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.17263","last_updated":"2021-10-14T01:44:48Z","snapshot_observed_at":"2026-08-13T07:18:31.408654Z","submitted_at":"2021-03-31T17:56:35Z","title":"Rethinking Self-supervised Correspondence Learning: A Video Frame-level Similarity Perspective","version":5},"cited_work":{"arxiv_id":"2103.17263","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.17263","snapshot_observed_at":"2026-08-07T10:27:01.426515Z","title":"Rethinking Self-supervised Correspondence Learning: A Video Frame-level Similarity Perspective","venue":"cs.CV","work_id":"cc3d6965-33ec-4126-a725-892c5c7947cd","year":2021},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:00.453266Z"},"links":{"cited_paper":"/paper/2103.17263","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:2de7c47233144df692816946ff9737e20f76f856b242de4879453ddfa786dc45","observation_id":"fff358bb-25ac-4658-9b82-c9e02b7bb5a2","resolution":{"observed_at":"2026-08-07T10:27:01.507949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02066","last_updated":"2023-04-07T01:10:17Z","snapshot_observed_at":"2026-08-13T15:30:01.146313Z","submitted_at":"2022-06-04T23:16:52Z","title":"PIDNet: A Real-time Semantic Segmentation Network Inspired by PID Controllers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.02066","snapshot_observed_at":"2026-08-07T10:27:00.565630Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:00.565630Z"},"links":{"cited_paper":"/paper/2206.02066","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:88c152e3cf9d981f0d5a70939659a380d7a68cef49da083d4ae3d33536811bf6","observation_id":"d28aa240-261e-4ce8-9022-5197386c229c","resolution":{"observed_at":"2026-08-07T10:27:00.565630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.03327","last_updated":"2018-09-06T04:19:45Z","snapshot_observed_at":"2026-07-06T07:00:12.122241Z","submitted_at":"2018-09-06T04:19:45Z","title":"YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.03327","snapshot_observed_at":"2026-08-07T10:27:00.674386Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:00.674386Z"},"links":{"cited_paper":"/paper/1809.03327","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:694ac1a3d47cd03094106def29acb835f494d9014b3399c98b0b5c2734244939","observation_id":"c0f9be20-457d-4a22-923c-6fe834b27fb4","resolution":{"observed_at":"2026-08-07T10:27:00.674386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13305","last_updated":"2023-12-20T03:01:33Z","snapshot_observed_at":"2026-08-13T04:58:01.126853Z","submitted_at":"2023-12-20T03:01:33Z","title":"DVIS++: Improved Decoupled Framework for Universal Video Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13305","snapshot_observed_at":"2026-08-07T10:27:00.801887Z","title":"Zhang, X","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:00.801887Z"},"links":{"cited_paper":"/paper/2312.13305","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:a192792ad15dd3823a728e21573be468ef87f70dd94ca6be60a366215e306bff","observation_id":"f065b8b8-0aa2-4922-9686-68ad0db7794d","resolution":{"observed_at":"2026-08-07T10:27:00.801887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.00661","last_updated":"2018-08-10T09:46:46Z","snapshot_observed_at":"2026-07-06T06:53:38.986055Z","submitted_at":"2018-08-02T04:24:36Z","title":"Adaptive Temporal Encoding Network for Video Instance-level Human Parsing","version":2},"cited_work":{"arxiv_id":"1808.00661","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.00661","snapshot_observed_at":"2026-08-07T10:27:01.242884Z","title":"Adaptive Temporal Encoding Network for Video Instance-level Human Parsing","venue":"cs.CV","work_id":"bd8ac4f6-99c5-4113-b785-289b07988e1c","year":2018},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:00.912867Z"},"links":{"cited_paper":"/paper/1808.00661","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:7989b5bc8cc76787c2d2b6efa6c5a12c868c652c8345ba549c3749088e9d8d79","observation_id":"932e4234-7db9-49b8-819a-e7ead73a5e3c","resolution":{"observed_at":"2026-08-07T10:27:01.307432Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.06377","last_updated":"2021-12-19T19:23:25Z","snapshot_observed_at":"2026-08-12T16:27:34.120981Z","submitted_at":"2021-11-11T18:46:40Z","title":"Masked Autoencoders Are Scalable Vision Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.06377","snapshot_observed_at":"2026-08-07T10:26:57.705213Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:57.705213Z"},"links":{"cited_paper":"/paper/2111.06377","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:6b3d9310d45f7c432a2ae0f07e80fc2863ac9be4fe4b7da77059d1c722df49bf","observation_id":"d678e2af-5d5f-4479-b05a-e88dd39b194c","resolution":{"observed_at":"2026-08-07T10:26:57.705213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T23:55:56.451144Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":35,"verified_exact":10,"verified_fuzzy":9},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2506.05543."}