{"as_of":"2026-08-11T10:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4cbced9b2486ae58d99b1898808cf0ff957d7fea2a09d2c3da762bc32a13c3d3","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:26:05.265658Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T21:29:27.063028Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T21:35:04.650377Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"cited_work":{"arxiv_id":"2506.14356","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14356","snapshot_observed_at":"2026-06-30T21:35:04.650377Z","title":"Eva02-at: Egocentric video-language understanding with spatial-temporal ro- tary positional embeddings and symmetric optimization","venue":null,"work_id":"be0cdc8c-e252-4e3f-98e3-b553d3488d58","year":null},"citing_paper":{"arxiv_id":"2605.14742","last_updated":"2026-05-14T12:10:27Z","snapshot_observed_at":"2026-07-06T23:26:09.066863Z","submitted_at":"2026-05-14T12:10:27Z","title":"EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T21:29:27.063028Z"},"links":{"cited_paper":"/paper/2506.14356","citing_paper":"/paper/2605.14742"},"observation_digest":"sha256:dc4506c06511d6920b3b0f8d3a9110a64b359f9fc53fdd0b74359f93ffc7a26a","observation_id":"f36432fc-d3bc-424a-92ef-4a6a6846fb18","resolution":{"observed_at":"2026-06-30T21:35:04.652174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14356/citation-record","integrity":"/paper/2506.14356/integrity","json":"/paper/2506.14356/citation-record.json","paper":"/paper/2506.14356"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.545059Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":"12bdba57-255a-4f08-8f4c-2226dd5ff71f","year":2017},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:59.431559Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:ccfd330595733ddd9537b50cbc6890ebe2ba4ad97ac2aadae75ce2cc12ac838b","observation_id":"3b3039c5-4f63-43b2-96a1-d4c4fc357c19","resolution":{"observed_at":"2026-08-07T00:26:10.550525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.531094Z","title":"Video summarization through reinforcement learning with a 3d spatio- temporal u-net,","venue":null,"work_id":"2cc18413-a434-452e-8b0c-d7a46b69b636","year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:59.542659Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:fba30d8a112bf50e3608b3ac1554317ddfdfc35ac0befc14165cd409e7ec6b62","observation_id":"3b05827e-9bcb-4504-b918-91617a462caa","resolution":{"observed_at":"2026-08-07T00:26:10.535398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.516992Z","title":"Deep attention network for egocentric action recognition,","venue":null,"work_id":"5ef82d32-7b2d-4d41-9789-e61336fe728c","year":2019},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:59.700863Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:41d25682f58dc1fbbe2cc582f90a34d2c57ac442a5e6b32578aff9516fd87029","observation_id":"b2e2b62d-3ff3-42f4-b510-693cd4de7b11","resolution":{"observed_at":"2026-08-07T00:26:10.521628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16669","last_updated":"2023-09-28T17:59:50Z","snapshot_observed_at":"2026-07-06T16:25:05.493379Z","submitted_at":"2023-09-28T17:59:50Z","title":"Training a Large Video Model on a Single Machine in a Day","version":1},"cited_work":{"arxiv_id":"2309.16669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.16669","snapshot_observed_at":"2026-08-07T00:26:05.896375Z","title":"Training a Large Video Model on a Single Machine in a Day","venue":"cs.CV","work_id":"8c42d068-7973-4b68-a59f-bce8ede97627","year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:59.818943Z"},"links":{"cited_paper":"/paper/2309.16669","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:acc8c89959d403d355f6a87194053aab9c5fb4c54d8abdb996b16324ab9d1cef","observation_id":"416ae5dc-9eea-4ae5-8c37-38a17c72361d","resolution":{"observed_at":"2026-08-07T00:26:05.951232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T00:25:59.990074Z","title":"Internvideo: General video foundation models via gen- erative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:59.990074Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:97b5d90898e11f19d94442cfd05f983ebe6e2ed665978debcd5d3776811918f2","observation_id":"c5d6b164-6f58-4f03-a66e-b3565b0bde8d","resolution":{"observed_at":"2026-08-07T00:25:59.990074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-10T11:36:03.411225Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-08-07T00:26:00.161920Z","title":"InternVideo2: Scaling foundation models for multimodal video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:00.161920Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:1a0700ba85a80c810ff9b64fdc26541947744c4fece99017be79ac59b2aef0e0","observation_id":"0c6c2b82-1304-4e98-8301-7975bacc3446","resolution":{"observed_at":"2026-08-07T00:26:00.161920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.503788Z","title":"EgoVLPv2: Egocentric video-language pre-training with fusion in the backbone,","venue":null,"work_id":"49845ecb-79be-4416-9a5e-23f3d6c5736a","year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:00.334603Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:9bba02441349f5bd1a1e3954888591bce9eab06009586a73700e5f8878733abd","observation_id":"a2d5163b-29bd-4182-9040-32cfece62edd","resolution":{"observed_at":"2026-08-07T00:26:10.507959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.491035Z","title":"Egocentric video-language pretraining,","venue":null,"work_id":"17a06723-3003-4dc7-b584-d6d88895eed3","year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:00.477538Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:0c2b9cc85e89c3d6e4b028c9238e04cc09ee6079e09d9002b969148cfd36a62b","observation_id":"82d49f24-f819-402c-81c9-472ae702a1bd","resolution":{"observed_at":"2026-08-07T00:26:10.495279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.476823Z","title":"Improving semantic video retrieval models by training with a relevance-aware online mining strategy,","venue":null,"work_id":"7039cbee-f62b-4ce0-9116-1ed9ab160a9f","year":2024},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:00.576434Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:14227ff4f896161018659c3e1001b46ed29bc4bb76367a5996bd5dfbc4d300f1","observation_id":"144cc8dd-9c57-48e0-8412-8e9a04012dba","resolution":{"observed_at":"2026-08-07T00:26:10.481056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.463601Z","title":"Learning video representations from large language models,","venue":null,"work_id":"a0bf7269-09ad-4d6f-ba1e-08530cb9e887","year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:00.716989Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:5e23afe7a2a9b77aba9530178fd9cab62046b76fba338d6ece525b760d292703","observation_id":"04357bdc-9f02-452b-ae9e-54018f9be793","resolution":{"observed_at":"2026-08-07T00:26:10.467688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18070","last_updated":"2024-07-01T02:44:11Z","snapshot_observed_at":"2026-08-03T16:08:46.390961Z","submitted_at":"2024-06-26T05:01:37Z","title":"EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18070","snapshot_observed_at":"2026-08-07T00:26:00.852320Z","title":"Egovideo: Exploring egocentric foundation model and downstream adaptation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:00.852320Z"},"links":{"cited_paper":"/paper/2406.18070","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:21313f026dad9ff58d4e4e67d4d59ef14a22ed82da5a258315bb34f12df79c43","observation_id":"f9ec9a56-fbec-4170-bf4d-b6170093b1b6","resolution":{"observed_at":"2026-08-07T00:26:00.852320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.448161Z","title":"Videomae: Masked autoen- coders are data-efficient learners for self-supervised video pre-training,","venue":null,"work_id":"31fc437f-07f0-4869-a40d-38fc2391131c","year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:01.017157Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:6735b51aafc29fafe80a507707d43f70d17374dbb4cc7211212906acfb8bd3a2","observation_id":"93e8b51b-8004-400e-9a20-d4c80012e913","resolution":{"observed_at":"2026-08-07T00:26:10.453114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-07T00:26:01.224115Z","title":"Laion-400m: Opendatasetofclip-filtered400millionimage-textpairs,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:01.224115Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:a9078a069869fd52b2342a3a9728fd2c3d3d3074003ce71b8bade8fa44af8103","observation_id":"3aa1e723-af16-4d5f-8aa8-4345f828d67c","resolution":{"observed_at":"2026-08-07T00:26:01.224115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.433895Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation,","venue":null,"work_id":"7bf16bb4-4c9a-4db7-ba6d-5abd7719db34","year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:01.393406Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:b7c87d5be6e30955129e357d5fadbfc3997e796171c8111a03485e58f6a6348a","observation_id":"4cda262c-684a-4f56-9402-0d6eabd98073","resolution":{"observed_at":"2026-08-07T00:26:10.437990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T00:26:01.534507Z","title":"Qwen2-VL: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:01.534507Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:59bc8735c7bae4fd2612307d8ba10e470b88091adfe380f2f014538857efcbf2","observation_id":"69ab1970-654d-4c41-a237-ef7ac463104c","resolution":{"observed_at":"2026-08-07T00:26:01.534507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-07T00:26:01.692337Z","title":"EVA-CLIP: Improved training techniques for clip at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:01.692337Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:d925401ba7c5c98c98fbd0694d8df87ba049facdd329881e2edef219eba224c4","observation_id":"7fbc78e4-1606-4303-b25e-ece1889a162a","resolution":{"observed_at":"2026-08-07T00:26:01.692337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T00:26:01.868488Z","title":"CogVideoX: Text- to-video diffusion models with an expert transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:01.868488Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:645037cfb598dc94f1927d9a84fc89d82cfb953c5e621b94d0c8740dd8766783","observation_id":"7176760f-561d-43fe-bc91-9b9f7c99fb15","resolution":{"observed_at":"2026-08-07T00:26:01.868488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11331","last_updated":"2023-03-22T14:10:37Z","snapshot_observed_at":"2026-08-07T07:27:03.329708Z","submitted_at":"2023-03-20T17:59:59Z","title":"EVA-02: A Visual Representation for Neon Genesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11331","snapshot_observed_at":"2026-08-07T00:26:01.964467Z","title":"EVA-02: A visual representation for neon genesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:01.964467Z"},"links":{"cited_paper":"/paper/2303.11331","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:6553a298e9050e7b07ea8ad9c207a2853948adc3b951efe2d0cedd79e0766aa5","observation_id":"0c2c0630-67ea-4f02-96fb-a8e0cd32a142","resolution":{"observed_at":"2026-08-07T00:26:01.964467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.420287Z","title":"Multi- similarity loss with general pair weighting for deep metric learning,","venue":null,"work_id":"6ff34638-46f5-4e00-af32-f257390ddc45","year":2019},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.137317Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:556b1b15d6cc65c720d98469374105e6a36b8d3568aa3ddf573092966524b04b","observation_id":"45c01c0e-2c0c-4446-ae29-20e8d6fed1c2","resolution":{"observed_at":"2026-08-07T00:26:10.424959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.356807Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video,","venue":null,"work_id":"1ec8c652-f272-458d-8af8-562fad46fc50","year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.208447Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:770102157b46e3ef2fbb743dfe99439d526c40ffea643f780dd25cb2b56f99f8","observation_id":"ab8d33a3-8344-4b78-99e6-7feda72268a3","resolution":{"observed_at":"2026-08-07T00:26:10.410562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:10.001275Z","title":"Rescaling egocentric vision: Collection, pipeline and challenges for epic-kitchens- 100,","venue":null,"work_id":"53f95643-3b3b-45ae-a439-75e8940fc674","year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.280538Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:de168e122d1f27694da9731a27e1d430035b7d6a8a716a3f83af627921721739","observation_id":"7aed2aee-2f71-4fe6-bcdd-308d381bc970","resolution":{"observed_at":"2026-08-07T00:26:10.218130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:09.768033Z","title":"Scaling egocentric vision: The epic-kitchens dataset,","venue":null,"work_id":"2274a564-688c-4883-b492-b31af28cbfde","year":2018},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.395824Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:251a5bad21f2cf54e6495fd6de374f1026de81654bb5fa74f8747b9ec58dfb0c","observation_id":"7ba327eb-6879-4ede-adc7-5b81d3a058b7","resolution":{"observed_at":"2026-08-07T00:26:09.831272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09626","last_updated":"2018-04-30T16:57:00Z","snapshot_observed_at":"2026-08-07T16:08:52.487917Z","submitted_at":"2018-04-25T15:30:27Z","title":"Charades-Ego: A Large-Scale Dataset of Paired Third and First Person Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.09626","snapshot_observed_at":"2026-08-07T00:26:02.474819Z","title":"Charades-ego: A large-scale dataset of paired third and first person videos,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.474819Z"},"links":{"cited_paper":"/paper/1804.09626","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:f240141df29d2954057c9183ea39405d565c770744898344026ec11d71099960","observation_id":"f8f59c61-0302-4d25-aa0e-c79e170886c6","resolution":{"observed_at":"2026-08-07T00:26:02.474819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:02.579192Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.579192Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:8277cdd54e70155cd5069a3d7d26988b251783a2698fe8ec9c6f0aa3414ffef9","observation_id":"7c7b3501-3185-4670-a377-336c7b19a095","resolution":{"observed_at":"2026-08-07T00:26:02.579192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:09.608099Z","title":"Is space-time attention all you need for video understanding?","venue":null,"work_id":"56df40cf-199c-4900-a321-65a4edb60fcb","year":2021},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.688759Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:58ee9a326db60db11b130ccf4987041c2716bd6e48b8277169228b12dc126604","observation_id":"0f86341f-085c-4b6c-9496-678cb767245d","resolution":{"observed_at":"2026-08-07T00:26:09.719279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:02.803661Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.803661Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:0726a5b563f6b3a453220336144d36f34ef4044e4cd32e969112b89f7a9a3d08","observation_id":"8a3e82d7-031b-4fea-b2b7-9e35cac358e4","resolution":{"observed_at":"2026-08-07T00:26:02.803661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:09.271971Z","title":"VideoMAE V2: Scaling video masked autoencoders with dual masking,","venue":null,"work_id":"7d17afe8-1eb0-4a5f-828b-224088d18e5b","year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.910107Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:30571977ac970b81a5e72474873605a6813a78d6c8ac09cf6980c6732b716c96","observation_id":"df4130a7-8ddd-434b-a195-251c34c4c424","resolution":{"observed_at":"2026-08-07T00:26:09.436074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:09.029258Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":"3c6dc81f-b672-4964-a4d3-3c00466b3103","year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:02.983354Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:74757973f9a59e51373e78fe28c7d878d1639e18dd1d60b8c3b0d56c1af77a7e","observation_id":"47013c40-a70d-4d51-b498-12e7e211c017","resolution":{"observed_at":"2026-08-07T00:26:09.120647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:08.758606Z","title":"Roformer: En- hanced transformer with rotary position embedding,","venue":null,"work_id":"7a399c8a-9c17-40c8-99cc-3a6fc4e09ba9","year":2024},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.094336Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:b6370c97c4bb2df499ccebe93154e445aca5619b3f4910bb35fabc9c11608287","observation_id":"46fab9ae-e11f-4030-a325-dc9b400980ad","resolution":{"observed_at":"2026-08-07T00:26:08.908407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T00:26:03.203928Z","title":"Video-LLaMA: An instruction- tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.203928Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:037fda000a70ea95b2ef352391ec52b28bfe78f51572258d0fa329c7fb2ef89d","observation_id":"d3b604c5-7e92-45b2-bcb2-12430e34096d","resolution":{"observed_at":"2026-08-07T00:26:03.203928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-07T00:26:03.315947Z","title":"VideoRoPE:Whatmakesforgood video rotary position embedding?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.315947Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:c14e01032e3e07be4eda2bfd6c2b87f8952eabcf9f4214339a3bce20e484cfc6","observation_id":"72d0da19-90bd-49a7-bad9-1dce2fcd7bc2","resolution":{"observed_at":"2026-08-07T00:26:03.315947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:08.484620Z","title":"Supervised contrastive learn- ing,","venue":null,"work_id":"21d3436c-f07b-4684-88cf-65ac270063de","year":2020},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.397899Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:42287ae02e5e789edd64bcf9c55d6016f06a138e05f84e21c4feaa5f4d974769","observation_id":"1db5d195-264f-4332-b8ae-69d2eef1df4c","resolution":{"observed_at":"2026-08-07T00:26:08.615395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:08.191077Z","title":"Parameter-free deep multi-modal clustering with reliable contrastive learning,","venue":null,"work_id":"c0646ee9-410f-476b-a8bd-fef486e9b8ca","year":2025},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.518745Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:9fb9306ae678db29ea68fe71dba960b52eecae3c81cebb74584377779e5c4a97","observation_id":"a6dcc2cf-ea91-4430-a219-604ca220f721","resolution":{"observed_at":"2026-08-07T00:26:08.308703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:07.895695Z","title":"Cross-modal contrastive learning network for few-shot action recognition,","venue":null,"work_id":"06e57213-e346-440a-a000-70ab97390883","year":2024},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.600867Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:dc2d376b4c41077dc577fbe14e3f3cc7737a58de1a433443b619ff0d3a211adc","observation_id":"34495b16-3787-4229-aac2-8c1013cfe167","resolution":{"observed_at":"2026-08-07T00:26:08.040114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T00:26:03.695009Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.695009Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:393bbe753fa3c81dc9c114f09581065141f3f6f1dc221a6bfe9e1825cb0b18bf","observation_id":"2423d424-3315-4b21-a30c-f5c861e37277","resolution":{"observed_at":"2026-08-07T00:26:03.695009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:07.776699Z","title":"End-to-end learning of visual representations from uncurated instructional videos,","venue":null,"work_id":"e0783bce-59e4-41ae-ae36-ef7637fcbf13","year":2020},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.805158Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:8d14dcf0ae2261091fe20435ae10a427435569af6f2d740636325cf3557abd54","observation_id":"30bce6e3-7aa2-4791-a3b7-8242b8c22b93","resolution":{"observed_at":"2026-08-07T00:26:07.827552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:07.674401Z","title":"Facenet: A unified embed- ding for face recognition and clustering,","venue":null,"work_id":"b231ae7b-afbe-4f75-ad5d-a1a1e4dd451b","year":2015},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.911202Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:d1cb4d25aa6f5314379879a635085313ce7f156a1abfb08d844fc5544f114b3f","observation_id":"dd7dbc9d-7868-4a71-ae29-fec6e005ca2f","resolution":{"observed_at":"2026-08-07T00:26:07.728889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:07.563644Z","title":"Circle loss: A unified perspective of pair similarity optimization,","venue":null,"work_id":"df3bf06e-1fe2-4d3e-b80f-7c10d833f68c","year":2020},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:03.992358Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:edf07c54787692d55d097ac24684fffbc89b6c1600c5011a872a04495d7c6ad8","observation_id":"5858fc87-7a64-427c-8795-10f7672704a3","resolution":{"observed_at":"2026-08-07T00:26:07.605657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:07.437811Z","title":"Relevance-based margin for contrastively-trained video retrieval mod- els,","venue":null,"work_id":"840c8a67-8907-448f-8fac-8dc72681b974","year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.100339Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:1574a771e897774c946354ae8e41b9002fe604c086ede734b56b16fe9364c0f3","observation_id":"49ed26cd-60af-4674-93e2-0eb323b8581d","resolution":{"observed_at":"2026-08-07T00:26:07.497252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:07.277979Z","title":"Masked video distillation: Rethinking masked feature modeling for self-supervised video representation learning,","venue":null,"work_id":"486e391f-8aff-4b0a-bb81-fd0c600ddc8f","year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.178813Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:4c3bf19e41e7ce0f6cce7700fbd54a40d2ac538243a35518d0e5e8228abc1a30","observation_id":"677b1418-3e49-410a-a9de-4e81b4db830a","resolution":{"observed_at":"2026-08-07T00:26:07.350471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:07.146652Z","title":"Fine-grained action retrieval through multiple parts-of-speech embeddings,","venue":null,"work_id":"79df891b-7f17-4df2-ae27-72fba1d68a1c","year":2019},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.268357Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:78c8d2d7d64bff16b9413c7df0fac2dbd3fb5764c65ec0ca31f1589b7cc87e6b","observation_id":"2f8337f0-1222-4470-8bbf-3b7e10e8222a","resolution":{"observed_at":"2026-08-07T00:26:07.212680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:06.999967Z","title":"On semantic similarity in video retrieval,","venue":null,"work_id":"72d1b89f-0611-41cb-aeb3-615aaadaf207","year":2021},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.332494Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:7ba0558aebd838c282efe4c07681a602114224226992099e6cb6e61e60b5c6b9","observation_id":"aa116c9e-61d8-4509-b642-0b598643aea5","resolution":{"observed_at":"2026-08-07T00:26:07.075302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01334","last_updated":"2022-08-03T12:08:50Z","snapshot_observed_at":"2026-08-10T00:32:32.625121Z","submitted_at":"2022-07-04T11:32:48Z","title":"Egocentric Video-Language Pretraining @ EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge 2022","version":2},"cited_work":{"arxiv_id":"2207.01334","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.01334","snapshot_observed_at":"2026-08-07T00:26:05.549051Z","title":"Egocentric Video-Language Pretraining @ EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge 2022","venue":"cs.CV","work_id":"676d24ea-6ece-46f8-aa90-d290fe62c337","year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.405236Z"},"links":{"cited_paper":"/paper/2207.01334","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:547f43b7cc453f47783504236938e6b24beb64320b9eb3ec97cf6948ae4bfe0a","observation_id":"431349d9-3713-4553-afbb-2d7961ed415d","resolution":{"observed_at":"2026-08-07T00:26:05.630065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:06.898694Z","title":"Collecting highly parallel data for paraphrase evaluation,","venue":null,"work_id":"460fe5d0-dfb6-430e-9cf3-5d3d9c3f529f","year":2011},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.491269Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:1afcc32d161315c95e0f486d0d1b5f55390e40ed001c4c446cef65ead0e82a8b","observation_id":"d653bc96-b238-49b9-bc71-1b6c966c223c","resolution":{"observed_at":"2026-08-07T00:26:06.939788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:06.801439Z","title":"Epic-fusion: Audio-visual temporal binding for egocentric action recognition,","venue":null,"work_id":"277ddf55-4c35-4bd1-adaf-3db4a2932ce4","year":2019},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.577115Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:75b4be9d31e92ad5980a7371275975b92509ed1a5076033bca8685ce3f151a8d","observation_id":"f784b997-ab31-4fbf-b6d6-9a2195580094","resolution":{"observed_at":"2026-08-07T00:26:06.834335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:04.664578Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.664578Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:748b0d364dd37bd3b23a76729d52ee3b930c19c5a7480140e661bd10664d3129","observation_id":"1b72421b-4411-4f93-bd51-689cb203ecfb","resolution":{"observed_at":"2026-08-07T00:26:04.664578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:06.685540Z","title":"HowTo100M: Learning a text-video embedding by watching hundred million narrated video clips,","venue":null,"work_id":"871a7370-5adf-4849-b1cf-0abfbf93d1cf","year":2019},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.750789Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:9e818f74899a74539aaa2e29e3bb82b099662aa4d58dc471ae82f579868c621c","observation_id":"7a5978af-2eed-4efd-9175-fb775f39d593","resolution":{"observed_at":"2026-08-07T00:26:06.732224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:06.515756Z","title":"Rethinking spatiotem- poral feature learning: Speed-accuracy trade-offs in video classification,","venue":null,"work_id":"c2d7a185-c15a-4d0a-80e0-4682f68591ab","year":2018},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.815632Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:f21d53f00add2314e12422ffa156f56b8b9ff20db52d9bdaaa49d9bfbefe01ce","observation_id":"cc0c3d76-bd7f-44da-b907-3baf74be4d47","resolution":{"observed_at":"2026-08-07T00:26:06.594967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:06.337807Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":"b35dffe5-fc03-442f-9484-6bdc85562a08","year":2021},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.888141Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:e69a6b8438cb2c5538fe545426eaadaa2fad47edb9b0e3046484b4dbadfd67f6","observation_id":"b475f87a-9c8c-4317-b1b7-9243d14519ca","resolution":{"observed_at":"2026-08-07T00:26:06.422516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:06.191997Z","title":"Hiervl: Learning hierarchical video-language embeddings,","venue":null,"work_id":"d7615d00-7bd9-4be8-8016-76f50fb16a0c","year":2023},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:04.957092Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:d45f1375943b58a367a7054c139b5cbe7b49a2e132bb8ce846f9a9fdf8ff0e17","observation_id":"e9c8fe45-b40d-420a-b7cb-4a383d5660b0","resolution":{"observed_at":"2026-08-07T00:26:06.261608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09462","last_updated":"2024-06-13T03:57:38Z","snapshot_observed_at":"2026-08-09T20:28:18.224519Z","submitted_at":"2024-06-13T03:57:38Z","title":"SViTT-Ego: A Sparse Video-Text Transformer for Egocentric Video","version":1},"cited_work":{"arxiv_id":"2406.09462","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09462","snapshot_observed_at":"2026-08-07T00:26:05.409485Z","title":"SViTT-Ego: A Sparse Video-Text Transformer for Egocentric Video","venue":"cs.CV","work_id":"1164429b-84ae-41f1-b3a8-cba66b974c4b","year":2024},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:05.023665Z"},"links":{"cited_paper":"/paper/2406.09462","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:5b378d83e69dc45c9e2a4343652d5d4eb252eef7d3e834631f08972d4169592f","observation_id":"c85f5577-4f51-4526-b62d-8f395bb174e9","resolution":{"observed_at":"2026-08-07T00:26:05.459079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:26:06.045025Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"a411e3c0-e8d1-4e8c-b1a3-ab7fabe79527","year":2019},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:05.111484Z"},"links":{"citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:03a11d8f1d194f640e065424d3e4506bd483ab52d14221be813c89d08a6e9152","observation_id":"5ecc0798-5e90-4dfe-858a-40557e35fb32","resolution":{"observed_at":"2026-08-07T00:26:06.125884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-07T00:26:05.197274Z","title":"DistilBERT, a distilled version of bert: smaller, faster, cheaper and lighter,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:05.197274Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:741a6886e6ab43641674f7e32659f912ef6d0c873a0f81cb35898e64ca571994","observation_id":"4be5b5db-e73a-4a44-8640-2a6d06e242af","resolution":{"observed_at":"2026-08-07T00:26:05.197274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T00:26:05.265658Z","title":"RoBERTA: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:26:05.265658Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:16ef450c1537c082392a443bf43a3cb8910eb3e61879388c2fc5d93175964717","observation_id":"784e0a32-bc55-4749-9325-564a43c2f4c0","resolution":{"observed_at":"2026-08-07T00:26:05.265658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":3,"verified_fuzzy":34},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2506.14356."}