{"as_of":"2026-08-17T17:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:acabea8b79f68a8d3392ac508e5776e7b7f9b7db3c20b997f86d47c2ba7fdc8b","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T23:26:20.608195Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:01:16.563055Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T04:09:35.177453Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04144","snapshot_observed_at":"2026-08-07T13:51:40.469649Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20788","last_updated":"2025-07-28T11:15:36Z","snapshot_observed_at":"2026-08-14T14:14:57.213324Z","submitted_at":"2025-05-27T06:48:59Z","title":"Enhancing Wearable Tap Water Audio Detection through Subclass Annotation in the HD-Epic Dataset","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:40.469649Z"},"links":{"cited_paper":"/paper/2502.04144","citing_paper":"/paper/2505.20788"},"observation_digest":"sha256:b92a0f084920ee05c256c276ae028e6d99416c1c6add559f0abd300e769bdff8","observation_id":"6b2dc4de-d3ef-48d2-b925-a88263011032","resolution":{"observed_at":"2026-08-07T13:51:40.469649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04144","snapshot_observed_at":"2026-08-07T12:33:37.342897Z","title":"Hd-epic: A highly-detailed egocentric video dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24287","last_updated":"2025-05-30T07:02:00Z","snapshot_observed_at":"2026-08-16T13:31:11.981941Z","submitted_at":"2025-05-30T07:02:00Z","title":"EgoExOR: An Ego-Exo-Centric Operating Room Dataset for Surgical Activity Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:37.342897Z"},"links":{"cited_paper":"/paper/2502.04144","citing_paper":"/paper/2505.24287"},"observation_digest":"sha256:33cf2c22e6c9c00d8e202f3466865783c1c9ab433228447fa75e6e1576f1dffd","observation_id":"54f43393-f7a1-4e3a-bc4c-e77a68170581","resolution":{"observed_at":"2026-08-07T12:33:37.342897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04144","snapshot_observed_at":"2026-08-07T05:49:53.375278Z","title":"Hd-epic: A highly-detailed egocentric video dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-17T11:12:16.797379Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.375278Z"},"links":{"cited_paper":"/paper/2502.04144","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:a20cae7303dc878ad023ffadd6f12f7f9ec97d501e0c41b8191f172b80864fc3","observation_id":"cb94633a-c344-46d0-a195-ee1cbbcc352c","resolution":{"observed_at":"2026-08-07T05:49:53.375278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04144","snapshot_observed_at":"2026-08-07T00:55:17.068649Z","title":"Perrett, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12312","last_updated":"2025-06-14T02:22:28Z","snapshot_observed_at":"2026-08-13T14:33:19.317608Z","submitted_at":"2025-06-14T02:22:28Z","title":"Perspective on Utilizing Foundation Models for Laboratory Automation in Materials Research","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T00:55:17.068649Z"},"links":{"cited_paper":"/paper/2502.04144","citing_paper":"/paper/2506.12312"},"observation_digest":"sha256:9859d896e60faa14a991bfd94746d45dd9b8f987aaf6dfa1285272d29dc8dbaf","observation_id":"f7ad62cc-2cef-4822-81b9-d232a190337d","resolution":{"observed_at":"2026-08-07T00:55:17.068649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04144","snapshot_observed_at":"2026-08-07T00:34:33.661243Z","title":"Hd-epic: A highly-detailed egocentric video dataset.arXiv preprint arXiv:2502.04144, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-15T03:29:11.892997Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:33.661243Z"},"links":{"cited_paper":"/paper/2502.04144","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:6268d385004a07c723d5b645f096d119e8632076822c9f22db5210d9118232c3","observation_id":"7c640ee3-a711-4b62-a391-8a8c515ba6f7","resolution":{"observed_at":"2026-08-07T00:34:33.661243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"cited_work":{"arxiv_id":"2502.04144","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04144","snapshot_observed_at":"2026-07-04T04:09:35.177453Z","title":"Hd-epic: A highly-detailed egocentric video dataset","venue":null,"work_id":"6d0fa995-1a4d-4511-8d64-a4b4fcf93109","year":2025},"citing_paper":{"arxiv_id":"2604.08342","last_updated":"2026-07-30T19:40:22Z","snapshot_observed_at":"2026-08-16T05:02:32.393959Z","submitted_at":"2026-04-09T15:13:36Z","title":"EgoEverything: A Benchmark for Human Behavior Inspired Long Context Egocentric Video Understanding in AR Environment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T17:35:34.760659Z"},"links":{"cited_paper":"/paper/2502.04144","citing_paper":"/paper/2604.08342"},"observation_digest":"sha256:d0dbb3163f3af3a56e3276f0606151339c9b98487050979618929510d2c6ecce","observation_id":"3819323b-47f2-4425-a1cd-214106eeb319","resolution":{"observed_at":"2026-05-11T06:36:00.368395Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04144","snapshot_observed_at":"2026-08-03T00:18:16.956499Z","title":"Preprint, arXiv:2502.04144","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2604.08342","last_updated":"2026-07-30T19:40:22Z","snapshot_observed_at":"2026-08-16T05:02:32.393959Z","submitted_at":"2026-04-09T15:13:36Z","title":"EgoEverything: A Benchmark for Human Behavior Inspired Long Context Egocentric Video Understanding in AR Environment","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T00:18:16.956499Z"},"links":{"cited_paper":"/paper/2502.04144","citing_paper":"/paper/2604.08342"},"observation_digest":"sha256:4fa3adb3a12ff179a9188cb35c0ba1a14767607bd079173d9daefa62819695c4","observation_id":"ff3e135d-9424-4c5b-8825-90d4de8cae97","resolution":{"observed_at":"2026-08-03T00:18:16.956499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"cited_work":{"arxiv_id":"2502.04144","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04144","snapshot_observed_at":"2026-07-04T04:09:35.177453Z","title":"Hd-epic: A highly-detailed egocentric video dataset","venue":null,"work_id":"6d0fa995-1a4d-4511-8d64-a4b4fcf93109","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":202,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2502.04144","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:d5f0d379d0de434a42b03e2e9cd4e8e104183c6273bf407a3013050323bc9686","observation_id":"cba8f6aa-fe85-419c-8228-9993ffeb94a7","resolution":{"observed_at":"2026-05-13T05:07:17.880503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"cited_work":{"arxiv_id":"2502.04144","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04144","snapshot_observed_at":"2026-07-04T04:09:35.177453Z","title":"Hd-epic: A highly-detailed egocentric video dataset","venue":null,"work_id":"6d0fa995-1a4d-4511-8d64-a4b4fcf93109","year":2025},"citing_paper":{"arxiv_id":"2605.31557","last_updated":"2026-06-01T11:50:06Z","snapshot_observed_at":"2026-08-15T11:32:36.001343Z","submitted_at":"2026-05-29T17:20:10Z","title":"EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T22:40:13.720341Z"},"links":{"cited_paper":"/paper/2502.04144","citing_paper":"/paper/2605.31557"},"observation_digest":"sha256:e4960764d7f1bd71cbb5fa47e428d3344c61fbca6fc3dd8a84d0e63955b7f080","observation_id":"36eee56d-e77c-4465-acc7-50a10a415e1a","resolution":{"observed_at":"2026-06-28T22:42:46.381178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"cited_work":{"arxiv_id":"2502.04144","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04144","snapshot_observed_at":"2026-07-04T04:09:35.177453Z","title":"Hd-epic: A highly-detailed egocentric video dataset","venue":null,"work_id":"6d0fa995-1a4d-4511-8d64-a4b4fcf93109","year":2025},"citing_paper":{"arxiv_id":"2606.20781","last_updated":"2026-06-18T17:05:19Z","snapshot_observed_at":"2026-08-13T05:52:18.238364Z","submitted_at":"2026-06-18T17:05:19Z","title":"World Action Models: A Survey","version":1},"reference_index":134,"source":"pdf_text","source_observed_at":"2026-06-26T17:11:12.686936Z"},"links":{"cited_paper":"/paper/2502.04144","citing_paper":"/paper/2606.20781"},"observation_digest":"sha256:eabe20c018623f5ac968dc737f7dc9c55dab59e0d63b5811b91ee4791a6cbafd","observation_id":"0142080b-618f-4726-8890-db94be87cfd5","resolution":{"observed_at":"2026-07-04T04:09:35.179773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04144","snapshot_observed_at":"2026-07-31T06:18:55.963116Z","title":"HD-EPIC: A highly-detailed egocentric video dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24744","last_updated":"2026-08-08T15:15:40Z","snapshot_observed_at":"2026-08-16T11:31:42.282108Z","submitted_at":"2026-07-27T17:59:58Z","title":"Data Pyramid for Embodied Manipulation: A Survey","version":1},"reference_index":299,"source":"pdf_text","source_observed_at":"2026-07-31T06:18:55.963116Z"},"links":{"cited_paper":"/paper/2502.04144","citing_paper":"/paper/2607.24744"},"observation_digest":"sha256:e02fd96378e512597c4a39ae3cc83928961dbae9c749b60cd38967f67d25f101","observation_id":"6b8a99be-e822-4964-b95d-2d868d4a68a8","resolution":{"observed_at":"2026-07-31T06:18:55.963116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04144","snapshot_observed_at":"2026-08-08T18:01:16.563055Z","title":"Hd-epic: A highly-detailed egocentric video dataset,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-14T15:53:24.800516Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.563055Z"},"links":{"cited_paper":"/paper/2502.04144","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:dea71ffa69ecb8e304f44025dbc8be225bcfe66f193fa11e4ecd5d92746fc526","observation_id":"25a8e8db-9fa3-4db0-8dc0-8cc1165cfd06","resolution":{"observed_at":"2026-08-08T18:01:16.563055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04144/citation-record","integrity":"/paper/2502.04144/integrity","json":"/paper/2502.04144/citation-record.json","paper":"/paper/2502.04144"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.239278Z","title":"https : / / facebookresearch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.239278Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:5f1314e5c227e506ee2c1c8b9c0acb8ab39929264007738c45fc48d348a27c0e","observation_id":"6b58ec32-1724-4f13-99ad-d20874ee7307","resolution":{"observed_at":"2026-08-08T23:26:20.239278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.244077Z","title":"https://www.blender.org/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.244077Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:4b3732c65e6d6bd43943ff50532d731d55c943b7bdd1cb8f7b6726877ffb4d26","observation_id":"34cd0556-806f-4396-b060-ca5ea742b32b","resolution":{"observed_at":"2026-08-08T23:26:20.244077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.248459Z","title":"https://www.myfitnesspal.com/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.248459Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:7d9e5e26e9e0955f016c236ac45ae67a4a0125a8a1c16d21151cc080243978d8","observation_id":"57796c86-1df2-4df5-a202-2a511bb1b722","resolution":{"observed_at":"2026-08-08T23:26:20.248459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.252480Z","title":"https://www.robots.ox.ac.uk/ vgg/software/lisa/","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.252480Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:60f15d3fa2811587e20587dad5ca346b9080aa213a0aa50ff65bcfe2009f76e2","observation_id":"df99a31b-f832-4eb0-bd61-ab2e7ca88419","resolution":{"observed_at":"2026-08-08T23:26:20.252480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T23:26:20.256546Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.256546Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:42d263b2654f6bdb4c4cd92e31f93afcaa8c05324ddb0cce4c42eb10eb0c06dd","observation_id":"6238a78c-d7f6-4b6c-86ea-cd09023de69c","resolution":{"observed_at":"2026-08-08T23:26:20.256546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.260880Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.260880Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:c72c7a5af047837691e4f730e68974d2c1a77d789b7cc54faea6db5cadac7be0","observation_id":"4cbe487a-721f-4381-91cc-e06db3e56a54","resolution":{"observed_at":"2026-08-08T23:26:20.260880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.265031Z","title":"HOT3D: Hand and Object Tracking in 3D from Egocentric Multi-View Videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.265031Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:b95c247d719931284802191f85cca616eb9a481b1b4f3e101e63e40c0b968bb4","observation_id":"ddbffbbd-65e7-4f55-b0d1-e29cb100901b","resolution":{"observed_at":"2026-08-08T23:26:20.265031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-16T13:09:28.872428Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-08T23:26:20.268946Z","title":"TemporalBench: Towards fine-grained temporal understanding for multimodal video models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.268946Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:ef8527bef0ee32598332fe26e16003a2b26192b684e4fa93f2035a9dd2b44a21","observation_id":"333f9254-8eb1-45d4-bb86-ce42e95dab06","resolution":{"observed_at":"2026-08-08T23:26:20.268946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.273390Z","title":"TIM: A Time Interval Machine for Audio-Visual Action Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.273390Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:300c84fc959db49a73224b2f3346f418189eba0169780925a9574d6185763150","observation_id":"c9f5b9f2-f33c-4e88-9ca1-14b85fce6a1a","resolution":{"observed_at":"2026-08-08T23:26:20.273390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.277499Z","title":"ReXTime: A benchmark suite for reasoning-across-time in videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.277499Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:7f7daa91d4afe38f4701abbe2d6e4364706f8e8c061541d9fca944368e627eff","observation_id":"f11e106c-57d2-465a-9689-6925ee6f98e8","resolution":{"observed_at":"2026-08-08T23:26:20.277499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.282222Z","title":"InternVL: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.282222Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:a23b01311f3826cd7c3b881881f301842405e42fcd5499a4b92e7e8b36950238","observation_id":"0cc1d324-9173-4046-8261-41d82ece59e5","resolution":{"observed_at":"2026-08-08T23:26:20.282222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.286474Z","title":"Putting the object back into video object segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.286474Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:debcaf8d08f1d972ac0fe8b9b44ff5739666ba98d5132111453ed090c9aa20a4","observation_id":"2a512596-75ad-446e-91bf-d19821db8439","resolution":{"observed_at":"2026-08-08T23:26:20.286474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-08T23:26:20.290885Z","title":"VideoLLaMA 2: Advancing Spatial- Temporal Modeling and Audio Understanding in Video- LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.290885Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:c2d49a31052b89a5981b2effccb09704af4cdb9a551bf75152f0727d21894b6a","observation_id":"bd9511dc-7227-4a82-a2e0-f230d44ea23a","resolution":{"observed_at":"2026-08-08T23:26:20.290885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-08T23:26:20.295053Z","title":"Qwen-Audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.295053Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:3a4bfb1095c2f92d1514be78be9cec05c80d91b3525bdf4430d48e126628a9a1","observation_id":"2810f8ec-750d-4ed8-aac0-05e31cc64c54","resolution":{"observed_at":"2026-08-08T23:26:20.295053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07752","last_updated":"2025-03-25T09:46:02Z","snapshot_observed_at":"2026-08-16T13:10:47.063439Z","submitted_at":"2024-10-10T09:28:36Z","title":"Lost in Time: A New Temporal Benchmark for VideoLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07752","snapshot_observed_at":"2026-08-08T23:26:20.299457Z","title":"TVBench: Re- designing video-language evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.299457Z"},"links":{"cited_paper":"/paper/2410.07752","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:651f623833c9671eba03dc4b67c2077961b9d5205508132879c2392dbdacc01d","observation_id":"0f9ee443-d1d2-492a-bd74-25d790104880","resolution":{"observed_at":"2026-08-08T23:26:20.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.303496Z","title":"ScanNet: Richly-annotated 3D reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.303496Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:c844f6937b474782bf6c3a22db1a0d5e1174b61ef307b8b05f0141ba5a84ace0","observation_id":"13ac7e72-21c4-4e7d-a965-4249943469d7","resolution":{"observed_at":"2026-08-08T23:26:20.303496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.307508Z","title":"Scaling egocentric vision: The EPIC-KITCHENS dataset","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.307508Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:41b487350e64e876bb894aa39ebf5e6f977b7f891a3be6469523481739a2fb9b","observation_id":"aad9994e-4714-41cc-916a-b0a9b606482e","resolution":{"observed_at":"2026-08-08T23:26:20.307508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.311313Z","title":"Rescaling egocentric vision: Collection, pipeline and challenges for EPIC-KITCHENS-100","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.311313Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:a823a72462762e74f6c2f7184e963093f89e1364eaf62fd9cdb7ea20d6ffb4d5","observation_id":"2389f14f-caad-4b4d-aff3-9a65debf586e","resolution":{"observed_at":"2026-08-08T23:26:20.311313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.668667Z","title":"EPIC-KITCHENS VISOR benchmark: Video segmentations and object relations","venue":null,"work_id":"ae7a433a-924a-400d-94e8-29e475985c82","year":2022},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.315566Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:40d85a3179cb1aee0c3472e36109e32b988fad45f3552f990c0e0709c0b0647b","observation_id":"2b91fb94-d96b-405b-a329-4c03ecbfdfd6","resolution":{"observed_at":"2026-08-08T23:26:21.672898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.655815Z","title":"Guide to the Carnegie Mellon University Multimodal activity (CMU-MMAC) database","venue":null,"work_id":"0b1521ba-3f12-48cc-b172-0192f8f709d9","year":2009},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.319438Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:4593342cdab2fb1fdeaaaef716a38a7b040a567db0a5f4691e2a8b2d4d6cd6c6","observation_id":"205dbc3e-002d-4a48-b7d8-6182f11aae92","resolution":{"observed_at":"2026-08-08T23:26:21.660287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T23:26:20.323259Z","title":"The Llama 3 Herd of Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.323259Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:81bb359fdab4fec3740b2b0d1ef2e22bf75ae5ddba325cb53cba64c058dfc7c0","observation_id":"ba11a6a8-a321-48de-b162-74c112609490","resolution":{"observed_at":"2026-08-08T23:26:20.323259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.642764Z","title":"The VIA annota- tion software for images, audio and video","venue":null,"work_id":"bf2448af-ba91-4736-a647-63f927d5e489","year":2019},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.327545Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:1ed6628daf762c97ba3fdae7956ca39c37ac20b02ec4f2ac40a21a85b5a02d1e","observation_id":"52d8b4e9-9d95-496e-a70c-bc03e7e805e0","resolution":{"observed_at":"2026-08-08T23:26:21.647028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.630221Z","title":"MMBench-Video: A long-form multi-shot benchmark for holistic video under- standing","venue":null,"work_id":"7ff1ed35-7912-4b0c-abfe-6c8d625a0630","year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.331473Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:b980e9ba0378425ccf904ab65c0e6905cf78e2c0acae035901af83a354a66075","observation_id":"76dd251e-3578-4521-aaaf-e683b2ed0c55","resolution":{"observed_at":"2026-08-08T23:26:21.634308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.616883Z","title":"SlowFast networks for video recognition","venue":null,"work_id":"246c6c61-f7ec-46b4-a584-2e2a0d50d276","year":2019},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.335460Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:da812f4e0b61301d517810d5d26ce325a167d87e291fcadf6e3a680617bab7cc","observation_id":"5a9a2edb-a8c6-4af6-b604-b11ededa64d4","resolution":{"observed_at":"2026-08-08T23:26:21.621676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.603102Z","title":"Video-MME: The First-Ever Com- prehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":null,"work_id":"8544196e-9852-4d2c-ae2d-794235e4d0f7","year":null},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.339415Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:a50ed080dc8c2c1232978873e7422163ae999aa6fb7c2988f3a8125539098606","observation_id":"a1c31c70-ffb3-484e-8083-1754ae5d28b7","resolution":{"observed_at":"2026-08-08T23:26:21.607864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.590006Z","title":"Omnivore: A Sin- gle Model for Many Visual Modalities","venue":null,"work_id":"58c05b1c-3465-45f2-b7a7-4c6e614d7826","year":2022},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.343144Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:9386b350441068e39c3b85f08256fdcf288c37cc13155a5dea45d0e45e7332d4","observation_id":"18df731d-b49a-4c57-b595-ea04dd69bdba","resolution":{"observed_at":"2026-08-08T23:26:21.594218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.576703Z","title":"SSAST: Self-Supervised Audio Spectrogram Transformer","venue":null,"work_id":"e47507ea-398f-4419-9f95-ae86f00e650f","year":2022},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.347316Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:c52f3ffadd071e9436c9011ba0cc6fa183d7d8968fcd9a2f3359e5dfa168be8d","observation_id":"dfce173c-7e13-4c23-8c55-b34750501abb","resolution":{"observed_at":"2026-08-08T23:26:21.581052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.563991Z","title":null,"venue":null,"work_id":"228b8900-76ad-48d5-83d2-6bb0be73c9ef","year":2022},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.351271Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:35b585255a05d0704cedc30244def79a6f69775303acf28f58e51dfbcdfc261f","observation_id":"b5cf30ab-846b-4562-a27b-1c1aea935df1","resolution":{"observed_at":"2026-08-08T23:26:21.568176Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.551247Z","title":"Jawahar, Richard Newcombe, Hyun Soo Park, James M","venue":null,"work_id":"1a4ac69b-7914-4bde-bbba-6eac84781582","year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.355218Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:323c8f639dac27c2c9b74f046a6a6d02d4d07048611116c4b241fa928af6069c","observation_id":"f5a3544a-2fc0-44cc-90d4-81804ef31848","resolution":{"observed_at":"2026-08-08T23:26:21.555543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.537810Z","title":"spaCy 2: Natural lan- guage understanding with Bloom embeddings, convolutional neural networks and incremental parsing","venue":null,"work_id":"c2ae25d6-8111-4142-8569-119d1a46cc5a","year":2020},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.359295Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:eb348ad837fd9c6713a64594133f882a00d55a206daddc86337c11fb345637c3","observation_id":"e76151dc-8020-40e1-bab8-f986b2b31117","resolution":{"observed_at":"2026-08-08T23:26:21.542221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.524924Z","title":"EPIC-SOUNDS: A Large- Scale Dataset of Actions that Sound","venue":null,"work_id":"bfb40897-6a5e-45d6-90ca-5a13fda96f1c","year":2023},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.363105Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:dde932742e30a604e019011c376eccb0b3e49cfb48df55fa62f3c096e54918fe","observation_id":"72dd8f29-c4e9-43cf-bed9-d36f2d7650f7","resolution":{"observed_at":"2026-08-08T23:26:21.529201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.511355Z","title":"Eye–Hand Coordination in Object Manipu- lation","venue":null,"work_id":"ed73feec-3238-45f5-8554-c3e848fba6a1","year":2001},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.366890Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:051c77156b65f7b39af34ea223ede8ad52eb0f64bf280ab7a72dfcd6db3c86cf","observation_id":"145e6045-089a-4942-b155-55c22f602b7c","resolution":{"observed_at":"2026-08-08T23:26:21.516007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.498425Z","title":"Toronto annotation suite","venue":null,"work_id":"477ef9c3-dbe7-4ad2-bd63-59321f4f172d","year":2021},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.370783Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:2bcdeeb6e5816fb16af78ab70005c6e079e0f0205af5a78fa1ae57be9a60679e","observation_id":"049a51ed-9c8d-45fc-950f-def6c197d0fc","resolution":{"observed_at":"2026-08-08T23:26:21.502573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.485200Z","title":"Slow-Fast Auditory Streams For Audio Recognition","venue":null,"work_id":"452731be-6047-4384-a92e-ff5ad7d89e2f","year":2021},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.374680Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:829271806caaf6d9b9032b9b0a8c6842bbb76cd2a68cde0472153eb1d620bd99","observation_id":"cdbf5bfb-6534-49ba-a1f7-2894ac0501cf","resolution":{"observed_at":"2026-08-08T23:26:21.489710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.472243Z","title":"ViLMA: A Zero-Shot Benchmark for Linguistic and Temporal Grounding in Video-Language Models","venue":null,"work_id":"73628a1a-9ee5-4be2-a2ab-3d3f4f48c17b","year":null},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.378784Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:b4ed177b650317442a5390fabd62bc9c6b12ba7514dd35362363bbf21054c485","observation_id":"bcc59d2c-02dc-4ca1-a19c-65aa0bfda331","resolution":{"observed_at":"2026-08-08T23:26:21.476503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.459841Z","title":"Segment any- thing","venue":null,"work_id":"164da79f-b211-4de7-acdd-63fe8eb90da1","year":2023},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.382620Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:f4b7e6711f5a0747ba7eb4f1deef29eb81f16f03d0da5999ddad7958f0778888","observation_id":"85777be6-3171-4d3a-8ce1-0bc36016e622","resolution":{"observed_at":"2026-08-08T23:26:21.463809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.447369Z","title":"Constituency parsing with a self-attentive encoder","venue":null,"work_id":"f43784bc-5a77-4e11-bc7e-6383ace46504","year":null},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.386562Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:42fecf2b238c93209ae74a05096565a661595545a7a4dd8bb80d9cd49c98a66c","observation_id":"2e564b7a-bbc7-4c5c-995d-a6c067331498","resolution":{"observed_at":"2026-08-08T23:26:21.451571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.09577","last_updated":"2019-09-14T03:51:46Z","snapshot_observed_at":"2026-08-16T06:50:16.511240Z","submitted_at":"2019-09-14T03:51:46Z","title":"NeMo: a toolkit for building AI applications using Neural Modules","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.09577","snapshot_observed_at":"2026-08-08T23:26:20.390501Z","title":null,"venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.390501Z"},"links":{"cited_paper":"/paper/1909.09577","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:c54de03ee1db6beb59679bc4679b280b7b61c0df429ba0c97521d1b245cb36de","observation_id":"333b30a2-7b90-4e7b-9573-a8399ba61496","resolution":{"observed_at":"2026-08-08T23:26:20.390501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.434418Z","title":"LEGO: Learning EGOcen- tric Action Frame Generation via Visual Instruction Tuning","venue":null,"work_id":"3ceaa648-b5c2-40d5-95de-b0f67aff250c","year":2023},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.394646Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:80ad3b1088ccd32c09a95483639997d247673c0afe8a37085472e39bd1b26609","observation_id":"de13f26c-8fc1-47e8-baea-d8b8b9992ee6","resolution":{"observed_at":"2026-08-08T23:26:21.438690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.421779Z","title":"The roles of vision and eye movements in the control of activities of daily living","venue":null,"work_id":"684b6c87-0535-4577-9a80-f467915deeb9","year":1999},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.398469Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:e500ba9c2ae22c1839674df769476644101f4cf680c81741159487ee99035231","observation_id":"8bb387df-992d-4c19-b3b7-c66f69ff069a","resolution":{"observed_at":"2026-08-08T23:26:21.425949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.408912Z","title":"Dis- covering important people and objects for egocentric video summarization","venue":null,"work_id":"f2188b6b-2818-4999-b0ea-6a3c1adbd6d3","year":null},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.402362Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:a79079fe4be94d41742abd781470af0ed36488049632b7f3350a9bbb9eb5ed18","observation_id":"81312a54-6a25-4447-9d27-9d19e483d7de","resolution":{"observed_at":"2026-08-08T23:26:21.413364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.396494Z","title":"SEED-Bench: Benchmarking Multimodal Large Language Models","venue":null,"work_id":"55f76093-4083-451f-bb0a-9c5bb5f4b315","year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.406340Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:86a0d38b6f564461d7bfce5aa16841ddfa6f5e4f71172e082b6872fc7ffba93d","observation_id":"033716c5-5ed8-4f86-b20e-1fec38415dd8","resolution":{"observed_at":"2026-08-08T23:26:21.400554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.384247Z","title":"MVBench: A Comprehensive Multi-modal Video Under- standing Benchmark","venue":null,"work_id":"7f572446-87d5-4a4a-9a9f-a59b5737a841","year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.410461Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:6984793f1544155d8079e3477d1f9cb4908b66fedfbe4a55e30977fd6875eb70","observation_id":"17dbfa49-15c2-49f9-ac50-50eaedab664c","resolution":{"observed_at":"2026-08-08T23:26:21.388272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.371641Z","title":"VITATECS: A Diagnos- tic Dataset for Temporal Concept Understanding of Video- Language Models","venue":null,"work_id":"46dc9850-9364-4714-94ff-ce63a7454bf6","year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.414382Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:f8f5ce4225e29e73b5ddd3d4b7bded9e19092085ebc7298f791c054bc80be2c2","observation_id":"85926b9f-a766-443f-a9fd-4f0cf4fa0d99","resolution":{"observed_at":"2026-08-08T23:26:21.375749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.359333Z","title":"In the eye of the beholder: Gaze and actions in first person video","venue":null,"work_id":"dfdd47bd-7a7f-4e9b-aef3-528141c841ff","year":2021},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.418264Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:714ec7b71e7e7c44902e10b4d88c0d632b95c246ef460476c09f34cf859e0839","observation_id":"c3731357-6ad9-45c0-b5af-5e804a335f21","resolution":{"observed_at":"2026-08-08T23:26:21.363381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.346802Z","title":"HOI4D: A 4D Egocentric Dataset for Category-Level Human-Object Interaction","venue":null,"work_id":"7068ede6-4a53-47f8-9633-8c382a410414","year":2022},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.422081Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:3541b6c7301b40ed84450e5ef241ad250da62911669abf86a16fabc51d4e6479","observation_id":"abffdc8d-9218-4c67-b187-fde7bb69b7d9","resolution":{"observed_at":"2026-08-08T23:26:21.350918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13349","last_updated":"2024-02-22T03:37:36Z","snapshot_observed_at":"2026-08-16T14:16:49.875435Z","submitted_at":"2024-02-20T19:53:15Z","title":"Aria Everyday Activities Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13349","snapshot_observed_at":"2026-08-08T23:26:20.426007Z","title":"Aria Everyday Activities Dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.426007Z"},"links":{"cited_paper":"/paper/2402.13349","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:c0312e957ad5826d939e3d496f20563ae71bfa075d0b3e154e85964dc1ad16f3","observation_id":"ead22a22-2625-4139-9514-dd4a39c11f9a","resolution":{"observed_at":"2026-08-08T23:26:20.426007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.334008Z","title":"OpenEQA: Embodied Question Answering in the Era of Foundation Models","venue":null,"work_id":"b47db42a-3271-4377-b349-34d89b7a4ed7","year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.430193Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:34ce3a8089b9e73cad46dfb0a0ebcf13370c62d5c61ae24f4550609df5777c90","observation_id":"8c4b3308-b6c0-4ec1-8614-6d6355827408","resolution":{"observed_at":"2026-08-08T23:26:21.338306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.321315Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","venue":null,"work_id":"027c6fdd-8bc0-47e0-bc85-f6c5cfef4136","year":2023},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.434028Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:10bb61839f5108eacfc6de8cca5937c445103b830763186dc8c557ed83c14b80","observation_id":"dd774e1d-80e4-4e2b-b727-197ec28b106b","resolution":{"observed_at":"2026-08-08T23:26:21.325615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.308515Z","title":"Aria Digital Twin: A New Benchmark Dataset for Egocentric 3D Machine Percep- tion","venue":null,"work_id":"3f635e86-556b-41ab-acdc-c360544bfd51","year":2023},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.437893Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:137167c34c2baa068c4cbdec8b2e5505a5722ccd3917f80ec17d0d5f5b874315","observation_id":"e79da7db-95b1-4d17-ac69-bc589f59ef78","resolution":{"observed_at":"2026-08-08T23:26:21.312899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.296005Z","title":"Asano, Is- han Misra Florian Metze, Christoph Feichtenhofer, Andrea Vedaldi, and Jo ˜ao F","venue":null,"work_id":"ca6bb35b-c734-42cb-b23c-48091a53d109","year":2021},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.442291Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:a9e303cf4d58974648756cf8730fe5ce7ed4dbea051a1684a12db0e7a4dbfe6d","observation_id":"48ba698e-331f-42b1-8f93-80119f4d62e2","resolution":{"observed_at":"2026-08-08T23:26:21.300066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.283432Z","title":"CaptainCook4D: A Dataset for Understanding Errors in Procedural Activities","venue":null,"work_id":"185372c1-a08c-4a32-9cc4-07348f1c90d9","year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.446125Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:318eb60434f344b7c050c4f2e5f1aa0f1c204cef84ae0342f01bcce4e5a07e6d","observation_id":"416c5761-2227-4a3b-b4c8-3c1a91fdb09f","resolution":{"observed_at":"2026-08-08T23:26:21.287627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.270852Z","title":"A benchmark dataset and evaluation methodology for video object segmentation","venue":null,"work_id":"f016f54e-a515-4d04-a065-800b405efc70","year":2016},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.450082Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:976844ee49451d0d49cad9455eb32d2c4056c802cd4c535e626a898adc3e3dad","observation_id":"370ea446-5072-40df-8eeb-be6464d288eb","resolution":{"observed_at":"2026-08-08T23:26:21.274927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.258133Z","title":"It’s just another day: Unique video captioning by discriminitave prompting","venue":null,"work_id":"61627444-ae9b-4b63-b165-208be0c70394","year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.453818Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:80acb273e4c697c5c19be48e8370bdbf7dfcd90a5474db4a83ef47cee1081349","observation_id":"f1537935-ec6e-428c-9ef2-311aede18cb3","resolution":{"observed_at":"2026-08-08T23:26:21.262237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.245459Z","title":"Detecting activities of daily living in first-person camera views","venue":null,"work_id":"65904334-6e8d-4fe7-8956-1437ffb33f3b","year":2012},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.457761Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:06bf3574f879cd9e050b6f7ce2c630a02617cadad2eec5aab9755e5971e41f2d","observation_id":"d04eaa30-cc79-477a-b00c-bdeff0a72a30","resolution":{"observed_at":"2026-08-08T23:26:21.249602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.232785Z","title":"Spatial Cognition from Egocentric Video: Out of Sight, Not Out of Mind","venue":null,"work_id":"ab8a415f-9d5f-40fd-b625-386bd15e1c79","year":2025},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.461562Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:f01ee66ba38294e60560cc9ab7d905d68c2e4662149bf6cf254c4689c6f88182","observation_id":"0b1aa5b7-6336-4d2b-a86c-d72ea5a3cb4b","resolution":{"observed_at":"2026-08-08T23:26:21.236851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-08T23:26:20.465518Z","title":"The 2017 davis challenge on video object segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.465518Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:0a4f893729822f0823855de3a1908e9affc9f32b3a6f13fd5150f55561d89c28","observation_id":"00134e01-a07e-4b6c-b28e-6ce0c39b278c","resolution":{"observed_at":"2026-08-08T23:26:20.465518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.220088Z","title":"Perception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":"7e6e2913-2efb-44d2-b756-d6f141f83b3d","year":2023},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.469568Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:cac591483b78845f7bc5d03b99cdda250228a2df39aed6bfa71ff0c042054c5a","observation_id":"830b92e6-9c90-4cfb-bc4c-96879489c5bd","resolution":{"observed_at":"2026-08-08T23:26:21.224189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.207260Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"d99a627c-ae97-4573-b3e3-8acf69dd7101","year":2021},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.473579Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:535aa3266fa3f1349fad233262e6dc2b654742e6da7fdfee599f03ed6ae0e1a5","observation_id":"fad31074-04f5-4dd0-ae3e-8fef698aa4a4","resolution":{"observed_at":"2026-08-08T23:26:21.211916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.194779Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"2589beb2-5e07-4103-a227-c6027acd6194","year":2023},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.477248Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:8924158a30d60e9cdf990704e53aded20b958af7316c659eed340e7229ca1745","observation_id":"710fb2ad-1545-469b-8e77-6a375545d6e5","resolution":{"observed_at":"2026-08-08T23:26:21.198914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.182419Z","title":"EGO- CH: Dataset and fundamental tasks for visitors behavioral understanding using egocentric vision","venue":null,"work_id":"655911fb-0915-4801-98a3-a3d36ff84cfa","year":2020},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.481007Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:cefc88192085d4795496d93e5a5544cee66686a9288e98f3a1432cf03bb7fd27","observation_id":"dc96536d-a0dc-4372-8412-b3380527fb0a","resolution":{"observed_at":"2026-08-08T23:26:21.186512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.169537Z","title":"The MECCANO Dataset: Understanding Human-Object Interactions from Egocentric Videos in an Industrial-like Domain","venue":null,"work_id":"12cb9579-51d6-4865-bd78-164f2931819d","year":2021},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.484796Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:5b12646b5b1236728dda63391790ff31c4ccd09d48e1a4b22e9653be521d398e","observation_id":"bce228f4-3fdf-47ff-a7e2-81cc3fe51f4a","resolution":{"observed_at":"2026-08-08T23:26:21.173854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.156839Z","title":"Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI","venue":null,"work_id":"bd33771a-b925-4b33-ae33-a992501bb24c","year":2021},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.488457Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:912ebf347b6ec2e69088032730b89d56d68058396f905cbcdab3aa9126b8d6bc","observation_id":"feaa7ba2-28a7-4a28-bd82-b01be462a69c","resolution":{"observed_at":"2026-08-08T23:26:21.161040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-08T23:26:20.492266Z","title":"SAM 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.492266Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:f370766a7968233d27e9c6b700c1135688213c18c8ca31ea083ce1a902103c82","observation_id":"52e5403b-a297-471b-a5e0-f8ad87b8f468","resolution":{"observed_at":"2026-08-08T23:26:20.492266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.144652Z","title":"Structure-from-motion revisited","venue":null,"work_id":"06bfdf7d-e791-4229-8262-2a08f7155a2e","year":2016},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.496441Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:809f317207247c16c14a8de091d74934b818fac39dff584b2626383bab6abb9b","observation_id":"ff09b05f-5e05-4cf5-9ed2-def48e39d4f1","resolution":{"observed_at":"2026-08-08T23:26:21.148656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.131912Z","title":"Pixelwise view selection for un- structured multi-view stereo","venue":null,"work_id":"7d579407-7b2d-4835-b5d4-acdc20a9739b","year":2016},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.500127Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:466cbd45a2e705efbcf27f43c0cd8b7f42f4c8337f49a14dfdf760cab148a878","observation_id":"40805fc2-12fa-422a-99a9-1c6828160e3f","resolution":{"observed_at":"2026-08-08T23:26:21.136075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.119474Z","title":"IndustReal: A Dataset for Procedure Step Recognition Handling Execution Errors in Egocentric Videos in an Industrial-Like Setting","venue":null,"work_id":"77499910-56f3-4f32-bd75-326a5a874605","year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.504236Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:b400d76dba64ed08751671a59535cce658bbddaf17f7764af611c29a1e1f38b8","observation_id":"94765ffb-a2d3-4da9-8485-488a73620f16","resolution":{"observed_at":"2026-08-08T23:26:21.123631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.106979Z","title":"As- sembly101: A large-scale multi-view video dataset for un- derstanding procedural activities","venue":null,"work_id":"d63520e0-4837-4f87-a140-5c3167afa242","year":2022},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.508124Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:37524cf1f9953c67dadf6d85665831a3dd8ea727383d26b2604a8d4e059285df","observation_id":"e43c87e6-4d50-4c04-afec-ca70c3a2cfe6","resolution":{"observed_at":"2026-08-08T23:26:21.111199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.094373Z","title":"Actor and observer: Joint modeling of first and third-person videos","venue":null,"work_id":"9206f952-7466-4165-a009-69fa50ad0621","year":2018},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.512149Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:cca65b2d9c39ca468409fb2760566b0a1efe9eff5abbcc03db96f0e9c37a14ae","observation_id":"40fc5ee3-465a-4ce8-8295-8c27688d35d3","resolution":{"observed_at":"2026-08-08T23:26:21.098608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.081761Z","title":"FLA V A: A foundational language and vision alignment model","venue":null,"work_id":"465b20e0-ad48-4d43-ad22-38822ffd0592","year":null},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.516045Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:ccd49f871ebc47ad175872ebe2933bbe0fe1a64f3a96ede57486ae5a93076e3b","observation_id":"1c381484-77f0-4ab7-8902-121427587990","resolution":{"observed_at":"2026-08-08T23:26:21.086030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.069006Z","title":"Krishnacam: Using a longitudinal, single-person, egocentric dataset for scene understanding tasks","venue":null,"work_id":"113ecefa-d8c6-4ead-b1fa-d92534805d43","year":2016},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.520024Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:f26cc436e2df8cb7ee647feebc11f7b76609a5979d6048c992616e126d128d40","observation_id":"f761f84d-13c9-4478-b742-9a6525e80604","resolution":{"observed_at":"2026-08-08T23:26:21.073225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13561","last_updated":"2023-10-01T20:16:22Z","snapshot_observed_at":"2026-08-13T14:52:21.014234Z","submitted_at":"2023-08-24T20:42:21Z","title":"Project Aria: A New Tool for Egocentric Multi-Modal AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13561","snapshot_observed_at":"2026-08-08T23:26:20.523883Z","title":"Somasundaram, Jing Dong, Huixuan Tang, Ju- lian Straub, Mingfei Yan, Michael Goesele, Jakob J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.523883Z"},"links":{"cited_paper":"/paper/2308.13561","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:fc017cbc42057382f31e53e8e30c2851e8efaad9d31675bd131658d1dc909f7a","observation_id":"05f7b50e-1e30-4414-b6f9-8b06ababf4c7","resolution":{"observed_at":"2026-08-08T23:26:20.523883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.056423Z","title":"Ego4D Goal-Step: Toward Hierarchical Understanding of Procedural Activi- ties","venue":null,"work_id":"e6185848-225e-4b4d-91ee-6c9693a9c515","year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.528109Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:b87a3b175de03090e72d533d320907ac96fb433242a2f27af5c22d0d91aec3ad","observation_id":"c17ed54f-c132-4368-bb14-3a0be5375339","resolution":{"observed_at":"2026-08-08T23:26:21.060615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10224","last_updated":"2024-06-14T17:57:35Z","snapshot_observed_at":"2026-08-16T19:00:18.398698Z","submitted_at":"2024-06-14T17:57:35Z","title":"EFM3D: A Benchmark for Measuring Progress Towards 3D Egocentric Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10224","snapshot_observed_at":"2026-08-08T23:26:20.532170Z","title":"EFM3D: A Bench- mark for Measuring Progress Towards 3D Egocentric Foun- dation Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.532170Z"},"links":{"cited_paper":"/paper/2406.10224","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:f545d3670cc030169406e9644b32b6de488a8088515c759026adb20fefb7bcd1","observation_id":"5def4a60-bc53-4f9e-9c7a-98e50220b20a","resolution":{"observed_at":"2026-08-08T23:26:20.532170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-08T23:26:20.536527Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.536527Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:99060686100fdcb9b1728afb0b9623b19a5f11952a5cd31f69f029420e8de982","observation_id":"4421fd1d-3c99-4217-b79c-3069662c99d1","resolution":{"observed_at":"2026-08-08T23:26:20.536527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.043679Z","title":"VideoMAE: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"ad87a94c-3c57-4433-9613-ef26b919e9dd","year":2022},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.540708Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:a8d14dd222f2237048620788bcc237bee9110f44b132781c1c3640754021bdf7","observation_id":"3f2cc7f4-2be9-49e5-819b-bb30040f9cba","resolution":{"observed_at":"2026-08-08T23:26:21.047878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.030190Z","title":"EPIC Fields: Marrying 3D Geometry and Video Understanding","venue":null,"work_id":"8590f443-425f-4e33-bfa3-e101dd144d00","year":2023},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.544581Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:354d732a8a9b926cea7c48b32122d77217df44120517be7a67c1ec00f957c699","observation_id":"db29982c-51d7-4fa7-a6e6-4dc328e7eb01","resolution":{"observed_at":"2026-08-08T23:26:21.034653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.017454Z","title":"SOK-Bench: A Situated Video Reasoning Benchmark with Aligned Open-World Knowledge","venue":null,"work_id":"592beddd-6f73-48e7-8244-391d2206c6a9","year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.548570Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:c65bae9460b7d99540139981168c01150de2f4b7391fb94badf84839d35ced42","observation_id":"ab3356ad-dc3a-4c49-9097-d9354f031ee4","resolution":{"observed_at":"2026-08-08T23:26:21.021685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:21.003524Z","title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","venue":null,"work_id":"4c133a1e-2b8c-4317-a8a8-6c35b0cb621b","year":2023},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.553079Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:5cc97bac5a0c216461e3cc230cf650c02187b53e951d9a104af920a854088fe8","observation_id":"0d7ecea7-deff-4361-9c4c-ce3df4a2d39f","resolution":{"observed_at":"2026-08-08T23:26:21.008203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.990325Z","title":"HoloAssist: an Egocentric Human Interaction Dataset for Interactive AI Assistants in the Real World","venue":null,"work_id":"284e16a6-527f-4cc1-b5fc-ab3605281ccf","year":2023},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.556982Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:a39b09edc9bdeb29d842895d199f26f385259870edf2ae108578b3261fbbe13a","observation_id":"d2b48275-bd4a-4ee1-9150-2091110cc0ed","resolution":{"observed_at":"2026-08-08T23:26:20.994826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.977313Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks","venue":null,"work_id":"524bc88e-8e19-4e8a-8209-97f388351a11","year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.560882Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:91a6e024f3eefdf270336d7c4ca5bd472d916beb4e804e4265bd75c6c446484e","observation_id":"68de8828-7b2a-44cd-b6e1-a90613c2a053","resolution":{"observed_at":"2026-08-08T23:26:20.981658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.963785Z","title":"Can I trust your answer? Visually grounded video question answering","venue":null,"work_id":"e1a1f7e1-48ed-4c43-8e94-040665088f5b","year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.564671Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:cd41301b028ee50466eb3542dad268b951d686b3ceb7bf6d547d3f3c00d37c12","observation_id":"5012ac33-4628-4840-a9db-940960bb8ee5","resolution":{"observed_at":"2026-08-08T23:26:20.968023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.03327","last_updated":"2018-09-06T04:19:45Z","snapshot_observed_at":"2026-08-14T18:32:23.594089Z","submitted_at":"2018-09-06T04:19:45Z","title":"YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.03327","snapshot_observed_at":"2026-08-08T23:26:20.568915Z","title":"YouTube-VOS: A large-scale video object segmentation benchmark","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.568915Z"},"links":{"cited_paper":"/paper/1809.03327","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:22bbb0ac1a101f1d76fca4d6a9ecf48e3fa48cdb8e9d37a64f9c4bc26ab57ae1","observation_id":"58be70ce-1a26-408b-a7f2-859328d1d6d7","resolution":{"observed_at":"2026-08-08T23:26:20.568915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.951101Z","title":"The 2nd large-scale video object segmentation challenge - video object segmen- tation track, 2019","venue":null,"work_id":"12697667-4510-4ccf-93d6-3c31ecaaf5d4","year":2019},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.572962Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:a622454226ffabf5191ba7c87d35d2fba402d9158fadfe6710921844e2b90cba","observation_id":"447b4751-a4ca-4fa0-b4c9-b0ce0527827e","resolution":{"observed_at":"2026-08-08T23:26:20.955251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.937818Z","title":"Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data","venue":null,"work_id":"40823ef7-fd4a-4ef0-a653-c3ea1f88550a","year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.576842Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:3a83bf51076608d32b606a95fd37526859c38bb57d50b758deacbcd89b82b4f1","observation_id":"4a208cbc-f21d-4d8e-adaf-e50d2be26c13","resolution":{"observed_at":"2026-08-08T23:26:20.942500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.924413Z","title":"MM-Ego: Towards Building Egocentric Multimodal LLMs","venue":null,"work_id":"5f28b3d9-4a30-4804-ae66-0c47acc27ea2","year":2025},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.580615Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:084fe794e506329e3a1f35b58a40b0b12575fd6c3874a32b76e91246908e5f50","observation_id":"36f94223-53f9-4543-a414-c5835cb0ba20","resolution":{"observed_at":"2026-08-08T23:26:20.928595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.910762Z","title":"Es- timating body and hand motion in an ego-sensed world","venue":null,"work_id":"8f91686e-a9e4-4f2d-8b25-58016a25be76","year":2025},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.584386Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:49c1f26318124109d440369ead16d6df857cd6899a7e31fdf17998daf166e4b7","observation_id":"90f44fcc-27db-4ab0-b627-4f056604030f","resolution":{"observed_at":"2026-08-08T23:26:20.914857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.897463Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":null,"work_id":"24686b87-f63c-4c8d-8dbd-21a5254bcfee","year":2023},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.588264Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:f6e0787a1ecf51c3031ced05d5e253181533ce43ce84ba5a0a1a59dfe90e1f87","observation_id":"856ad914-69c9-4f4c-a4a1-b59626b61d92","resolution":{"observed_at":"2026-08-08T23:26:20.901873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-08T23:26:20.592106Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.592106Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:50a2c2cafc194ee3f17649d54a7d418d94207ee96a43e18d113705ade8a66477","observation_id":"e79ee3c6-d068-4c32-9b59-2ac9a81cf4ef","resolution":{"observed_at":"2026-08-08T23:26:20.592106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-08T23:26:20.596294Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.596294Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:4162f7bfe2539128d7a7e2b78d8fa5ac4e8c056d8448dbdccb4839ac559ea651","observation_id":"a1d6fdb8-f008-4e9b-bf41-016f8e7b30e9","resolution":{"observed_at":"2026-08-08T23:26:20.596294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.884641Z","title":"Instance tracking in 3D scenes from egocentric videos","venue":null,"work_id":"9a3859e0-93d3-48a5-8174-d5e51d5c8e93","year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.600705Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:519a7bada054ff85636e90225bee2abe6ebe3a1247c8a2f2e87cfc92312cc35f","observation_id":"b8ad5e72-7c0b-4e97-bfe5-102e4f14ee5b","resolution":{"observed_at":"2026-08-08T23:26:20.888751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.871053Z","title":"Needle In A Video Haystack: A Scalable Synthetic Framework for Benchmarking Video MLLMs","venue":null,"work_id":"88957b83-4ebd-4440-964d-bca9163ac84d","year":null},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.604452Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:ac08fefccc965def780d9545ddd4aaeb5e26090a8e6faf8f82321459da4ae749","observation_id":"bbf72b08-6b42-4df1-b940-7b1bfde916b6","resolution":{"observed_at":"2026-08-08T23:26:20.875976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:26:20.856443Z","title":"use something","venue":null,"work_id":"17cf6d2d-acaa-4b8f-ab1d-a9dd2f65ed9b","year":2018},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.608195Z"},"links":{"citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:b3011fe3979e9032fd5611c7c6429ee3f0ae4e14d1eef742de4f11cb7c5c9441","observation_id":"8e32b923-523c-4190-a07e-316a8b53e8c9","resolution":{"observed_at":"2026-08-08T23:26:20.861665Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T04:44:12.425507Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":62},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 12 inbound Pith citation observations for arXiv:2502.04144."}