{"as_of":"2026-08-15T18:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:96d7c913378e5df393bfd71ed96b413cda5b24932a109fd24a9ddcbb106ee9af","coverage":[{"denominator":138,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:31:42.599141Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.07886/citation-record","integrity":"/paper/2506.07886/integrity","json":"/paper/2506.07886/citation-record.json","paper":"/paper/2506.07886"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.346223Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.346223Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:f1d67262c00eda6c67133ca0df67aa82d51e9b8412af6fcd5d640d2906485d62","observation_id":"15894f6c-633e-4832-806d-3e43a6a26cda","resolution":{"observed_at":"2026-08-07T05:31:42.346223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.349741Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.349741Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:25ecf51362d4e0c48ca54b84df5be2b795c4f57827df4c0573b79645d95678f5","observation_id":"0a8f9399-7488-4ef2-a179-2678ae232f49","resolution":{"observed_at":"2026-08-07T05:31:42.349741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-07T05:31:42.352925Z","title":"Cosmos world foun- dation model platform for physical ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.352925Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:cc4167fd33257dc6427b043f1168f0d4c17f7003d5f3d2d78b3c9d80d1069039","observation_id":"cf5137c5-86e3-4333-9e18-23dcab4e0c56","resolution":{"observed_at":"2026-08-07T05:31:42.352925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.356074Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.356074Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:88c35984380353b86303e303f2e30886bcac7d85732a1d370e68a1f3ad6d1f02","observation_id":"f63069d3-06bb-4d13-8e40-4a4c0cd3b781","resolution":{"observed_at":"2026-08-07T05:31:42.356074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.358916Z","title":"Scenescript: Reconstructing scenes with an autoregressive structured language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.358916Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:c17ed087d7f14cfb863db7eba65c966694be9d26427232f6eb9385ce510fb6d4","observation_id":"7fad7658-0c0b-409e-886d-56e0c4d08177","resolution":{"observed_at":"2026-08-07T05:31:42.358916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.361669Z","title":"Newcombe, and Vasileios Balntas","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.361669Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:133cc3a71c3cc4aa51adbf4b96aa52d9966dadf607da606dcf5ac9145bd01f9d","observation_id":"0617dc0d-0e34-4703-96c7-c1db19e69ccb","resolution":{"observed_at":"2026-08-07T05:31:42.361669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.364505Z","title":"MultiMAE: Multi-modal multi-task masked autoencoders","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.364505Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:8b0c585ab751a6b46de0b891a20b9177666979a3e9b8591369ee4a7f6743f5b6","observation_id":"bc8ce495-3b8b-4b19-bc39-a6519066f386","resolution":{"observed_at":"2026-08-07T05:31:42.364505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.366966Z","title":"4M-21: An any-to-any vision model for tens of tasks and modalities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.366966Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:e1494cae1f4f1ba12b808a626476ae695d1672f37a712f14cace458d2b5dc517","observation_id":"449cfd9e-580e-4616-901f-ab5e8a91cdd1","resolution":{"observed_at":"2026-08-07T05:31:42.366966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.369371Z","title":"Lending a hand: Detecting hands and recognizing activities in complex egocentric interactions","venue":null,"work_id":null,"year":1949},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.369371Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:cae6f7fc162dd3d207398d5c298b8b0961d6cab4c17bae8e27726b7a7de445dc","observation_id":"13c506a7-8635-4d99-9918-5431ab0404ce","resolution":{"observed_at":"2026-08-07T05:31:42.369371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09598","last_updated":"2024-06-13T21:38:17Z","snapshot_observed_at":"2026-08-15T09:37:43.807327Z","submitted_at":"2024-06-13T21:38:17Z","title":"Introducing HOT3D: An Egocentric Dataset for 3D Hand and Object Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09598","snapshot_observed_at":"2026-08-07T05:31:42.372012Z","title":"Introducing hot3d: An egocentric dataset for 3d hand and object tracking.arXiv preprint arXiv:2406.09598,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.372012Z"},"links":{"cited_paper":"/paper/2406.09598","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:af13283225fbed30da817bd4f6929ac506a479148b66bdcf7e24a385558a6655","observation_id":"f68b6e4d-f5d9-4ffe-b548-1bef9b959f7b","resolution":{"observed_at":"2026-08-07T05:31:42.372012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.375059Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.375059Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:b8364f51505e7874d03bdcecb621a65d3816d821d31e9bd3a72edd8c3195330f","observation_id":"b8f5cdf0-83c4-44f1-8530-eb19bc33e420","resolution":{"observed_at":"2026-08-07T05:31:42.375059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.377428Z","title":"Align your latents: High-resolution video synthe- sis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.377428Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:f4b15e1b9a0874df081be380d1040dd3e1ea9e542d51f12cfed6d25984f67da0","observation_id":"49ff6499-ee5d-430f-8f77-31886228d558","resolution":{"observed_at":"2026-08-07T05:31:42.377428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.379761Z","title":"Scene coordinate reconstruction: Posing of image collections via incremental learning of a relocalizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.379761Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:e54570c0ba7bd078b54602e14f3a3368914e260be0a52aaaa4d779f608b064da","observation_id":"541dd731-2077-4ef5-b5a6-00c8efb30f53","resolution":{"observed_at":"2026-08-07T05:31:42.379761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.382148Z","title":"Genie: Generative interactive environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.382148Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:c5db9aca109acac4d0509d4f5e7a7ac02ef0b97b76e7e8edfd315acdb21561e5","observation_id":"a852ea0f-f485-4732-8c3c-2aa14db15dee","resolution":{"observed_at":"2026-08-07T05:31:42.382148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.384474Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.384474Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:874e11b3dd809e9edd2629f3531c88987139ea5852d55debfd95902555cdda2d","observation_id":"5c1d5162-9dbf-4d9a-b756-670d26569b51","resolution":{"observed_at":"2026-08-07T05:31:42.384474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.386991Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.386991Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:981aa53b43f270a108f20d0b2b61642d2998139bac63c294ad45643d41805059","observation_id":"3f9630f1-da1a-4b4d-9abd-2f82a4159002","resolution":{"observed_at":"2026-08-07T05:31:42.386991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.389243Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffu- sion models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.389243Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:1495273fc41c9a360731497939ac03edbc1289dadfcceb5ffabd13b1396918c5","observation_id":"15fb6131-0fbc-44c4-a196-1853f71245d8","resolution":{"observed_at":"2026-08-07T05:31:42.389243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.391946Z","title":"Fleet, and Geoffrey Hinton","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.391946Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:a7aeb34d887ab43d89de5cd5c322d00ad582c50496d52628040f1d5d22d8bb21","observation_id":"f6e90f27-0f2f-4cdd-98fd-c557c5db6b1b","resolution":{"observed_at":"2026-08-07T05:31:42.391946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.394269Z","title":"Control- a-video: Controllable text-to-video diffusion models with motion prior and reward feedback learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.394269Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:95a20ef3af9b36164af95a178565201b2c5726619408b39fffc6d5b9d3cbc354","observation_id":"8afff46f-d8e4-473d-8a61-84d53bd87593","resolution":{"observed_at":"2026-08-07T05:31:42.394269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.396601Z","title":"Scaling egocentric vision: The epic- kitchens dataset","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.396601Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:b87d60e2632fc7e99484bbe7648ee92878086e949ceee8797432310a8f766857","observation_id":"2b910072-2163-4309-89dc-77bd1f85f945","resolution":{"observed_at":"2026-08-07T05:31:42.396601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T05:31:42.399010Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.399010Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:8f65cf68fa2b7d3fd71d619b9014df090672cc357cc6c7c8d1df208a32f2edba","observation_id":"00a2618b-7fce-4b42-9bec-9b401e93b5e4","resolution":{"observed_at":"2026-08-07T05:31:42.399010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.401827Z","title":"Structure and Content-Guided Video Synthesis with Diffusion Mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.401827Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:9eee17459534d0b028c06c5a87640754cfc12938161aa5da86df34051d9f7b5c","observation_id":"6d95ac89-690b-435f-af8c-9526af2a8c0b","resolution":{"observed_at":"2026-08-07T05:31:42.401827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.404240Z","title":"Black, and Otmar Hilliges","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.404240Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:521df6a1548fd2af0be60898bdfae39eac502974548711cad72938370821f7a8","observation_id":"34ffb50e-9f66-460b-8ce2-7ad3e4a53694","resolution":{"observed_at":"2026-08-07T05:31:42.404240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.406558Z","title":"HOLD: Category-agnostic 3d reconstruction of interacting hands and objects from video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.406558Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:9f1effdcb0eb202feb66dc5b496fe00e332fdcaa6b029ebdd9ab0ee00bb4bc21","observation_id":"3dfc6897-3adf-4384-893a-18b9fd95211d","resolution":{"observed_at":"2026-08-07T05:31:42.406558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12681","last_updated":"2022-04-16T04:21:26Z","snapshot_observed_at":"2026-08-13T17:28:14.250211Z","submitted_at":"2021-11-24T18:31:20Z","title":"VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12681","snapshot_observed_at":"2026-08-07T05:31:42.408928Z","title":"Violet: End-to- end video-language transformers with masked visual-token modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.408928Z"},"links":{"cited_paper":"/paper/2111.12681","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:0f3b95025e77b7ae8656fa3c1b8dfb1f04eac3fa4a7c3e073be0e90cc4e91d90","observation_id":"505417fb-eae6-4fa0-b2de-e1c0b6e9f9d2","resolution":{"observed_at":"2026-08-07T05:31:42.408928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.411701Z","title":"First-person hand action bench- mark with rgb-d videos and 3d hand pose annotations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.411701Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:8fc6d4d5f93a0465d5bbe94b8af5268d0e185b78baec1e3eb6c97cbd6599a980","observation_id":"55a2aeec-0259-4acf-8ae5-04c17ce47536","resolution":{"observed_at":"2026-08-07T05:31:42.411701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.414302Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.414302Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:777bdd7a0f5171e5aa5edfbcb0021589b4dc6530bef3087e9b2e0f065c76d002","observation_id":"5fd4f5f4-7520-4d04-a576-e2df90ba89ff","resolution":{"observed_at":"2026-08-07T05:31:42.414302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.416754Z","title":"Accurate, large minibatch sgd: Training imagenet in 1 hour, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.416754Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:ad0a7c464229bde3cc320e6584359185252dd4fc36b55cebcaac5a9a8d61e3f2","observation_id":"9e5a3b5b-3cb4-4816-a31b-6ad45b96c684","resolution":{"observed_at":"2026-08-07T05:31:42.416754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.419200Z","title":"Ego4d: Around the World in 3,000 Hours of Egocentric Video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.419200Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:ec7039183f0b2b7e998dd40fd6ed6a51e4466ebaf239ad959e1ebd6303113b5d","observation_id":"0801895d-a503-4cb6-a12f-0c36348f3d69","resolution":{"observed_at":"2026-08-07T05:31:42.419200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.421469Z","title":"Ego-exo4d: Understanding skilled human activity from first- and third-person perspec- tives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.421469Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:240fb8268bd636eb9b1b1b142d005a93dde5480301e7ab4c8e0aa22c953bcab8","observation_id":"bcf61676-1751-4004-80ab-d9232c3a7592","resolution":{"observed_at":"2026-08-07T05:31:42.421469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.423750Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.423750Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:e484d3774a187bc76943268ccddfb10808073e6269273ab8314c0cc6eea66ca8","observation_id":"59fcde70-c33c-4575-9deb-69eab36e6483","resolution":{"observed_at":"2026-08-07T05:31:42.423750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-08-15T13:04:28.651186Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-07T05:31:42.426124Z","title":"World models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.426124Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:97e32f4ac1601baacd82f52c3c559172f95d82f63343edc38cb4b6c610166d87","observation_id":"9af1b819-83cf-4904-80fc-840d4704c4aa","resolution":{"observed_at":"2026-08-07T05:31:42.426124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.428661Z","title":"Girshick","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.428661Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:5cef1d622bf4f4da30ae61c6b29803fa7f72a0c33c3bcc87df83668ec8e9072d","observation_id":"7c1575ea-1ee2-4ed0-8020-9e970c0fd46a","resolution":{"observed_at":"2026-08-07T05:31:42.428661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.430965Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.430965Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:338b41f3473868c35ea74b89c2669276ed498f9cf8ef1a399e1fb5cb27fa8070","observation_id":"cfecc510-d9c4-4fa7-8696-949fad01d9f0","resolution":{"observed_at":"2026-08-07T05:31:42.430965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.433709Z","title":"Video diffu- sion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.433709Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:a46faf11eeb8d37369327e11282dd95ebe31b628331d37ebfcbd0c3350014397","observation_id":"c087ee39-de85-40d5-ab00-c371152241bb","resolution":{"observed_at":"2026-08-07T05:31:42.433709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.436271Z","title":"The curious case of neural text degeneration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.436271Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:342a4e0f1fcd0676ae48faef6f702152532661b9f6c7f8cfcf5b8ea832417c3d","observation_id":"4a4af980-0b14-40ca-abf4-c16d7b4263c4","resolution":{"observed_at":"2026-08-07T05:31:42.436271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.438690Z","title":"Cogvideo: Large-scale pretraining for text-to- video generation via transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.438690Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:f35cdc387a25a7a787c53fcf7a94eee2190ef914a25a981b85fdb567ac708758","observation_id":"7c459429-91fc-4ea3-a3cc-f48d486d3cf5","resolution":{"observed_at":"2026-08-07T05:31:42.438690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.441013Z","title":"Gritsenko, Jasmijn Bastings, Ben Poole, Rianne van den Berg, and Tim Salimans","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.441013Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:e21392e31622ffa7a4392b7e3fdbb23d5200ba1e56307a90db95fe0fa6a51b74","observation_id":"1e6a5851-42d7-4baf-be4c-4db19fd1e816","resolution":{"observed_at":"2026-08-07T05:31:42.441013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.443348Z","title":"Ross, and Alireza Fathi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.443348Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:16ebf2e05a6473ffdc80be81f8254c0346f3f7640ede2cd58301117df103f375","observation_id":"0ff59b2a-d994-4462-9651-ffcf2ec61f47","resolution":{"observed_at":"2026-08-07T05:31:42.443348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.445693Z","title":"Predicting gaze in egocentric video by learning task- dependent attention transition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.445693Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:0fe3ca222c10e94813d7612184126573e5bbd99805a5c205690e6566698c5d90","observation_id":"d63a9227-59ab-40b8-b469-aae67ab99370","resolution":{"observed_at":"2026-08-07T05:31:42.445693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T05:31:42.447923Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.447923Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:0a134b9f0dc78c35f8824c5a58ebf6918d6caf048f188adabdcc0413377c1ceb","observation_id":"2a3c13d0-fb71-46ce-b967-3ad57c9ea5f2","resolution":{"observed_at":"2026-08-07T05:31:42.447923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.450515Z","title":"Epic-fusion: Audio-visual temporal binding for egocentric action recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.450515Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:1b23ab52a7e588f33e6968fafaf33565f51ae6db4d6edc4b78c75d19d316d335","observation_id":"400f5c80-0591-4a7f-a8ab-ffd96cbb14b8","resolution":{"observed_at":"2026-08-07T05:31:42.450515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.453671Z","title":"Re- purposing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.453671Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:618afeeca0c4af47ab0c5c3d999e9e95e3970d16ce94bb5cf938f6eaafdc769a","observation_id":"04454c8a-dc38-4169-a86b-a8039f528166","resolution":{"observed_at":"2026-08-07T05:31:42.453671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.456344Z","title":"Video depth without video models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.456344Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:ed97c80eb53c30c18f2aaa2ca9dac4c72c441d201c9011f1c54f8fbab061e351","observation_id":"c185bded-22cc-4cc7-bf12-3d5c9ceec635","resolution":{"observed_at":"2026-08-07T05:31:42.456344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.458614Z","title":"Text2Video-Zero: Text- to-Image Diffusion Models are Zero-Shot Video Generators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.458614Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:6308c1013df756794807e77dbc7342dd9d62739c18e8be636b06670b246e33c9","observation_id":"36c03888-f351-40d8-834e-23e0d4fd5506","resolution":{"observed_at":"2026-08-07T05:31:42.458614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.460971Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.460971Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:4937aac31c3a646897a75b9768bdab60984e05985bdab27acdeab7aae1f039e8","observation_id":"306b8dd8-70c4-4016-8e9a-b90231c1cee4","resolution":{"observed_at":"2026-08-07T05:31:42.460971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.463435Z","title":"Harmsen, and Neil Houlsby","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.463435Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:547a0ff987593b343e54654b1e13a43697866f8a6b244a7d999a696ae1706543","observation_id":"85cfafe2-386a-4e0b-a8b3-b6856a206452","resolution":{"observed_at":"2026-08-07T05:31:42.463435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.465709Z","title":"VideoPoet: A large language model for zero-shot video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.465709Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:e15f3fbf17ac6e07e887f0966b4bd1af4d1e622ec66c0185fed8b9f24a812b31","observation_id":"56202ac3-0576-4504-b221-2e677d77f744","resolution":{"observed_at":"2026-08-07T05:31:42.465709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.468298Z","title":"H2o: Two hands manipulating objects for first person interaction recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.468298Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:5af2df13d364c4648433e78dd3ac3af021a4aed0d6832175c2d51dbd19085363","observation_id":"8aaa8fa9-d631-4558-9fcf-3e60bf0ae668","resolution":{"observed_at":"2026-08-07T05:31:42.468298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.470764Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.470764Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:7f0469676c25cb96ad1245e547b15305416cc0758f45c58b29e1465e9f81ae2a","observation_id":"4caa288a-432f-4f65-affa-3db175476b05","resolution":{"observed_at":"2026-08-07T05:31:42.470764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.473203Z","title":"Lisa: Reasoning segmenta- tion via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.473203Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:411b91ddc41b2b85e1e983f88bee963f94def7f051e4a48e8364d6c3e61cf8ba","observation_id":"a82b8a1d-6305-4cfa-93db-c0ffa7b3405a","resolution":{"observed_at":"2026-08-07T05:31:42.473203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.475810Z","title":"Egogen: An egocentric synthetic data generator","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.475810Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:ef03ac0740202f45a07f40f39a0883c1aaf6fc69ec072c267d926b15168cb6ad","observation_id":"31d3e8ba-650b-4fb4-992f-ca9afb0f6ad1","resolution":{"observed_at":"2026-08-07T05:31:42.475810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T05:31:42.478451Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.478451Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:d359239de886c52e99e49f5c75bfd162c8bc171c2d50a47dcaafa74339d38f2b","observation_id":"f4bd1b8c-c516-46d8-a784-fb266f7e1a4f","resolution":{"observed_at":"2026-08-07T05:31:42.478451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.481256Z","title":"Megasam: Accurate, fast and robust structure and motion from casual dynamic videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.481256Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:cb3d027379deefc2624b9e8b40ba80e92372f6d9909307c9218d4c18db192985","observation_id":"aec46962-59cc-45c6-acbc-8457da029965","resolution":{"observed_at":"2026-08-07T05:31:42.481256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.483820Z","title":"Video-LLaV A: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.483820Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:fff511149c323cf7449255399a3fb9e49b68b8bc51a3957350a2302b0050d9f9","observation_id":"45d097af-9a90-49d3-91e0-60c25371e42e","resolution":{"observed_at":"2026-08-07T05:31:42.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.486760Z","title":"Cross-view exocentric to egocentric video synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.486760Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:454f79b11280cb25a81d677f50ef5cfb5fe9495f1436d1809563d7626907fc61","observation_id":"3e263881-3e9a-4794-86af-d218551e21ae","resolution":{"observed_at":"2026-08-07T05:31:42.486760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.489037Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.489037Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:c723dc508d73cddacda53aa3b45287cf323de91946cc5a760cb8d85cdd73a6fd","observation_id":"01a27f75-5b00-4edf-8daa-383a5ad7a7c2","resolution":{"observed_at":"2026-08-07T05:31:42.489037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.491572Z","title":"Exocentric-to-egocentric video gener- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.491572Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:eda2696fd333e2484806093d6812205bf19d4375c23516e9df647646618cc574","observation_id":"6b3c69ab-e05a-4fbb-b93b-29013773e9f4","resolution":{"observed_at":"2026-08-07T05:31:42.491572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.494202Z","title":"Li, Ying Shan, and Ge Li","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.494202Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:a67520f57051ea39bcb8685dcaab01b1073931fdadb760a7ba4846401bab213b","observation_id":"6f7ff5ef-cb26-4e70-a7fc-dc3429d9c4d3","resolution":{"observed_at":"2026-08-07T05:31:42.494202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.499922Z","title":"Hoi4d: A 4d egocentric dataset for category-level human-object interaction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.499922Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:c6c8f74fa2e4b19175f6684623cbdfa7c8c977dac70bd797e6c88271026a5b55","observation_id":"fee22a39-4c72-4ac1-8728-4142f468e909","resolution":{"observed_at":"2026-08-07T05:31:42.499922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.502461Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.502461Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:de54f7f3f61e5811efea57022c29d187b2aac27980e194e4b558e727f169232f","observation_id":"baa0c2cf-52c5-41ae-99fe-26b4bc392390","resolution":{"observed_at":"2026-08-07T05:31:42.502461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.505098Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.505098Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:2ee0898f0d5bc57a015bc9f7df42dc90bfd184805915a507eeeb22e69f07dbb3","observation_id":"9064648b-65c1-4b38-a48f-fdd5d5acbc60","resolution":{"observed_at":"2026-08-07T05:31:42.505098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.507569Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.507569Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:2a638f36b95cd12a6bad13e3dab4c675b40c80c1dd50ad2b4125a5d2cb04e733","observation_id":"b95d2052-f35f-4041-8469-e7085267b8e4","resolution":{"observed_at":"2026-08-07T05:31:42.507569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.509938Z","title":"Unified-io 2: Scaling autoregressive mul- timodal models with vision, language, audio, and action","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.509938Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:7edd01c92810c57b0f0c1ae4e1e0a2a754bd968f9662cc4d54f8635d86238184","observation_id":"d35445cd-14d2-407e-a5e3-3c65dc60ab61","resolution":{"observed_at":"2026-08-07T05:31:42.509938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.342370Z","title":"UNIFIED-IO: A uni- fied model for vision, language, and multi-modal tasks","venue":null,"work_id":"10059363-e6ad-455b-870c-f3faae31d7ad","year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.512343Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:56e96542c2e7687d3753af72b5579e72e0c215c7685b44b3a1e900169b9f7748","observation_id":"4ddd5a67-06cf-42cf-968e-3ddfee63a802","resolution":{"observed_at":"2026-08-07T05:31:43.345152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.334826Z","title":"Align3r: Aligned monocular depth estimation for dynamic videos","venue":null,"work_id":"d26f450e-f820-44d1-a518-92cc32bd4c17","year":2025},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.515421Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:51be449baea7b2a0dbf8832d4820abd1757ca774f57c234f900fa12006e50276","observation_id":"a87fcc94-61c6-4fb1-a7f3-9790ca147d68","resolution":{"observed_at":"2026-08-07T05:31:43.337663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.327287Z","title":"Dream Machine","venue":null,"work_id":"8e24fa1d-966b-4c1b-8843-bdec4198b161","year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.518003Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:ab4f70a086b0a877771b9cbb87b600581279d0c3606ff77cf76b1074cda52d11","observation_id":"e196fdd4-630d-480a-8b97-1abbf6d199b6","resolution":{"observed_at":"2026-08-07T05:31:43.329825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.319722Z","title":"Videofusion: Decomposed diffusion models for high-quality video generation","venue":null,"work_id":"13e1ea40-0ec3-4bfb-bad6-e892c88dde0a","year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.520485Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:711c65c6f772b77747dbb6f9de976660aacb6b6cfaac1b12040a56ace7581fa0","observation_id":"85040bb0-72f9-4587-923d-e6ba6321b337","resolution":{"observed_at":"2026-08-07T05:31:43.322374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13349","last_updated":"2024-02-22T03:37:36Z","snapshot_observed_at":"2026-08-13T04:14:14.123303Z","submitted_at":"2024-02-20T19:53:15Z","title":"Aria Everyday Activities Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13349","snapshot_observed_at":"2026-08-07T05:31:42.522928Z","title":"Aria ev- eryday activities dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.522928Z"},"links":{"cited_paper":"/paper/2402.13349","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:9ddede54a5ee14b9b4ee4fa6879cb26ea88e9e14788ea4851111a89d74e3457e","observation_id":"b49d3759-826d-4058-912b-f96bc2c8be84","resolution":{"observed_at":"2026-08-07T05:31:42.522928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09905","last_updated":"2024-09-20T01:18:11Z","snapshot_observed_at":"2026-08-12T23:42:49.268895Z","submitted_at":"2024-06-14T10:23:53Z","title":"Nymeria: A Massive Collection of Multimodal Egocentric Daily Motion in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09905","snapshot_observed_at":"2026-08-07T05:31:42.525404Z","title":"Nymeria: A massive collection of multimodal egocentric daily motion in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.525404Z"},"links":{"cited_paper":"/paper/2406.09905","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:b2e0f6a81ba1de9b2b416d5ae5bbca21459ab0feadd0bd95f98d1ef582261bd0","observation_id":"b6e9ab21-5033-431c-80fe-6db7083e494f","resolution":{"observed_at":"2026-08-07T05:31:42.525404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.311929Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"88bd040d-3cda-482c-a0cc-8fe41ffda9e1","year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.527939Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:a570255a4d750bcbfc895c7ab7fec25a167dc1210e0934a29eab402fc44302bb","observation_id":"1fd07221-c02f-4ec3-a438-49767fe5dfa2","resolution":{"observed_at":"2026-08-07T05:31:43.315038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.304109Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training, 2024","venue":null,"work_id":"4c6099b3-05a4-43cf-8a80-3fc42ed0c5ca","year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.530377Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:2820e557d2f9c6982dca3ceb77e61aeb898de714ab866f87045ccddbe3241e44","observation_id":"9977c314-da17-4ddf-b118-483416f1e3f9","resolution":{"observed_at":"2026-08-07T05:31:43.306917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.297097Z","title":"Project Aria Glasses","venue":null,"work_id":"4148ef05-4a89-4d54-9119-bc9f757ab41f","year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.532866Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:122b74e00de0f22b519c7c45dc23151bf03d3d9796c2ad92ba21afe0d2cbb5b6","observation_id":"d9deb7a6-65ed-4c3a-b7db-84c72c36390f","resolution":{"observed_at":"2026-08-07T05:31:43.299588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00588","last_updated":"2023-03-01T09:21:14Z","snapshot_observed_at":"2026-08-14T21:03:04.507003Z","submitted_at":"2022-09-01T17:03:07Z","title":"Transformers are Sample-Efficient World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00588","snapshot_observed_at":"2026-08-07T05:31:42.535714Z","title":"Trans- formers are sample-efficient world models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.535714Z"},"links":{"cited_paper":"/paper/2209.00588","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:c4405392ecbad176b3c23714b12c144fd421e5a456b2e33004c2c1eeb5fc125f","observation_id":"8ba322c7-646c-418d-9622-261ee4a5c97b","resolution":{"observed_at":"2026-08-07T05:31:42.535714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.289793Z","title":"HoloLens 2","venue":null,"work_id":"4e69ff22-0f22-4919-8a74-83e46b129d1e","year":2019},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.538301Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:cd9a8e8b135fae972caa4e02f2053c5d73421d4471f3ed57ae85c2c289ff3482","observation_id":"5dc57102-cd1d-463d-b21a-8dcf0ada7d48","resolution":{"observed_at":"2026-08-07T05:31:43.292402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.282406Z","title":"4M: Massively multimodal masked modeling","venue":null,"work_id":"1913f39d-6914-43b1-869e-e4ae4aba1af5","year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.540832Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:372c05c262f439ac71c95f2cea24a7a2356a3300ef238bb406780e3b33a115ae","observation_id":"c137608e-1b3b-4edf-bd0f-d879c2a3dbf5","resolution":{"observed_at":"2026-08-07T05:31:43.285124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.274975Z","title":"AssemblyHands: towards egocentric activity understanding via 3d hand pose esti- mation","venue":null,"work_id":"fe5a4712-3767-4881-a1b6-5157fb70a0f2","year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.543229Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:a7cab3684422ed099fa8e35689f90073b56357d4a47bc94db2d0930abaebaddf","observation_id":"b4420ba5-ac62-4b89-b5cb-6046902b1220","resolution":{"observed_at":"2026-08-07T05:31:43.277532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.267007Z","title":"Video generation models as world simula- tors","venue":null,"work_id":"e25a893e-434d-4153-8c19-f0fb84ac30d9","year":null},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.545537Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:4731fca0a066d99cc9cc9e09537bc80f75f4a1853e5e3c839fb208cce42b1057","observation_id":"c79c1e4d-4e9a-4db0-aae0-0eff5aeb866a","resolution":{"observed_at":"2026-08-07T05:31:43.269716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.259777Z","title":null,"venue":null,"work_id":"bafd4369-fe89-4648-a73e-c7d35542482e","year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.548214Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:b48d1af2602c0f13f76bb0dd3020c6148a7bc987e5a3ddde94e035acf1edbd39","observation_id":"374a7076-4d4a-4983-9a51-fd3c31220660","resolution":{"observed_at":"2026-08-07T05:31:43.262258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.251429Z","title":"Aria digital twin: A new benchmark dataset for egocentric 3d machine perception","venue":null,"work_id":"6512ee24-73b4-4c66-83e3-457641ee99fd","year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.550637Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:8ac8fd6e0bde04af609ca6f9a62f4da664ba56290607bacf5112cec6f49da5be","observation_id":"3fb761d3-f991-4650-a924-fac389397dcf","resolution":{"observed_at":"2026-08-07T05:31:43.254661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-14T11:08:32.950294Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T05:31:42.552979Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.552979Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:b81dcaed8af58f1928c1a68ac641b17f3ed0f203038f644b714b233a26060e5f","observation_id":"b0563564-1aa4-491d-a10b-6305dffedad5","resolution":{"observed_at":"2026-08-07T05:31:42.552979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.242973Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"7a4f782a-7814-42a9-9af4-37e0301b7b20","year":2021},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.555752Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:df3ef34668774e0cadc8cf0403575faadc84cf6ea9ce41c77fc831a779b6f1c3","observation_id":"2a104cc6-49f3-486a-a341-1b1e0f6f3a57","resolution":{"observed_at":"2026-08-07T05:31:43.245929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.234881Z","title":null,"venue":null,"work_id":"47f6e3cb-3a9e-48fa-9d45-de50d0b8c161","year":2020},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.558132Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:25c6206c76679ec71a8159fc2a39c3e2f56329e0f8895b752c55c07bd770ffb7","observation_id":"43e157ec-730b-452b-8b52-c5821f2d7f52","resolution":{"observed_at":"2026-08-07T05:31:43.237643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.226456Z","title":"High-Resolution Im- age Synthesis with Latent Diffusion Models","venue":null,"work_id":"5e01c818-9c96-412d-8f56-663646060cf1","year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.560589Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:5eb6f92ef9109559733ca5e81358601ee95eb28837f8847bae6629fc7dac12bb","observation_id":"64ae6b91-6d2e-4268-bbab-dff2f7364b2d","resolution":{"observed_at":"2026-08-07T05:31:43.229469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.218459Z","title":"Gen-3 Alpha","venue":null,"work_id":"74509dc9-5564-44be-8606-85a82988e5af","year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.562991Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:f7743258645bb399a5297a3d9e3bbff5f25464c2fa3788edafce23d9f1090708","observation_id":"b3f70a23-1293-4c39-9ff0-f360abc10974","resolution":{"observed_at":"2026-08-07T05:31:43.221152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.209427Z","title":"Lamar: Bench- marking localization and mapping for augmented reality","venue":null,"work_id":"4196d515-52c2-4037-9a8f-60310db1bc68","year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.565470Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:32e6ae286b3090755562abbcf900bce7caf275de75fe57a81a27e246d5646f56","observation_id":"66bddc3a-7e9c-4f03-bd41-b88c485106d3","resolution":{"observed_at":"2026-08-07T05:31:43.212813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.200788Z","title":"Sener, D","venue":null,"work_id":"41a3851d-50c5-405e-bbf9-870d46ce3d06","year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.567826Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:9c811896d7aa321f967ea917dfd67183dc80c5ca4478ab9e15f26af86cb2b02b","observation_id":"07d1e775-b7d6-4c92-94dc-a1b1a51ed7b1","resolution":{"observed_at":"2026-08-07T05:31:43.203556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:42.570245Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.570245Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:71ae64985f117351145aecf690d5911fee33f0d367c0527fdd535cc07129481a","observation_id":"ee2d64bc-3bc5-478e-af14-5ff57d27f4ce","resolution":{"observed_at":"2026-08-07T05:31:42.570245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05797","last_updated":"2019-06-13T16:29:58Z","snapshot_observed_at":"2026-08-01T13:51:16.469557Z","submitted_at":"2019-06-13T16:29:58Z","title":"The Replica Dataset: A Digital Replica of Indoor Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05797","snapshot_observed_at":"2026-08-07T05:31:42.572653Z","title":null,"venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.572653Z"},"links":{"cited_paper":"/paper/1906.05797","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:1a4fd1f39c54d134a1a66ce5149d93ec0cd1487f91ef007dce99c28b36686565","observation_id":"2706b4d7-8665-4f5e-9dc2-06dd67743634","resolution":{"observed_at":"2026-08-07T05:31:42.572653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.188191Z","title":"Part, Ioannis Papaioannou, Arash Eshghi, Ioannis Konstas, and Oliver Lemon","venue":null,"work_id":"0afe7759-4f95-4ebd-af1c-16c4de590021","year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.575522Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:bd9815842228da5dad1bbea9fc2b7f716794ccc44a148ed7008a8a37c2db6aea","observation_id":"c84926b5-1768-451c-b056-ae70ede2ec88","resolution":{"observed_at":"2026-08-07T05:31:43.191261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.181007Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":"dfedd122-dc92-4322-abd0-1a9913e81cfb","year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.577766Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:8af986782f3ab9f8b72770f3564360b46176d850e43da935d45ea0d472bf5b82","observation_id":"c5e558a0-b2ed-4d3d-bf55-4fb269ab28b3","resolution":{"observed_at":"2026-08-07T05:31:43.183503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T05:31:42.580076Z","title":"Gem- ini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.580076Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:790f3ec63f2b93470e4783aba0f8d9dcceab56a8d087dcef349201bda681c208","observation_id":"9ba77c0d-e496-42e5-a6c2-5147d5e6eb40","resolution":{"observed_at":"2026-08-07T05:31:42.580076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.173742Z","title":"Kling ai video generator","venue":null,"work_id":"cb651866-6b55-4a82-a602-130250c88786","year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.582501Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:e4b565eda5f2aa73fde758191b4e36b8a54a216d0e325483223d8181d397bfb3","observation_id":"522fd6c4-b46a-4fc0-b37e-a072ab425b44","resolution":{"observed_at":"2026-08-07T05:31:43.176365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.165383Z","title":"DROID-SLAM: Deep vi- sual SLAM for monocular, stereo, and RGB-d cameras","venue":null,"work_id":"21ae3a76-dd9c-448e-8694-e30bdee81b04","year":2021},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.584808Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:95025d35775e3bcabb5a0c938e3f23cee1549614c658a005e16bb4fe49fc5eff","observation_id":"e8559f55-245d-4006-a0d8-af30007aedce","resolution":{"observed_at":"2026-08-07T05:31:43.168267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.157048Z","title":"VideoMAE: Masked autoencoders are data-efficient learn- ers for self-supervised video pre-training","venue":null,"work_id":"03ed9ee1-360d-48de-81e7-3824ef167c65","year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.587075Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:9f8d9b34bd5aa42cdccf6c60512dfb1d8dc0b5d4336eec102b4efd51e001ee8b","observation_id":"2fa6a850-a295-4b97-a6bc-d0ddc6ddd58f","resolution":{"observed_at":"2026-08-07T05:31:43.160061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.148290Z","title":"Towards accurate generative models of video: A new metric & challenges, 2019","venue":null,"work_id":"bbd3a3bc-d4b3-495c-bfef-36bafda6eef8","year":2019},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.589235Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:5fa2cb73bec9c50823b7261b6ad6113585a088cffd9434db6cc59366fcfec18c","observation_id":"2a8dbe85-a2d5-4cb7-a498-9d7c352ce84d","resolution":{"observed_at":"2026-08-07T05:31:43.151538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-08-14T07:06:06.462400Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-07T05:31:42.591660Z","title":"Diffusion models are real-time game engines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.591660Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:b530121e6a0a559eaa3a0643f923f1619f420670a83bdbc1dac34602ea403194","observation_id":"1e2f2197-f1ed-4ec3-9ad4-e1979f876097","resolution":{"observed_at":"2026-08-07T05:31:42.591660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.140086Z","title":"Neural discrete representation learn- ing","venue":null,"work_id":"12c86dfd-4144-431d-b41f-dc62d3043d22","year":2017},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.594555Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:0afab5b69a0f67a03184567e00d9534dd0c7248c106f42b550f1077f38514f8e","observation_id":"7e673542-0d8e-4206-bd37-c9d6f93d6215","resolution":{"observed_at":"2026-08-07T05:31:43.142981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.131936Z","title":"Attention is all you need","venue":null,"work_id":"e3e40857-6603-4c0b-895e-e63a79e1013d","year":2017},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.596902Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:01dd3916e0db0f53944bba060d94c4aae1122eb512155d3f5e94abe4fac3b340","observation_id":"3fc44bf5-10be-4363-8f68-d9a1423b43b9","resolution":{"observed_at":"2026-08-07T05:31:43.134665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:31:43.123207Z","title":"Phenaki: Variable length video generation from open do- main textual descriptions","venue":null,"work_id":"fa007d6c-9927-4fe1-a278-a819ca9f7a59","year":2023},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.599141Z"},"links":{"citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:a975cc6e5d1c35cbabb7103e989c2fb2c0bd3469d693d63ada35243203a6bba4","observation_id":"f383cfda-5eff-479b-b21c-46daadaed112","resolution":{"observed_at":"2026-08-07T05:31:43.126418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T06:55:59.818042Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":74,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":138},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 100 of 138 outbound references and 0 inbound Pith citation observations for arXiv:2506.07886."}