{"as_of":"2026-08-15T16:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eeaff3ae3ea034547b5b2a8bfba495877072534ecb48001bc3081c4aaa15f4bb","coverage":[{"denominator":119,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:55:59.914437Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.00932/citation-record","integrity":"/paper/2412.00932/integrity","json":"/paper/2412.00932/citation-record.json","paper":"/paper/2412.00932"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.397059Z","title":"When will you do what?-anticipating temporal occurrences of activities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.397059Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:26af4fda3f17a3ebb8db67c2c0c68e16e6f355ce5075b6dbaccf9d4365f54991","observation_id":"c95a774e-e9a0-4766-a269-52b754da3f11","resolution":{"observed_at":"2026-08-12T04:55:59.397059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.401821Z","title":"A spatio-temporal transformer for 3d human mo- tion prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.401821Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:17258bf9dd64121900be89f4fe008b975a26a18ef163d81ef49982564655c8fa","observation_id":"022228d3-b30f-4870-826d-c08cd4edc939","resolution":{"observed_at":"2026-08-12T04:55:59.401821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.406523Z","title":"Zero experience required: Plug & play modu- lar transfer learning for semantic visual navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.406523Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:7398a271edfe1c2ccf9d98373f33f0a3017decb0d2f640d2950aeaf3c1caa891","observation_id":"b58bab80-8db7-48bc-9ab1-8c9ea6846ff9","resolution":{"observed_at":"2026-08-12T04:55:59.406523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.06757","last_updated":"2018-07-18T03:28:02Z","snapshot_observed_at":"2026-08-14T11:12:04.949259Z","submitted_at":"2018-07-18T03:28:02Z","title":"On Evaluation of Embodied Navigation Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.06757","snapshot_observed_at":"2026-08-12T04:55:59.412778Z","title":"On evaluation of embodied navigation agents","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.412778Z"},"links":{"cited_paper":"/paper/1807.06757","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:265960f72da8acd20ae3a1256adfefaf9a440f417ce9f8d310b173c8cf4aeae4","observation_id":"7e2b7f73-dc70-429b-83f1-2e990df1e54e","resolution":{"observed_at":"2026-08-12T04:55:59.412778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.418626Z","title":"Hiervl: Learning hierarchical video- language embeddings","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.418626Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:29feba18bc0f03cac9b8c9a9717caffd46bc17d03b5ccea3091a0de35ef213c9","observation_id":"dc20e4b7-d67d-4887-9c40-3dd2704841e0","resolution":{"observed_at":"2026-08-12T04:55:59.418626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00672","last_updated":"2025-04-11T20:37:50Z","snapshot_observed_at":"2026-08-12T23:10:07.704417Z","submitted_at":"2024-08-01T16:13:07Z","title":"ExpertAF: Expert Actionable Feedback from Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00672","snapshot_observed_at":"2026-08-12T04:55:59.425152Z","title":"ExpertAF: Ex- pert actionable feedback from video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.425152Z"},"links":{"cited_paper":"/paper/2408.00672","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:742d37b29ef557f88c9523759c75ab7739413fd4f0cf45b30bb7ad6625b7c8e7","observation_id":"2542b0b9-ef66-40d1-ae14-91d0690dcb4c","resolution":{"observed_at":"2026-08-12T04:55:59.425152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.429721Z","title":"Video-mined task graphs for keystep recognition in instructional videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.429721Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:4441ed79c502a27ab1aa2875617c9daffc70a441f956cd7072610e029d60d331","observation_id":"1a821230-2642-46a5-84fa-8a3633942ca3","resolution":{"observed_at":"2026-08-12T04:55:59.429721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.434263Z","title":"Affordances from human videos as a versatile representation for robotics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.434263Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:ae1bc5ec4052db0b2a6b9cf0bfb6b678f5b19cbd1a86adc4b984f3dc7fd57241","observation_id":"f90a7c01-627c-42ef-a83f-4f677f48f99b","resolution":{"observed_at":"2026-08-12T04:55:59.434263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13171","last_updated":"2020-08-30T04:28:13Z","snapshot_observed_at":"2026-08-14T14:40:15.936772Z","submitted_at":"2020-06-23T17:18:54Z","title":"ObjectNav Revisited: On Evaluation of Embodied Agents Navigating to Objects","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13171","snapshot_observed_at":"2026-08-12T04:55:59.438939Z","title":"Objectnav revisited: On evaluation of embodied agents navigating to objects","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.438939Z"},"links":{"cited_paper":"/paper/2006.13171","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:d9ccd3cde14183981d1662aecd3bd738840552f35efb3b589f8c1dc97aa1f647","observation_id":"95c4d2c7-7c85-46bb-8864-5b7294c1375c","resolution":{"observed_at":"2026-08-12T04:55:59.438939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.443996Z","title":"Is space-time attention all you need for video understanding? In ICML, page 4, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.443996Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:6a37ea62e8d5a5725f60eb5b39f4f3eabd98b86c8f80375701aed255cbebfa0c","observation_id":"2297cef5-8674-44dc-b5a2-c97368b3ec24","resolution":{"observed_at":"2026-08-12T04:55:59.443996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.450889Z","title":"Procedure planning in instructional videos via contextual modeling and model- based policy learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.450889Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:da6db82c6bcf95f0495b71a75706c509e3e60fdac5cfb1a8ca779dfe32066ac5","observation_id":"f8935a8d-f960-4b47-913e-5e629a3e7a4c","resolution":{"observed_at":"2026-08-12T04:55:59.450889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.454637Z","title":"Long-term human mo- tion prediction with scene context","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.454637Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:c669df3e2b68b8b95bdbfc501047183e08a0e31983012a1617ff0445aef81913","observation_id":"f740a5e7-ad07-4b37-9228-1038b8bc3012","resolution":{"observed_at":"2026-08-12T04:55:59.454637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.457842Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.457842Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:6ef5de35f03cf422a72ea44cfd07905de656909db7e8854f7cd8ae4474ea82f3","observation_id":"b9a306b7-83f1-4529-a98d-6b87fb4af34f","resolution":{"observed_at":"2026-08-12T04:55:59.457842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.461437Z","title":"Procedure planning in instructional videos","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.461437Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:4e602259df941d026c460d789093965d31fa5794183cf5fa9349b50a69e2a53b","observation_id":"4c1da243-0ef4-44e7-8edd-fb9aab1adbc5","resolution":{"observed_at":"2026-08-12T04:55:59.461437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16796","last_updated":"2024-03-06T02:19:38Z","snapshot_observed_at":"2026-08-14T10:57:44.231246Z","submitted_at":"2024-02-26T18:09:24Z","title":"Expressive Whole-Body Control for Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16796","snapshot_observed_at":"2026-08-12T04:55:59.464865Z","title":"Expressive whole-body con- trol for humanoid robots","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.464865Z"},"links":{"cited_paper":"/paper/2402.16796","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:cfb3be5395d03d40e5d54d92cc08f3d55be9f6a639ce6117fe7a3eb33c394abb","observation_id":"5eb360d5-b888-47e2-9637-920da724e3ac","resolution":{"observed_at":"2026-08-12T04:55:59.464865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.468904Z","title":"Context-aware human motion prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.468904Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:d76068881cbd429a58c6ff731ccc127efd8f141484e29316c3c252b089a09837","observation_id":"58b08415-f29b-4bf7-9c4e-ef45c24e6c0f","resolution":{"observed_at":"2026-08-12T04:55:59.468904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.473018Z","title":"Enrichme: Per- ception and interaction of an assistive robot for the elderly at home","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.473018Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:7feda8e692071433d43b26e95ea1e5063a780b2822e5ae0afe8123062d0d1a3c","observation_id":"065ad2b4-b807-45b1-8c15-3fdb8eddb8c1","resolution":{"observed_at":"2026-08-12T04:55:59.473018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.477471Z","title":"Rescaling egocentric vision: collection, pipeline and chal- lenges for epic-kitchens-100","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.477471Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:3ecb74f7b2133dc6857e7dddae8ab03f54106d3811ccc04e7cc3bb87f0d70970","observation_id":"4ac30229-5b29-4828-b673-33e479576cbd","resolution":{"observed_at":"2026-08-12T04:55:59.477471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.481221Z","title":"3d affordancenet: A benchmark for visual object affordance understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.481221Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:c1f07209c5c718bf46c5725b3089d0fa44bee2bd494ff907387265d48d810eb9","observation_id":"ceac0663-40ab-4778-b4be-0bc8c98e4ea9","resolution":{"observed_at":"2026-08-12T04:55:59.481221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.485891Z","title":"Cg-hoi: Contact-guided 3d human-object interaction generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.485891Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:6ce982b28546e64ab9af7ebdb8dfb86fabda51289e0d1ebc85a0b53356a24d6d","observation_id":"6dcfee24-9873-4266-ae4a-81bc264f9f9d","resolution":{"observed_at":"2026-08-12T04:55:59.485891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T04:55:59.489732Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.489732Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:025a41dc399088d07e77fd05242691dd92ad452c92bf37b2c6e441a5f034da93","observation_id":"265f3001-992f-4a17-ba35-d57b79014bc1","resolution":{"observed_at":"2026-08-12T04:55:59.489732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.494237Z","title":"Simultaneous local- ization and mapping: part i","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.494237Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:2321975800ef5fcdd1324cdc9226571182234301c3bb65096a84c7916cc0c959","observation_id":"96efb0e0-9d9a-46de-89a9-b2aff306908b","resolution":{"observed_at":"2026-08-12T04:55:59.494237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.497741Z","title":"Flow graph to video grounding for weakly-supervised multi-step localization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.497741Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:523dbe83faa73d8b1c577d5aaf33160617bd5159114a2cccbdf9397c3e4519e1","observation_id":"32520ba7-dcf5-46d1-b2d5-95079b5c9a9c","resolution":{"observed_at":"2026-08-12T04:55:59.497741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.501481Z","title":"Tokenhmr: Advancing human mesh re- 9 covery with a tokenized pose representation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.501481Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:569ac9f41acc91efffb25e88e6d1b6bd4568f6682026f151c5d4f75aee30ad2a","observation_id":"2dc1a19b-e9a0-4a68-8f4c-96490736776f","resolution":{"observed_at":"2026-08-12T04:55:59.501481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13561","last_updated":"2023-10-01T20:16:22Z","snapshot_observed_at":"2026-08-13T14:52:21.014234Z","submitted_at":"2023-08-24T20:42:21Z","title":"Project Aria: A New Tool for Egocentric Multi-Modal AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13561","snapshot_observed_at":"2026-08-12T04:55:59.505259Z","title":"Project aria: A new tool for egocentric multi-modal ai research","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.505259Z"},"links":{"cited_paper":"/paper/2308.13561","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:e276336658281bf67bd68df6de42c1abd95ac5206db96166fb1a67c46b22cd25","observation_id":"85643271-4cea-4c54-9799-21e1a05540db","resolution":{"observed_at":"2026-08-12T04:55:59.505259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.509543Z","title":"A density-based algorithm for discovering clusters in large spatial databases with noise","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.509543Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:cd4b4a37261df4e4c71a08ee498e0e3b999284c686de518fd1e487bbddc05950","observation_id":"2299be9d-93e7-4fdd-90b7-400eaaf71e2c","resolution":{"observed_at":"2026-08-12T04:55:59.509543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.513886Z","title":"Slowfast networks for video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.513886Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:5a4508c1d50315b1cf0cde027208e6974c93f7291b62746cae293098eec3479f","observation_id":"9650bfbe-83f2-4201-9ec7-c30b3fd4ba0c","resolution":{"observed_at":"2026-08-12T04:55:59.513886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.517545Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.517545Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:cf51d81435d082c120fd67e3a097dcf514cb12c43c83f388db9935a1c46fbbdb","observation_id":"2ca6f636-f66d-4bf6-ae28-7b0be065eb78","resolution":{"observed_at":"2026-08-12T04:55:59.517545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.521528Z","title":"Rolling- unrolling lstms for action anticipation from first-person video","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.521528Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:5ed894551782aba6638ba98ffcdb712ec2274832b0fa6719ee0ac12cca92ab9c","observation_id":"3f76046c-4380-4c1c-9f2c-70af36c75545","resolution":{"observed_at":"2026-08-12T04:55:59.521528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.526581Z","title":"Next-active-object predic- tion from egocentric videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.526581Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:7d0acb138b7da7b3c10611d134c3243c71d19722700d4d1cc17e87efe56a127f","observation_id":"a70b580e-32ca-4e3e-beba-618376031e57","resolution":{"observed_at":"2026-08-12T04:55:59.526581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.04818","last_updated":"2017-07-16T04:23:57Z","snapshot_observed_at":"2026-08-14T20:47:26.130170Z","submitted_at":"2017-07-16T04:23:57Z","title":"RED: Reinforced Encoder-Decoder Networks for Action Anticipation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.04818","snapshot_observed_at":"2026-08-12T04:55:59.535082Z","title":"Red: Re- inforced encoder-decoder networks for action anticipation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.535082Z"},"links":{"cited_paper":"/paper/1707.04818","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:3c5b7cbf13cec4f0540c289ae702a0e9312a41e38754b7b7b1f9cdf59abba1aa","observation_id":"01abb968-9e33-48bd-b23d-55d9f11abb22","resolution":{"observed_at":"2026-08-12T04:55:59.535082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.538490Z","title":"Anticipative video transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.538490Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:d364836ac275796f290cc8fa751da61026d0414c3fa8806b021cc714980b41c0","observation_id":"a6063b88-8054-4b1a-8174-13b6c88ae93a","resolution":{"observed_at":"2026-08-12T04:55:59.538490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.542273Z","title":"Omni- vore: A single model for many visual modalities","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.542273Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:1ee42a334162049ba8885cce60b0d1d437fffa462caace94ebb9384512cff261","observation_id":"004f3e4f-8e7e-4127-88d3-bf299f685a08","resolution":{"observed_at":"2026-08-12T04:55:59.542273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.545672Z","title":"Humans in 4d: Re- constructing and tracking humans with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.545672Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:dffb6e181831e247b7bcfb4f54deab46f18dcfe8267d540aee20446aa0c999f9","observation_id":"bf196040-dcb1-4cfb-af48-5c104814bb4f","resolution":{"observed_at":"2026-08-12T04:55:59.545672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.549484Z","title":"Con- tactopt: Optimizing contact to improve grasps","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.549484Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:afae7c751268e511204c612a5208a3acf85cbc3c4310d7e2ad3d1450b404bb79","observation_id":"47955e9a-7cf5-4cc3-8590-d870b02ffe80","resolution":{"observed_at":"2026-08-12T04:55:59.549484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.553880Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.553880Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:3c74f4602c1e83fd067bef10fdbdfb8d945ef81339efa4aad82f12e5d6607cfb","observation_id":"cbe0b724-33af-4318-b876-7ed2bbe59832","resolution":{"observed_at":"2026-08-12T04:55:59.553880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.558067Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.558067Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:65651eab703002a982446924641ac14edcfc08fc1878e131c6b02f3a91284b11","observation_id":"818be1cb-7ff7-494a-9c1b-967c34453325","resolution":{"observed_at":"2026-08-12T04:55:59.558067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.562199Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.562199Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:b80eae8915d7fe7ee8eaa4dbe205fbfed56f2d5efbb3b62a03f3c820dacb6662","observation_id":"649f042e-568f-453c-9609-b41fc3830ebc","resolution":{"observed_at":"2026-08-12T04:55:59.562199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.566700Z","title":"Resolving 3d human pose ambiguities with 3d scene constraints","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.566700Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:d892b71044dc73b9caccdb2ed3cce4b08ab35b154d4d4b8b1e6656053c32f9c9","observation_id":"896641e9-732a-4cae-a3d5-7b1c5182b8a1","resolution":{"observed_at":"2026-08-12T04:55:59.566700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.571042Z","title":"Stochas- tic scene-aware motion prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.571042Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:05d32e9f01955472ab2cc601630ed5d4917e7308352101abb86f22a377fdc2a5","observation_id":"ed044fe1-a82f-448f-b79b-0247bdcd712b","resolution":{"observed_at":"2026-08-12T04:55:59.571042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.575363Z","title":"Synthesizing phys- ical character-scene interactions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.575363Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:8641cadfa5ce9e52896a7786a00bdbc3094bfb080ea50c4f7bc9eb64864de32d","observation_id":"14dd2e39-6a5c-4c28-a458-dc4e16fee3a4","resolution":{"observed_at":"2026-08-12T04:55:59.575363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04436","last_updated":"2024-03-07T12:10:41Z","snapshot_observed_at":"2026-08-13T04:00:51.099269Z","submitted_at":"2024-03-07T12:10:41Z","title":"Learning Human-to-Humanoid Real-Time Whole-Body Teleoperation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04436","snapshot_observed_at":"2026-08-12T04:55:59.579824Z","title":"Learning human- to-humanoid real-time whole-body teleoperation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.579824Z"},"links":{"cited_paper":"/paper/2403.04436","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:cd5c73d0aee3bf1536740e4f7324f134558f51fd1a95d408f9efa1dfa6dc4e3d","observation_id":"ccdee9e4-0959-4787-b098-6152f839eea3","resolution":{"observed_at":"2026-08-12T04:55:59.579824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.584042Z","title":"Diffusion- based generation, optimization, and planning in 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.584042Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:e6486e47f9afcfab3c465ddd223b916f23f2e536a76dd08804d30b1a61b43b2b","observation_id":"90595afb-d08a-4055-9a06-4a6c2fe5c670","resolution":{"observed_at":"2026-08-12T04:55:59.584042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.587680Z","title":"Human3.6m: Large scale datasets and pre- dictive methods for 3d human sensing in natural environ- ments","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.587680Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:4252d94dae93d55e2ba009cbc680edab642731f2188db0b007745253069879ad","observation_id":"7ce5930b-6c19-4f41-ad7e-6a8ee7bda2da","resolution":{"observed_at":"2026-08-12T04:55:59.587680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.591402Z","title":"Hand-object contact consistency reasoning for hu- man grasps generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.591402Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:93309405ae8bd12ebc8e2c9f8f042fc47e37b4f98b139c8c2242bef46c37abc5","observation_id":"9f203ce7-0efa-4553-b54a-9303e78e8174","resolution":{"observed_at":"2026-08-12T04:55:59.591402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.595135Z","title":"Sym- phonize 3d semantic scene completion with contextual in- stance queries, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.595135Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:b5abf0e0ce732dd3807a5c8e2f073907d03dc415771b46e07d5b4e49b87005a5","observation_id":"f0a1d69a-e07a-47c5-8728-ec5dedaf5cb7","resolution":{"observed_at":"2026-08-12T04:55:59.595135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.09579","last_updated":"2017-06-30T13:01:52Z","snapshot_observed_at":"2026-08-14T20:50:54.430766Z","submitted_at":"2017-06-29T05:00:38Z","title":"R2CNN: Rotational Region CNN for Orientation Robust Scene Text Detection","version":2},"cited_work":{"arxiv_id":"1706.09579","doi":null,"metadata_source":"pith","pith_arxiv_id":"1706.09579","snapshot_observed_at":"2026-08-12T04:56:00.177012Z","title":"R2CNN: Rotational Region CNN for Orientation Robust Scene Text Detection","venue":"cs.CV","work_id":"44acee94-e7e8-422f-a906-36d736117b7c","year":2017},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.598689Z"},"links":{"cited_paper":"/paper/1706.09579","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:869e8c4760f2e1cfc79d3b06872230c08e3c9adb428685e067f2fec4b2c68c73","observation_id":"07767f29-b574-4145-aaba-ea6861a5e29d","resolution":{"observed_at":"2026-08-12T04:56:00.181188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.602804Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.602804Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:161a095f8912afc083ffbf6036e082394315bb9bb70793a66e1b0535ca90c870","observation_id":"e35a7de4-ea32-4cb1-9a81-21fade0c5aa1","resolution":{"observed_at":"2026-08-12T04:55:59.602804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.964335Z","title":"Interactive object segmentation in 3d point clouds","venue":null,"work_id":"2b995604-1150-4f35-9f1d-0ecbbf616e25","year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.606482Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:bdea961568c5f6ee577e7eea12458cfe59722e65c17c71fda917567ed6c1988f","observation_id":"b05ffc6d-7d7f-4961-9cd1-1a35dc569ff4","resolution":{"observed_at":"2026-08-12T04:56:00.969264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.952193Z","title":"A hi- erarchical representation for future action prediction","venue":null,"work_id":"3f1779bc-aa1c-44d0-903d-591b501884a2","year":2014},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.609535Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:8895359b796e0077f00ef785670f877b908459ac2280b8d6a180bb1c0dfbed36","observation_id":"63eef815-7046-4c14-94d7-2ce13dd3dd57","resolution":{"observed_at":"2026-08-12T04:56:00.956226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00890","last_updated":"2023-06-01T16:50:07Z","snapshot_observed_at":"2026-08-09T05:23:28.778360Z","submitted_at":"2023-06-01T16:50:07Z","title":"LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00890","snapshot_observed_at":"2026-08-12T04:55:59.612463Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.612463Z"},"links":{"cited_paper":"/paper/2306.00890","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:b467dcecb25784402344d68538be27748c099ac5a51c99ffc42b92c20007d405","observation_id":"2d32b3ba-df97-467e-927c-13a462eb3b29","resolution":{"observed_at":"2026-08-12T04:55:59.612463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.09450","last_updated":"2023-05-31T09:19:23Z","snapshot_observed_at":"2026-08-13T16:54:26.879994Z","submitted_at":"2022-01-24T04:39:39Z","title":"UniFormer: Unifying Convolution and Self-attention for Visual Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.09450","snapshot_observed_at":"2026-08-12T04:55:59.615541Z","title":"Uniformer: Unifying convolution and self-attention for visual recogni- tion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.615541Z"},"links":{"cited_paper":"/paper/2201.09450","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:0b6cd5223d27a31c599f09a87a0f10f09e52e5eee151b51f3cb1ecd17f120a86","observation_id":"1e9820cb-45c1-4420-a34d-f00c8bad3a4b","resolution":{"observed_at":"2026-08-12T04:55:59.615541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.938631Z","title":"Mvitv2: Improved multiscale vision transform- ers for classification and detection","venue":null,"work_id":"2def1459-46ef-49ac-b29e-f02e3cbfa4b6","year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.618770Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:854f59e5a537843a73b5771d6bcef42c7ce284dca5ee58e37985bbc2ed0bf03c","observation_id":"c0cb4845-502b-4372-a53e-19f406dbed80","resolution":{"observed_at":"2026-08-12T04:56:00.943815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.925336Z","title":"Alvarez, Sanja Fidler, Chen Feng, and Anima Anandkumar","venue":null,"work_id":"e5a5f812-344c-449f-821f-d57b0415688b","year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.622214Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:7a6cf718840e804097c152f7eab801b57ec994ce620118ed80deed83019381b5","observation_id":"a0c3ed5b-aad4-414a-99b3-572528567b07","resolution":{"observed_at":"2026-08-12T04:56:00.930511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.911563Z","title":"Egocen- tric video-language pretraining","venue":null,"work_id":"7a3fc06c-75ca-489f-b458-e5bddd478f18","year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.625968Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:18859119555ce60afb5761f8242b1f205e41c903a302ab40699496e01d68dd3e","observation_id":"0fb9c6e7-6b18-4534-be8f-4499916cc2e4","resolution":{"observed_at":"2026-08-12T04:56:00.915968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.629458Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.629458Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:ee48039719ce752f243265bea90103a92d3c97903738c5c37468246f65eae30d","observation_id":"3c376914-a25f-4b3a-835a-282c30660cd0","resolution":{"observed_at":"2026-08-12T04:55:59.629458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.889270Z","title":"Learn- ing to recognize procedural activities with distant supervi- sion","venue":null,"work_id":"d8481794-9bfc-43be-9fd3-2b2e2762e9ce","year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.633145Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:0de524031e5c533afb0eb469ff540c57ea199b59a5ce59baf7fb0e59f20f55ad","observation_id":"d1798fd1-2fc4-40ee-bb42-e11d60d02a8e","resolution":{"observed_at":"2026-08-12T04:56:00.893705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.877707Z","title":"Deep patch visual slam","venue":null,"work_id":"46aaed5e-e333-41a3-805e-b0b633a07fef","year":2025},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.637095Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:45915b9315b303155050664821bb8f4ebec421e7d55f50d6eaea80aa4da375c6","observation_id":"04161796-2915-456a-aabf-ab8359d75e6d","resolution":{"observed_at":"2026-08-12T04:56:00.881706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-12T04:55:59.641299Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.641299Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:6d7fb2eb6709d4f87eaad58bfe23a576d95b05a7c11443364304c915291484f0","observation_id":"87fed159-0559-4ad8-8d4b-9908c2664220","resolution":{"observed_at":"2026-08-12T04:55:59.641299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.866691Z","title":"Fore- casting human-object interaction: joint prediction of motor attention and actions in first person video","venue":null,"work_id":"bf76a08d-478d-4055-bbe2-8e1d6196b7c1","year":2020},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.645564Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:96e9157ca017e4a39819cc2470def1f70c58d98d9def22fa4b0f4dd8c2ccff32","observation_id":"cf3b1fc8-af49-4d67-9408-ca464e6ada64","resolution":{"observed_at":"2026-08-12T04:56:00.870748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.855431Z","title":"Joint hand motion and interaction hotspots prediction from egocentric videos","venue":null,"work_id":"50bae926-624a-42e6-be69-0395c75a6e67","year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.649079Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:4a3ce3f55cd6a842070f1268a36dedcc747c4436c6126919ea67bb977d8ddaea","observation_id":"8c1cdd44-0956-481e-82dd-e18914533a92","resolution":{"observed_at":"2026-08-12T04:56:00.859489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.844247Z","title":"Joint hand motion and interaction hotspots prediction from egocentric videos","venue":null,"work_id":"924f56cf-5b78-4cea-9f08-706fb6624d07","year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.652471Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:40091b2d39a8772e90ff2a80a0a41877182701218488934237b6763723721c09","observation_id":"bf640659-1a84-4232-b088-3e464f2819e8","resolution":{"observed_at":"2026-08-12T04:56:00.847867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.833450Z","title":null,"venue":null,"work_id":"cd248f4b-af8d-46e2-8704-e75719f0dbbc","year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.655916Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:29a63f7b2f5ac826f8dd32ac48fa4c6b85e99f09cd74d14016b798b9c625d36d","observation_id":"2860e921-7892-4b06-9a23-8b62fe354f34","resolution":{"observed_at":"2026-08-12T04:56:00.837304Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.822491Z","title":"Multimodal sense-informed forecasting of 3d human motions","venue":null,"work_id":"70d9b7ee-c690-4eb4-9949-ce6e31bb8e75","year":2024},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.659781Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:15caaf31a3f7f79316f87bbee391dcbb5d4b6677b36324531cf55481b444625e","observation_id":"9cbe04d5-4a68-4396-b4fd-0ad035ca3fb5","resolution":{"observed_at":"2026-08-12T04:56:00.826379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.810913Z","title":"Amass: Archive of motion capture as surface shapes","venue":null,"work_id":"17ce6295-bbbf-4bdb-93f0-be3f81e965b2","year":2019},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.663603Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:f76fcfe1732a273de56c1660c71f0e00202763fb49ff942ef41cf9cf70a3edee","observation_id":"5b87f850-56d8-4358-958d-e7f36ea74cf0","resolution":{"observed_at":"2026-08-12T04:56:00.814816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.799266Z","title":"Contact-aware human motion forecasting","venue":null,"work_id":"d5206ede-2243-44b7-8ab6-9785d254c9ed","year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.667609Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:c9ec1dad1be7b518275d8445d14225d5cbe0795bbe64e97d08ad5ab842515221","observation_id":"fee3d281-a9ba-4e46-96fd-245e975f7d4c","resolution":{"observed_at":"2026-08-12T04:56:00.803216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.787035Z","title":"On human motion prediction using recurrent neural networks","venue":null,"work_id":"9b3592a1-2114-422b-9171-ab5436f683ca","year":2017},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.671250Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:b8955c3e37e489057fd85e2cc8e6e09b9b0ba094b96e61e4db222e7b01c5b9c5","observation_id":"f8dfe2d4-90ed-4baf-b6a4-7b73c28a4120","resolution":{"observed_at":"2026-08-12T04:56:00.791592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12080","last_updated":"2024-04-08T15:50:13Z","snapshot_observed_at":"2026-08-13T14:57:46.027491Z","submitted_at":"2022-07-25T11:57:01Z","title":"Intention-Conditioned Long-Term Human Egocentric Action Forecasting","version":4},"cited_work":{"arxiv_id":"2207.12080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.12080","snapshot_observed_at":"2026-08-12T04:56:00.129396Z","title":"Intention-Conditioned Long-Term Human Egocentric Action Forecasting","venue":"cs.CV","work_id":"08e0f316-f8a4-45f9-a7ca-d09e8f443986","year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.675387Z"},"links":{"cited_paper":"/paper/2207.12080","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:2ca463f63d68aff39a52fce586edaa09de764f74fe316e8150b62086c86eb486","observation_id":"00f2291d-45aa-49fe-9888-a8acafb95bfb","resolution":{"observed_at":"2026-08-12T04:56:00.133452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.774839Z","title":"Howto100m: Learning a text-video embedding by watch- ing hundred million narrated video clips","venue":null,"work_id":"d6257583-f86d-4ac6-a8a7-3f27757dbce2","year":2019},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.679252Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:8f6e819659894a91aa8198aa82aa498e8fb7f4ad2c161ecb6ecbd5c43e46e577","observation_id":"4986b394-7980-4259-8baa-bb8b72142364","resolution":{"observed_at":"2026-08-12T04:56:00.778937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.762669Z","title":"End-to-end learning of visual representations from uncurated instruc- tional videos","venue":null,"work_id":"63a83053-ae21-409d-b0c2-4dd64e1aa703","year":2020},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.682922Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:0f700e868be39d41d82c9183f665276303b2da6886c9f2ed2be9791a7a521115","observation_id":"75393f18-c82b-49eb-aa56-cd909c9a897f","resolution":{"observed_at":"2026-08-12T04:56:00.767520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.749524Z","title":"Nerf: Representing scenes as neural radiance fields for view syn- 11 thesis","venue":null,"work_id":"53f3337d-0001-49e4-8ce4-7f4f74594f9f","year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.686550Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:f0da658539a05fb5d0031ba7b7f35bb7549353266289b4e7c32dcbc9ec750614","observation_id":"877213ac-c196-423a-8cb6-5e895cf645af","resolution":{"observed_at":"2026-08-12T04:56:00.753669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.736928Z","title":"Graspit! a versatile simulator for robotic grasping","venue":null,"work_id":"a94c16cf-8adf-4c8a-9167-281af521433a","year":2004},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.690285Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:7d5ba4baf33f9c4d221266fa4d023f7e8287c56a1eb834d5a26a3d8a33576e75","observation_id":"9ec69155-3b27-4297-94da-1192e797f937","resolution":{"observed_at":"2026-08-12T04:56:00.741183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.724911Z","title":"Where2act: From pixels to actions for articulated 3d objects","venue":null,"work_id":"e5f7723b-147c-4ca7-9830-f9b1fd228a44","year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.694406Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:e701c19b22c01b4e8fe14a21cd1f34c2dd0ffe4c4d374357f534301a68b20d91","observation_id":"44846b5c-4c04-4323-b8fe-dcdc281ff0bb","resolution":{"observed_at":"2026-08-12T04:56:00.729177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.697773Z","title":"Orb-slam: a versatile and accurate monocular slam system","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.697773Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:4c274df13636849b45b3d5a78430a1321439e910d614bc611d53e96b68e97708","observation_id":"0b75ac41-22cb-45bc-9a2f-9a0068bcdd1a","resolution":{"observed_at":"2026-08-12T04:55:59.697773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.706283Z","title":"Multi-label affordance mapping from egocentric vision","venue":null,"work_id":"bbec3780-80bf-4f51-b59f-e2d8fc2aa253","year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.704470Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:f58e2778e4b2be01b6dd401e29cb26a579097fd21635812b29974030e37469d9","observation_id":"c7b528b3-e084-4f00-a9ea-934d83e910ef","resolution":{"observed_at":"2026-08-12T04:56:00.710600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01194","last_updated":"2024-06-05T15:34:47Z","snapshot_observed_at":"2026-08-15T13:54:37.831829Z","submitted_at":"2024-06-03T10:57:18Z","title":"AFF-ttention! Affordances and Attention models for Short-Term Object Interaction Anticipation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01194","snapshot_observed_at":"2026-08-12T04:55:59.707512Z","title":"Aff-ttention! affordances and attention models for short- term object interaction anticipation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.707512Z"},"links":{"cited_paper":"/paper/2406.01194","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:1db8c6601c7a2a991334d2dac9cc6433f42363c69e8a097bc4963fcc78ac93f5","observation_id":"e41b3955-af65-441b-aa9e-703b140f0ec7","resolution":{"observed_at":"2026-08-12T04:55:59.707512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.693125Z","title":"Nagarajan and K","venue":null,"work_id":"d2f3b8bc-7db3-4a70-aec6-c76506bf8e98","year":2020},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.710676Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:9f0e37d0ec5659dbfd46772c8d29200ec4df5c55cc9926571f3b4eb88c399f53","observation_id":"0d4db6a3-d95d-45a6-bebc-b9feb5891460","resolution":{"observed_at":"2026-08-12T04:56:00.697433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.681588Z","title":"Grounded human-object interaction hotspots from video","venue":null,"work_id":"4d4f1e66-f89a-47d0-835f-b04df3569686","year":2019},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.713776Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:15837fdd78c1e589f6a275d9e313260c92895b2430744b56976239d56f75897b","observation_id":"7be45799-0727-413b-8734-fb27ef1dad26","resolution":{"observed_at":"2026-08-12T04:56:00.685731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.669831Z","title":"Future event prediction: If and when","venue":null,"work_id":"db646957-7189-4fb3-b7b6-27996788a0e5","year":2019},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.717287Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:be8e7f55b684ba99947dda088338041ef90c0e1bccd6273dd889defc2c1e6b3f","observation_id":"26792741-cff7-4591-b15b-46d282ad7b76","resolution":{"observed_at":"2026-08-12T04:56:00.674007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1501.03100","last_updated":"2015-04-29T02:22:38Z","snapshot_observed_at":"2026-08-14T23:04:13.264683Z","submitted_at":"2015-01-13T18:40:11Z","title":"Using Geometry to Detect Grasps in 3D Point Clouds","version":3},"cited_work":{"arxiv_id":"1501.03100","doi":null,"metadata_source":"pith","pith_arxiv_id":"1501.03100","snapshot_observed_at":"2026-08-12T04:56:00.103323Z","title":"Using Geometry to Detect Grasps in 3D Point Clouds","venue":"cs.RO","work_id":"72692ace-fc32-4516-a75f-a71dcc262864","year":2015},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.837998Z"},"links":{"cited_paper":"/paper/1501.03100","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:3a62f9cc9658c9048e02921ab133c47ce0dfb1fbcf968470c18dc2928048120b","observation_id":"2472ca63-6afd-48f3-bcc4-77ef094f42c3","resolution":{"observed_at":"2026-08-12T04:56:00.107862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.842388Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.842388Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:3e8a3206dcbe36a4271b19e7937e0f0885d9083743143592dd24287e1a5a3bd1","observation_id":"1306d568-892c-4691-b533-161300a63894","resolution":{"observed_at":"2026-08-12T04:55:59.842388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.651613Z","title":"Egovlpv2: Egocentric video-language pre-training with fusion in the backbone","venue":null,"work_id":"0e0dac2f-c0ca-47fa-bd37-21950aa69152","year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.846244Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:9f354ba62aac8dbca2fea533f3ced3897b6242ec7e84587b60f976b41a07273e","observation_id":"7414532d-4fee-4cef-96e3-b58cb3017e6d","resolution":{"observed_at":"2026-08-12T04:56:00.655407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13724","last_updated":"2023-10-19T17:29:17Z","snapshot_observed_at":"2026-08-15T10:54:03.146672Z","submitted_at":"2023-10-19T17:29:17Z","title":"Habitat 3.0: A Co-Habitat for Humans, Avatars and Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13724","snapshot_observed_at":"2026-08-12T04:55:59.850055Z","title":"Habitat 3.0: A co-habitat for humans, avatars and robots","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.850055Z"},"links":{"cited_paper":"/paper/2310.13724","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:86582af900bf5f0c3ef7cf991839ab31f47609dd2f3e78ee7901a2507b371b1e","observation_id":"4e6dd8f6-41fa-4a1d-add9-743bed487856","resolution":{"observed_at":"2026-08-12T04:55:59.850055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.640593Z","title":"Vins-mono: A ro- bust and versatile monocular visual-inertial state estimator","venue":null,"work_id":"90da757d-733e-4c63-846c-6676f4f54c77","year":2018},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.853864Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:2a033c58bdbfd1fdb9d8a760c5f8fbfb6704bc8ba733981d68d37e90cb3d9464","observation_id":"ad74e877-1478-4938-bc7f-c3f14648910b","resolution":{"observed_at":"2026-08-12T04:56:00.644501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.628070Z","title":"State-only imitation learning for dexterous manipulation","venue":null,"work_id":"ba2e4114-3050-493b-a895-d20e44dc013d","year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.856756Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:bfd0f25ac8cee2e456888a57eb67f1dc271422366f049285be20b1e82ba70e56","observation_id":"a9b6bcdf-c44d-42a6-ba3e-1230e330fa99","resolution":{"observed_at":"2026-08-12T04:56:00.632033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.616878Z","title":"Poni: Potential functions for objectgoal navigation with interaction-free learning","venue":null,"work_id":"33df3d61-2dc2-4581-a111-20e6b8ec35e5","year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.860281Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:66c1ab82af1061d024c46025766ff418ceacfcd17fe01b4a6055252dfe98847b","observation_id":"4e0c5a99-7e26-42ad-8eb6-e26325e83235","resolution":{"observed_at":"2026-08-12T04:56:00.620790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.605285Z","title":"Humor: 3d human motion model for robust pose estimation","venue":null,"work_id":"2746d1a5-d523-4ac9-9be1-c2c125250d76","year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.863253Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:66f8b0e457f764dfd351c23c8bf430f04e3aa277b9d0cd03df1bf8cf8db1181d","observation_id":"9c418893-8def-4287-aae8-0409267c61d5","resolution":{"observed_at":"2026-08-12T04:56:00.609620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.594081Z","title":"First-person activity forecasting with online inverse reinforcement learning","venue":null,"work_id":"063a9ccb-2ebf-48cb-bade-8ad380d38034","year":2017},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.866660Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:6eb5bfdb924c422a8e2a5a888c35302974b61c45012f3288722b93a7f17f96c0","observation_id":"ffafcde5-3f30-4535-9a77-390b2dcf1093","resolution":{"observed_at":"2026-08-12T04:56:00.598098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.582636Z","title":"Structure-from-motion revisited","venue":null,"work_id":"01a68356-bc49-4cf1-b3de-477829291841","year":2016},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.869991Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:61ab6693b6d0cbb3b8725f89e7b0583ae8b0f6e81910452790e8adc0728953d4","observation_id":"34224ca4-994f-4a09-88e9-2cc83b93bf22","resolution":{"observed_at":"2026-08-12T04:56:00.586404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.571186Z","title":"Wham: Reconstructing world-grounded humans with accurate 3d motion","venue":null,"work_id":"f48b93fe-23eb-40b3-ac94-ed5e6edd6f64","year":2024},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.874484Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:d5720e9e4f8a9951aaf841056516ffd4b3d75e10a40402497638ad6f2bcd4617","observation_id":"32b5e6bd-0ae5-450e-8e3d-e2d922e48ff1","resolution":{"observed_at":"2026-08-12T04:56:00.575160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.559570Z","title":"Learn- ing structured output representation using deep conditional generative models","venue":null,"work_id":"60e03570-3771-44ec-903c-957544d0f688","year":2015},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.878602Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:603b6e8cec15ccfa00e5a37a9ff14b977317ed96c1382af757a2e7e63a5647b0","observation_id":"9f894892-d0c4-42d8-b1fd-2c988dcaadc4","resolution":{"observed_at":"2026-08-12T04:56:00.563868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.547400Z","title":"Generating notifications for missing actions: Don’t forget to turn the lights off! In Proceedings of the IEEE International Con- ference on Computer Vision, pages 4669–4677, 2015","venue":null,"work_id":"b1152fff-5127-4dec-9d55-b3af8d3e2450","year":2015},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.882948Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:52ac872d3f6b332fcdbe580fca08bf9386608d6f6e4e44eb339cd81e4ceb199d","observation_id":"38969f8c-5b29-4748-a4f8-5b10810fdf06","resolution":{"observed_at":"2026-08-12T04:56:00.552001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.533580Z","title":"Segcloud: Semantic segmen- tation of 3d point clouds","venue":null,"work_id":"ea0792ac-0f1e-4591-ad4c-7f97bb204a78","year":2017},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.886883Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:c698579ca623ee1502b1753b6655dcaf66104dd246f97113b89c149a1876c843","observation_id":"38789a9a-c1e2-41a3-ad9e-ddbac541ddd3","resolution":{"observed_at":"2026-08-12T04:56:00.537792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:55:59.891500Z","title":"Droid-slam: Deep visual slam for monocular, stereo, and rgb-d cameras","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.891500Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:684cf5a73dacaea0558fee533553fd802076c3de4842b74f5975c014352a4d3d","observation_id":"22414549-19af-4e40-96c5-263c29df85cb","resolution":{"observed_at":"2026-08-12T04:55:59.891500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.514177Z","title":"EPIC Fields: Marrying 3D Geometry and Video Understanding","venue":null,"work_id":"cac70f27-e17e-4519-bc1f-84c463a2994c","year":2023},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.895419Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:1a57557a0f1e4145419f5addc32ad9efc1487e1ce0a26dfeeb8d0da68064ebda","observation_id":"5e2e33b1-5232-4ec4-8eb3-dbeb01c899f7","resolution":{"observed_at":"2026-08-12T04:56:00.518624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.08435","last_updated":"2023-02-06T14:49:05Z","snapshot_observed_at":"2026-08-14T21:19:01.251343Z","submitted_at":"2017-01-29T21:39:05Z","title":"Transformation-Based Models of Video Sequences","version":3},"cited_work":{"arxiv_id":"1701.08435","doi":null,"metadata_source":"pith","pith_arxiv_id":"1701.08435","snapshot_observed_at":"2026-08-12T04:56:00.073950Z","title":"Transformation-Based Models of Video Sequences","venue":"cs.LG","work_id":"402eb7ac-f990-4bf5-b322-d74c38a11951","year":2017},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.899330Z"},"links":{"cited_paper":"/paper/1701.08435","citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:72a791ab282b471b962481867545172050e389777df38ebf91bdeb05d665f343","observation_id":"5667d731-4af4-4431-9556-0195e76ddcf1","resolution":{"observed_at":"2026-08-12T04:56:00.080431Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.501793Z","title":null,"venue":null,"work_id":"e0c40177-06ae-4567-b201-29da50b3793a","year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.903006Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:f92deed11d33fd9923d34fab3fc85f09aee380307a0126858bc30343f6b3c82d","observation_id":"2ee9e01c-18a7-4644-8c0d-a8e20bfbfad9","resolution":{"observed_at":"2026-08-12T04:56:00.506311Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.489328Z","title":"Synthesizing long-term 3d human mo- tion and interaction in 3d scenes","venue":null,"work_id":"416ac475-d2b4-45ee-b703-c49a2806e577","year":2021},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.907142Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:8b9b40c9bbf24a2248c406e0ac6a041b6c408f3978fe758df4cb8b7838685290","observation_id":"cedbaa9f-ae03-4c41-802e-89cd7425b035","resolution":{"observed_at":"2026-08-12T04:56:00.493415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.476001Z","title":"Adaafford: Learn- ing to adapt manipulation affordance for 3d articulated ob- jects via few-shot interactions","venue":null,"work_id":"20a83356-4555-4863-8f71-771d758eb207","year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.910653Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:34fb4b20390c905cb0b1f12bb3e12def8965f9802db0f634fdea9a42490acb38","observation_id":"3d6d5e86-d9da-4c0d-8d7a-3552690f5732","resolution":{"observed_at":"2026-08-12T04:56:00.480249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:56:00.462578Z","title":"Memvit: Memory-augmented multiscale vision transformer for efficient long-term video recognition","venue":null,"work_id":"e5f93654-6ed8-4b4e-a328-7578888d1874","year":2022},"citing_paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-12T04:55:59.914437Z"},"links":{"citing_paper":"/paper/2412.00932"},"observation_digest":"sha256:4469db9b6181ca6b38d18cbe4cde09f2c042ccf544ea317a48cf76d88581948c","observation_id":"9747d2c8-d121-46a7-865e-8ccc3c9072c6","resolution":{"observed_at":"2026-08-12T04:56:00.467780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00932","last_updated":"2025-04-11T20:21:03Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T17:06:56.570483Z","submitted_at":"2024-12-01T18:44:17Z","title":"FIction: 4D Future Interaction Prediction from Video"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":4,"verified_fuzzy":38},"total_outbound_references":119},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 100 of 119 outbound references and 0 inbound Pith citation observations for arXiv:2412.00932."}