{"as_of":"2026-08-18T01:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:163fa796565d84411f4ef2c0cefee6fe05fed75eae769770bb5ac8ddfe1d8d37","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:26:46.275801Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T13:15:57.832559Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T05:27:40.053520Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"cited_work":{"arxiv_id":"2508.12349","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12349","snapshot_observed_at":"2026-07-03T05:27:40.053520Z","title":null,"venue":null,"work_id":"74d97ce3-d892-4910-97db-66a553811b5c","year":2025},"citing_paper":{"arxiv_id":"2606.10743","last_updated":"2026-06-09T11:53:29Z","snapshot_observed_at":"2026-08-03T12:18:51.370506Z","submitted_at":"2026-06-09T11:53:29Z","title":"Hand-centric Human-to-Robot Trajectory Transfer from Video Demonstrations via Open-World Contact Localization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T13:15:57.832559Z"},"links":{"cited_paper":"/paper/2508.12349","citing_paper":"/paper/2606.10743"},"observation_digest":"sha256:fc39f2808bf9dad5a3f2e20815901bef29da922ca172e41a1a9721aa0683432b","observation_id":"87ec612f-6da8-423a-8a91-272550ce748d","resolution":{"observed_at":"2026-07-03T05:27:40.054754Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.12349/citation-record","integrity":"/paper/2508.12349/integrity","json":"/paper/2508.12349/citation-record.json","paper":"/paper/2508.12349"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:45.724643Z","title":"The evolution of first person vision methods: A survey,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.724643Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:0294a74220e68b7d41955d42c82867f9687299e37b471813bc25120a6e65d50c","observation_id":"0ddef51b-d9a1-4bf7-b5c6-744f33c0fb77","resolution":{"observed_at":"2026-08-15T17:26:45.724643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:45.731247Z","title":"An outlook into the future of egocentric vision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.731247Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:3c3f267ad18e74ab3c4d280d43258340c816f3151e60d4f80d6549bb108b96a6","observation_id":"8be6dd7b-ca3a-4f51-81b5-1507241e0f7f","resolution":{"observed_at":"2026-08-15T17:26:45.731247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:45.738039Z","title":"Analysis of the hands in egocentric vision: A survey,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.738039Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:6c1a7dab3d272453884f0057ad3316b2a6f138548b0e274d6b1b1d2f523b916a","observation_id":"9d14f76c-19e9-4d51-9441-18154299d6a8","resolution":{"observed_at":"2026-08-15T17:26:45.738039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:45.744361Z","title":"Bigs: Bimanual category-agnostic interaction reconstruction from monocular videos via 3d gaussian splatting,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.744361Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:0e41e33ffce4fbf2c19e8609fb7593b549946361c2307a6fd858f2bde20b1f21","observation_id":"6d6edf90-d6f8-45e3-82fe-defb9091b9e5","resolution":{"observed_at":"2026-08-15T17:26:45.744361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:45.751807Z","title":"Easyhoi: Unleashing the power of large models for reconstructing hand-object interactions in the wild,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.751807Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:e631c581e663cdb9ee38cf9611f609cd9f4ef3c3b2f536c11129000d70345e85","observation_id":"4b53689e-8a2f-438f-88a1-b38b407ead27","resolution":{"observed_at":"2026-08-15T17:26:45.751807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:45.758489Z","title":"Diffusion-guided reconstruction of everyday hand-object interaction clips,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.758489Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:72d3f8aeff179f797c869bfec7b1344a008354bf98b0a483e39f20052655946d","observation_id":"cb1d15ff-4f7d-42e2-af9e-171a00a749cb","resolution":{"observed_at":"2026-08-15T17:26:45.758489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:45.765143Z","title":"Hoid- iffusion: Generating realistic 3d hand-object interaction data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.765143Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:e2b8412abc6b0612e7e615a25777727c55efe149055d92abf7d0c4926345b028","observation_id":"905290b1-baa3-4969-812d-335846a51b34","resolution":{"observed_at":"2026-08-15T17:26:45.765143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.522927Z","title":"Gears: Local geometry-aware hand-object interaction synthesis,","venue":null,"work_id":"b2c9a2b3-4ab3-4cea-8b73-14b90a59c7f8","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.774024Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:2d6a4d699d5e27f142b70a9fb6620f8d670a936f0dc8eff35b33132577dd586c","observation_id":"88e460b5-a7a8-4b1b-a14a-1d0e2630b153","resolution":{"observed_at":"2026-08-15T17:26:48.528897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.501928Z","title":"Reconstructing hands in 3d with transformers,","venue":null,"work_id":"7133b48b-b3b3-4161-b8ad-c2aeca32580f","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.779356Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:d9bc3aaff03d4827d754701627f6aee540355811c453373f1b96a214d4302bbe","observation_id":"bc1f8ba9-0d48-4748-b979-a94a785c4a43","resolution":{"observed_at":"2026-08-15T17:26:48.508148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.480872Z","title":"Consistent 3d hand reconstruction in video via self-supervised learning,","venue":null,"work_id":"0277abf8-253d-4eb6-800d-b61cd60b2c84","year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.785025Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:86ff4a4fa02d2c2172b9b1b3bccde889ea1a33f9e1b6fea479e1b4f8ca43d6de","observation_id":"d805cd3f-5019-44f9-8823-5e6937b99131","resolution":{"observed_at":"2026-08-15T17:26:48.486909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.459323Z","title":"Pyramid deep fusion network for two-hand reconstruction from rgb-d images,","venue":null,"work_id":"edf269b6-58ee-444b-890d-865fe6782008","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.791737Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:d014ef41bd93a8d29830e7a90d4f9ab311eeded864bc53d279346e7f7e7fa3c6","observation_id":"d78e4ad9-34c3-4aed-8d3f-ffc91a6dc859","resolution":{"observed_at":"2026-08-15T17:26:48.464965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.438507Z","title":"Hhmr: Holistic hand mesh recovery by enhancing the multimodal con- trollability of graph diffusion models,","venue":null,"work_id":"497b3491-e813-41a0-9c07-86a06f0c7e11","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.797886Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:c1d6d57f216fef5e269a5ad4d0c6913189c50f39a69554448a6e1c23f2fe6c8f","observation_id":"679da222-f85d-44b6-ba30-d5eed664f228","resolution":{"observed_at":"2026-08-15T17:26:48.445809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.413077Z","title":"Recovering 3d human mesh from monocular images: A survey,","venue":null,"work_id":"7612695f-dcaa-4340-9006-33dbc287ec4a","year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.804971Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:e9f6d395a72778f7a3ee78618488855b72aede4a9f646231c4c322fcebabcc6d","observation_id":"17a054b6-2058-44ce-8bad-a2125e1c078c","resolution":{"observed_at":"2026-08-15T17:26:48.422121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.391423Z","title":"Fine-grained egocentric hand-object segmentation: Dataset, model, and applications,","venue":null,"work_id":"e484ea36-4740-4ac2-861a-721115a74cfe","year":2022},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.813131Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:a04f49099606ac18ce6ec9df50e396ca5d0fb5c37136752b9081613405bfb5ab","observation_id":"7a7ec25f-ee0c-46a1-b694-9cfc27942e94","resolution":{"observed_at":"2026-08-15T17:26:48.398278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.369565Z","title":"Egocentric prediction of action target in 3d,","venue":null,"work_id":"0eb265cb-a7dd-4039-99bd-3f7db2255f40","year":2022},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.822738Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:9919cfff32b866f8b2ed69d01669851edfe507df6f2cf37f40e01b2fd82878a9","observation_id":"94256934-f091-4965-962e-db07ed722ab2","resolution":{"observed_at":"2026-08-15T17:26:48.377687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.350816Z","title":"Precision-enhanced human-object contact detection via depth-aware perspective interaction and object tex- ture restoration,","venue":null,"work_id":"d4e3c534-8706-4402-ac84-36ac7158a2a9","year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.828994Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:4d4d8876275568c75275ae28cf058336a4e5bb382e85b81471ad5ad946bf5014","observation_id":"f82d04e7-fed1-4838-9678-7fcf8dca5926","resolution":{"observed_at":"2026-08-15T17:26:48.356163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.328173Z","title":"Interaction region visual transformer for egocentric action anticipation,","venue":null,"work_id":"5e2343bb-6982-44e7-9fe5-72ee2e123f30","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.834520Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:4b0d470eeafc2372339deceb3d5d89a313fc2137a1e1ef34b398c01702d06278","observation_id":"baa5524a-14f2-4623-a2a7-6f593db60a7b","resolution":{"observed_at":"2026-08-15T17:26:48.336875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.310102Z","title":"Under- standing atomic hand-object interaction with human intention,","venue":null,"work_id":"0308d66e-6b26-4836-af04-90a24451d123","year":2021},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.840902Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:2be629955b21a9c206626d1388139e75a6140f922f4f0852ea312a7e07ba888c","observation_id":"ed038ce5-f6e7-4247-b627-4d7130470c6e","resolution":{"observed_at":"2026-08-15T17:26:48.315285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.288292Z","title":"Graph convolutional module for temporal action lo- calization in videos,","venue":null,"work_id":"dc32da2c-918f-421e-b2c9-8cbdf11eacc6","year":2021},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.847312Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:fb9873f6eebbd2f235322c4d2b2a31f2804c478d65c25fb0798826b53e346d13","observation_id":"e9fda984-7528-4d80-acb5-8347180af56a","resolution":{"observed_at":"2026-08-15T17:26:48.295851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.267960Z","title":"Vectorized evidential learning for weakly-supervised temporal action localization,","venue":null,"work_id":"b62a5ff4-c13c-4fcc-a74e-29027b19578d","year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.853113Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:a11e4969ade0330049abec8e7cf28a2172348028ecf4938628f52f51464e6201","observation_id":"cf7d821f-15ba-4254-9c13-64cda55407f4","resolution":{"observed_at":"2026-08-15T17:26:48.273835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.234934Z","title":"Opental: Towards open set temporal action localization,","venue":null,"work_id":"a21bc157-4c67-47a8-bb03-beebdb5f1cee","year":2022},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.860218Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:9267dae65b2333f882bd9bbd7f33bca96fc3465a93601def4e94060877949dd8","observation_id":"6bae1e62-86ee-474d-8f94-551a73ddb0a7","resolution":{"observed_at":"2026-08-15T17:26:48.255123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.216586Z","title":"Detal: Open-vocabulary temporal action localization with decoupled networks,","venue":null,"work_id":"dc9283a1-5bc8-4429-9e88-180ed6d0a812","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.867420Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:90d6a78239860c01f94eeee468d7a7660288c5aab6e0c2b1de2fa16fe9c67b3b","observation_id":"eeb985a1-cdca-41e2-b8be-2a4d528d3253","resolution":{"observed_at":"2026-08-15T17:26:48.222313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.197379Z","title":"Transferable unintentional action localization with language-guided intention translation,","venue":null,"work_id":"816ebc2a-5d27-44f4-96c7-e485b55fce45","year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.873573Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:a8a144f7858ed27b9bf92f716881d662a21fa09bca5c8c67eff0de92f4e5c331","observation_id":"a77b1ebc-3ddf-416b-b180-bbe357c917f7","resolution":{"observed_at":"2026-08-15T17:26:48.204307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.175500Z","title":"Ual- bench: The first comprehensive unusual activity localization benchmark,","venue":null,"work_id":"7960de88-5b60-4188-a62f-122cbc05da79","year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.879350Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:d0984c9f6d497094c6b1caf91a1ee61d8b725ef20265bd7d9e9a6fb5286e0ef1","observation_id":"d6db97f4-bda1-4b8e-99a8-b7f6e21e44b2","resolution":{"observed_at":"2026-08-15T17:26:48.180810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17422","last_updated":"2025-04-07T10:55:13Z","snapshot_observed_at":"2026-08-16T13:22:34.690877Z","submitted_at":"2024-08-30T17:12:14Z","title":"Open-Vocabulary Action Localization with Iterative Visual Prompting","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17422","snapshot_observed_at":"2026-08-15T17:26:45.890759Z","title":"Open-vocabulary action localization with iterative visual prompting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.890759Z"},"links":{"cited_paper":"/paper/2408.17422","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:399956303fdd61d295327d71ac6a036fa8b806c70c1cf291df52088fa831e5fe","observation_id":"22f6b5d3-578b-4791-bf2b-8b1e2601ab37","resolution":{"observed_at":"2026-08-15T17:26:45.890759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15556","last_updated":"2024-06-21T18:00:05Z","snapshot_observed_at":"2026-08-16T13:40:38.811614Z","submitted_at":"2024-06-21T18:00:05Z","title":"Open-Vocabulary Temporal Action Localization using Multimodal Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15556","snapshot_observed_at":"2026-08-15T17:26:45.901479Z","title":"Open-vocabulary temporal action localization using mul- timodal guidance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.901479Z"},"links":{"cited_paper":"/paper/2406.15556","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:f4ad0bb94e557f93999bc0af50cd10dc19ca8d73525557e6d1b52e1fadac6b15","observation_id":"45b3bafe-17c7-489e-ba9c-6262b6d84aca","resolution":{"observed_at":"2026-08-15T17:26:45.901479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:45.910307Z","title":"Motion tracks: A unified representation for human-robot transfer in few-shot imitation learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.910307Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:dbdc71ce3d43e2da5500c9649add1be218809853554a6cc5146e700b2fa10b34","observation_id":"32c0577c-f7e6-4c18-b8a1-b60c1bd73440","resolution":{"observed_at":"2026-08-15T17:26:45.910307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.157682Z","title":"Vlmimic: Vision language models are visual imitation learner for fine-grained actions,","venue":null,"work_id":"996441ee-8172-4dac-905c-a22ba8dbd4b8","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.917362Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:f9425493a2cf78a6e44b086cf5d010adbbb8328ee3eb383c9c73850c715a36c8","observation_id":"c53db613-5422-4e9e-b000-24693edb3cfc","resolution":{"observed_at":"2026-08-15T17:26:48.164374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:45.925425Z","title":"Vlm see, robot do: Human demo video to robot action plan via vision language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.925425Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:e612ba35207110720b6b3b2622bc066d2f6e845517bc199cc4fa2a36de5903ed","observation_id":"4520b5e9-6aaa-4f2b-b704-8ab5409b7ee8","resolution":{"observed_at":"2026-08-15T17:26:45.925425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-15T17:26:45.930770Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.930770Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:880ecf1dc561484fe05eb3914c36f7c9077aeb5d4dfe3743059437bb9262d77c","observation_id":"6b39b5e9-9ede-4ca1-a6ff-205355056b20","resolution":{"observed_at":"2026-08-15T17:26:45.930770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.141506Z","title":"Zero- shot temporal interaction localization for egocentric videos,","venue":null,"work_id":"3e162eea-e7dd-4d97-ae14-c48e711ff400","year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.936410Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:d385ab42efc196f3b5c6156c5a4e86d17b186c97386ca767fed2ad4542c04ca1","observation_id":"3276ccfd-7eaf-4ada-b53f-01d622c07b5d","resolution":{"observed_at":"2026-08-15T17:26:48.146464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.125565Z","title":"Graph convolutional networks for temporal action lo- calization,","venue":null,"work_id":"058c3693-3e02-46ab-b764-0fec0e8a4c69","year":2019},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.942125Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:dddec7e5411575c656132300ed233ca1768b4e4922206d3e6f4e3a3c6d83c42f","observation_id":"e89ec9fb-e0ed-4c55-b0ab-4e9cfbc555e5","resolution":{"observed_at":"2026-08-15T17:26:48.130502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.104450Z","title":"Zeetad: Adapting pretrained vision-language model for zero-shot end-to- end temporal action detection,","venue":null,"work_id":"91dc4e36-079a-42c7-b542-4b0b8b17c87c","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.948125Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:80db8490edbc830dcb324b48aee2250eb9e697de6a74133c3aca06f934962fc6","observation_id":"786bb426-4a95-40d7-801a-a57b45cbbe67","resolution":{"observed_at":"2026-08-15T17:26:48.109657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.086333Z","title":"Unloc: A unified framework for video localiza- tion tasks,","venue":null,"work_id":"92cb2b7c-283f-4a43-825b-18a320ce8f26","year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.955928Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:2679399830044cfa4897239b299489ef2cfb7008aff908eae0a4ecf4315e864f","observation_id":"c1fbce81-d6ad-4cb2-a0ad-c37946e91502","resolution":{"observed_at":"2026-08-15T17:26:48.091805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.062753Z","title":"Deep learning-based action detection in untrimmed videos: A survey,","venue":null,"work_id":"b6363c4f-3a8b-478a-b53f-6e0ae9ffc184","year":2022},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.961310Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:a829965113ffd052ec4b229415e6110a5d925ee4939d5273f6e0ef34821b353a","observation_id":"3fbfc089-a4df-44be-8803-04ea5647a21d","resolution":{"observed_at":"2026-08-15T17:26:48.069275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.045073Z","title":"Dynamic sampling networks for efficient action recognition in videos,","venue":null,"work_id":"9b2d221f-a661-4a5e-ae50-29f3fa45a117","year":2020},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.967893Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:7e441500ce8d031c12566a4a63d1ceb257942dc767f54f2f92014dded80b0f11","observation_id":"14077026-dc38-4fc8-884c-0178c04ecfaf","resolution":{"observed_at":"2026-08-15T17:26:48.050365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.027225Z","title":"Evidential deep learning for open set action recognition,","venue":null,"work_id":"1247b518-7733-4b7e-b74d-95726033ccb4","year":2021},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.973053Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:2dee24127287ec3a03d7db69b5b8e01f720994f36f6ecd196fc9d5cf36534519","observation_id":"e42bb345-fde4-431e-a560-951428504c11","resolution":{"observed_at":"2026-08-15T17:26:48.033355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.010539Z","title":"Egocentric action recognition by capturing hand-object contact and object state,","venue":null,"work_id":"b700ec12-8c03-4f8f-b000-959c1977d6d3","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.978469Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:77e1c32595a98aa360fca64fb6a4dd870a9386156338070c38061f865f709efc","observation_id":"840df3a1-b15f-4d18-b616-67627716478c","resolution":{"observed_at":"2026-08-15T17:26:48.015439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.994448Z","title":"Infogcn++: Learning representation by predicting the future for online skeleton-based action recognition,","venue":null,"work_id":"c5ae2544-d2fa-4d1c-8339-14650455f5e8","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.984649Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:713a467088a33b64de5d6e9dd598f565c23a80cd639fdd8c90af27be5137f9b1","observation_id":"f8535856-2f6a-4313-974d-bd7034d43012","resolution":{"observed_at":"2026-08-15T17:26:47.999228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.978238Z","title":"Referring atomic video action recognition,","venue":null,"work_id":"be8076e0-6748-499b-8dfd-cb5f39fac160","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.989870Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:053299766a6744f5c9dbb2cbaacefddaa62ebe65b46bdcca0ca0eff4da474cbf","observation_id":"eaf14208-30be-4c2c-a7ba-9e7896d08ddd","resolution":{"observed_at":"2026-08-15T17:26:47.983401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.960800Z","title":"Temporal action localization in the deep learning era: A survey,","venue":null,"work_id":"e3bd3c93-a15f-457f-bd40-475f7800f2a1","year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.995092Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:5e69d17b44c45d43a547709d7c511e4da74d38714b17e3da48b7870412827218","observation_id":"c21f2e4c-30ed-425b-8b46-18d3f1f86c1f","resolution":{"observed_at":"2026-08-15T17:26:47.965979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.944362Z","title":"Prompting visual- language models for efficient video understanding,","venue":null,"work_id":"bd895de7-2daa-4f2a-a330-8a5b645879f7","year":2022},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.005388Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:6d4fcf8d3fbc1828933d07e280152c2f420477a2a21bf0a74b256d8ebba269f2","observation_id":"b445762c-03b8-46a5-a25c-23634cd7b214","resolution":{"observed_at":"2026-08-15T17:26:47.948944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.928414Z","title":"Learning transfer- able visual models from natural language supervision,","venue":null,"work_id":"948305c1-8040-413e-84aa-f37dd08e3576","year":2021},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.011008Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:59b187e2ba65e2fca59dde3fa755ee3dd40cc0f3706600ccd42356728fdadfbc","observation_id":"d94b51fd-e40c-4bc6-a522-f0436cfd5cea","resolution":{"observed_at":"2026-08-15T17:26:47.934010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.911540Z","title":"Zero-shot temporal action detection via vision-language prompting,","venue":null,"work_id":"cf7f627c-aa8d-4559-9ae4-0ff2b3bea735","year":2022},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.017539Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:47cbadfe802c8ea5178aede72a67d4cfd2ab656c3c69b6b5d9a428aec58316ce","observation_id":"e09da0c1-5e2e-4bed-b4a4-06a93bd54a21","resolution":{"observed_at":"2026-08-15T17:26:47.917303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.893622Z","title":"Zero-shot temporal action detection by learning multimodal prompts and text-enhanced actionness,","venue":null,"work_id":"2013f2cd-ef59-4a76-b8d4-2a8e2f071318","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.023624Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:620c379b8d10525b8656680df70eff259d6ab469e98bfc66b927a5e2f9fe1bee","observation_id":"f71f5dc3-e50c-49ee-b814-3a44b111c03b","resolution":{"observed_at":"2026-08-15T17:26:47.898880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.877620Z","title":"Test-time zero-shot temporal action localization,","venue":null,"work_id":"53169e58-3441-49af-b989-c70a0a138dea","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.028772Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:511165f908833d08a8b56f7e378d5bafb974156a24e5363b85d79bffc0660b53","observation_id":"625eee44-f223-4d7c-87b6-81313c0328a6","resolution":{"observed_at":"2026-08-15T17:26:47.882409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11732","last_updated":"2023-03-21T10:40:13Z","snapshot_observed_at":"2026-08-16T15:46:36.586163Z","submitted_at":"2023-03-21T10:40:13Z","title":"Multi-modal Prompting for Low-Shot Temporal Action Localization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11732","snapshot_observed_at":"2026-08-15T17:26:46.033644Z","title":"Multi-modal prompting for low-shot temporal action localization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.033644Z"},"links":{"cited_paper":"/paper/2303.11732","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:1e931ae49fd7f549d1ea0558d8f1ef1a7312598bceb0493f9acedc07567fa34e","observation_id":"95163f6e-5f23-4d85-a118-a86dd36568ac","resolution":{"observed_at":"2026-08-15T17:26:46.033644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.861255Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark,","venue":null,"work_id":"ce972087-ef33-467a-997c-66566d2c6ce6","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.038900Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:bb7580e9c9afe6d3141babf6892fd7da6e546843e760b5a2a779e0cd988b9b5e","observation_id":"7132f8f9-0c23-4084-898b-682527d22718","resolution":{"observed_at":"2026-08-15T17:26:47.866718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.845734Z","title":"Zero-shot video moment retrieval from frozen vision-language models,","venue":null,"work_id":"506b687d-66fb-43c2-adeb-e543aa0a01ea","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.044416Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:acbc3190950f9330a95c200ca8e027cf2634e8e0bd45b553a62319586ba9a189","observation_id":"937186ee-6180-4699-8743-1e95f4b306a7","resolution":{"observed_at":"2026-08-15T17:26:47.850743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T17:26:46.052318Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.052318Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:9761dbc8f6d18daeb3d76ee344e57199739f110bfec00d5e36393be7a4e1d6c8","observation_id":"9480f719-9044-4360-9fbd-c9cfff8227bf","resolution":{"observed_at":"2026-08-15T17:26:46.052318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-16T14:19:14.631075Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-08-15T17:26:46.057999Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.057999Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:3c1076e97cfff900489bb82b59d8dd0fa40e3f772ba959a84d12002c7d5ec6b9","observation_id":"db4bb1ff-e23a-4481-8c5a-cb60b7602da8","resolution":{"observed_at":"2026-08-15T17:26:46.057999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.822978Z","title":"Forecasting hands and objects in future frames,","venue":null,"work_id":"c09b0aed-772a-41fb-bbbc-cf8fc6236794","year":2018},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.064904Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:1b7aa8017d40eaf120b8a960a846d5117e9c5bfc2e13ecc2dbcba84b65fe354c","observation_id":"c614b675-e658-4a2d-9169-84f2bdd85d1f","resolution":{"observed_at":"2026-08-15T17:26:47.831466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.801174Z","title":"Scaling egocentric vision: The epic-kitchens dataset,","venue":null,"work_id":"5058cdbc-8081-46fc-90f3-0c3761d6be08","year":2018},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.070513Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:56d26379d500b8bc517aaf5740bc582ac921354140d5febcb296dfa9520a18a5","observation_id":"6fd4f90d-9384-456d-8d40-65805db9435d","resolution":{"observed_at":"2026-08-15T17:26:47.808278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.782039Z","title":"Understanding human hands in contact at internet scale,","venue":null,"work_id":"49c21ef0-1edf-46e4-972c-e5c6593c1820","year":2020},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.091274Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:f26efe5482753ee76196009fe3ca6815162e4ccba05e2a6c2cf6c5ef72ab7a4d","observation_id":"f1d00eb0-007b-4efe-adc3-bbf951222fe6","resolution":{"observed_at":"2026-08-15T17:26:47.789197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.759099Z","title":"Joint hand-object 3d reconstruction from a single image with cross-branch feature fusion,","venue":null,"work_id":"9f4c5dbb-068e-4c61-9572-6e19f0899d51","year":2021},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.097126Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:74a2eca35537e6d88efe5fde872718a2f54505ec1f5e1a7fa772921f3b8f382b","observation_id":"420de195-53ee-42c6-9718-f231ce5da600","resolution":{"observed_at":"2026-08-15T17:26:47.766643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.739667Z","title":"Interacting hand-object pose esti- mation via dense mutual attention,","venue":null,"work_id":"f3b778c1-7797-4cb4-bda2-409e1357bedc","year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.102215Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:335abfd57262446c72cdb547024f568b0abf2a75ad44d510372e1eb06384525c","observation_id":"4879fdb5-518a-4dc4-be8f-a789ebed2451","resolution":{"observed_at":"2026-08-15T17:26:47.746068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.715015Z","title":"Affordance diffusion: Synthesizing hand-object interactions,","venue":null,"work_id":"b8640978-e1ca-409a-a731-89d40d707aef","year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.107940Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:a82125ea6b3a62c2b04f139f1defc0d7c792725fd7dca95aa7a89a20f4b4781e","observation_id":"254ccc7b-e236-4502-9e8e-28b562b95bbd","resolution":{"observed_at":"2026-08-15T17:26:47.723754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.692814Z","title":"Hoi-swap: Swapping objects in videos with hand-object interaction awareness,","venue":null,"work_id":"d01088f4-ce1c-4c1b-8a11-39f6d22e83f9","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.114863Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:0d07be0b48b9cf741893de6b79be7c292fdbad701f46fdd6f92cea8506b0efdf","observation_id":"0cdb92ef-bfbc-4a48-8f01-dd78e65cdbb2","resolution":{"observed_at":"2026-08-15T17:26:47.699641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.667613Z","title":"3d hand pose estimation in everyday egocentric images,","venue":null,"work_id":"a3991ead-7b7f-4923-a6d4-292574a6ed3c","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.121153Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:b4b3d753f93126d903c68b9dac24f436b716ea11e841b4d5d8d30eea27e2a440","observation_id":"d27bfdfe-ff12-4b45-9258-4d3cfb91889f","resolution":{"observed_at":"2026-08-15T17:26:47.674636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.646222Z","title":"Uncertainty-aware state space transformer for egocentric 3d hand trajectory forecasting,","venue":null,"work_id":"54414acc-9b88-4db0-b7da-2eda37fd9a4c","year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.126702Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:50de4e40189bdb007828cb51e459ec7a920a9c7e963755eac1101d9fd57147d1","observation_id":"e3f8de01-c265-45f5-aafd-3d82dadd8f01","resolution":{"observed_at":"2026-08-15T17:26:47.653984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:46.131778Z","title":"Diff-ip2d: Diffusion-based hand-object interaction prediction on egocentric videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.131778Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:ec5060d9aaad3072a6d23b832606b6e75cafd7f6194534651e2df144256540c5","observation_id":"8b96217f-3554-4873-9801-31634ad1c05e","resolution":{"observed_at":"2026-08-15T17:26:46.131778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:46.137381Z","title":"Madiff: Motion- aware mamba diffusion models for hand trajectory prediction on egocentric videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.137381Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:b646a0aadb52f5b70d8960725906d89dbc0da1fb7704ffc0507b201ad03020de","observation_id":"8af7508f-5a6e-416c-928d-485110777d39","resolution":{"observed_at":"2026-08-15T17:26:46.137381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.619038Z","title":"Can’t make an omelette without breaking some eggs: Plausible action anticipa- tion using large video-language models,","venue":null,"work_id":"28daeb36-ffa9-471c-bcd3-53b22e852757","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.142449Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:242a2cb73a1d62206ada2b84afce692b42ce3199dd1d54d9aca5372486497352","observation_id":"7a30926a-2729-498c-8cd5-7aeda981e2ad","resolution":{"observed_at":"2026-08-15T17:26:47.628952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.593761Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"494f966a-bb84-497e-bdac-49a7f59cb6ee","year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.148073Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:2ac0ae986dcf54d36a3030943fe55be3709050b88ba180e8ac47b6182de0d6e7","observation_id":"d6a0743a-77fb-4973-943d-a8c096159755","resolution":{"observed_at":"2026-08-15T17:26:47.602101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.568806Z","title":"Strategies to leverage foundational model knowledge in object affordance grounding,","venue":null,"work_id":"08e19a6c-f165-4c60-8fd9-702f1d6a71c1","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.153369Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:14832a76f09fdd2c9dcce3ccbe7245fbd46f8333b9541893eb9b796bb874f5cc","observation_id":"1dca1e98-f7e7-4e98-b51d-d72fca1272b4","resolution":{"observed_at":"2026-08-15T17:26:47.576269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.547301Z","title":"Egothink: Evaluating first-person perspective thinking capability of vision-language models,","venue":null,"work_id":"45911d0f-856d-4d8b-ab30-cbca77507ad4","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.158574Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:394722394ebc9ba401576819f9b24152ce09cd0f81db485cbbaeeed8318004f4","observation_id":"86b374eb-34fb-43fa-9985-a32d93e4a512","resolution":{"observed_at":"2026-08-15T17:26:47.555384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-12T19:55:27.838188Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03097","snapshot_observed_at":"2026-08-15T17:26:46.165458Z","title":"Egovlm: Policy optimization for egocentric video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.165458Z"},"links":{"cited_paper":"/paper/2506.03097","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:00e7f0b45d46ad0a94770024d6e5696ec5925f99ef413b4c56038d7d8bc3c354","observation_id":"004476fc-40b1-40e2-bccc-5727d2f6faaa","resolution":{"observed_at":"2026-08-15T17:26:46.165458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.524829Z","title":"Smoothing and differentiation of data by simplified least squares procedures.,","venue":null,"work_id":"39ed9f20-317e-4673-a38c-49e1ea7da779","year":1964},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.172216Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:990229ed1ed819631c5e39998d3a89dd61a8575220e31c5f0575c93f091e8851","observation_id":"d39501d2-aded-40ae-a781-fe2a29cdb324","resolution":{"observed_at":"2026-08-15T17:26:47.532044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.504049Z","title":"Choice of contact points during multidigit grasping: effect of predictability of object center of mass location,","venue":null,"work_id":"52e22705-cf07-4bb3-8945-102a61f5a224","year":2007},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.177238Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:8e6cd75e36fe9f32adc2f3ebd6866af8752a9eb07c690698749caaf5d786e688","observation_id":"88ba594f-cfd2-44df-aeb5-0648451b2767","resolution":{"observed_at":"2026-08-15T17:26:47.511008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.476824Z","title":"Research on speed and acceleration of hand movements as command signals for anthropomorphic manipulators as a master-slave system,","venue":null,"work_id":"76aac1f8-ea11-45ff-a0a8-1c6c006cea02","year":2022},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.182907Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:ce993f764e1c042a21e3d585f66c0154a7eb89562e0f90172a5e0d341c6975d2","observation_id":"e6c07fb9-6a53-43ee-bae0-703eefad84be","resolution":{"observed_at":"2026-08-15T17:26:47.486802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.446135Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":"808e8fee-5406-4b44-b117-a56869d2188c","year":2022},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.189398Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:a226f2fb50d78d3fe971326864bfbada7fc66aef8cf3c8e3dab881e0169ce932","observation_id":"73e454bb-3db8-4866-83b5-217581e8a217","resolution":{"observed_at":"2026-08-15T17:26:47.453770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-15T17:26:46.195656Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.195656Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:b6f64ffbc9adbae3f07bc4a2ed0e1854af0562306faf785f215e4bbf963a2dfc","observation_id":"120acae6-061e-49da-b510-3d2051b8d01a","resolution":{"observed_at":"2026-08-15T17:26:46.195656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.421516Z","title":"Lan- guage models are few-shot learners,","venue":null,"work_id":"4f589910-35f8-470b-b67b-e217d3456192","year":1901},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.202507Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:5f1dcd70c0e63f13e81b7578afa2ce8b8534279631704847120b74c50838d44f","observation_id":"698d8ed8-b6ab-442c-b57e-481b844a24f2","resolution":{"observed_at":"2026-08-15T17:26:47.431120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-15T17:26:46.208003Z","title":"Videochat: Chat-centric video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.208003Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:4c6359c6f57409c0cad3ec48a8e9a8f1cbf459bea48fccb186797c4b4d065d8b","observation_id":"b9385bac-7421-4097-8d7d-8be2ee2b3f3c","resolution":{"observed_at":"2026-08-15T17:26:46.208003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20391","last_updated":"2025-02-27T18:59:18Z","snapshot_observed_at":"2026-08-16T12:54:32.032012Z","submitted_at":"2025-02-27T18:59:18Z","title":"Point Policy: Unifying Observations and Actions with Key Points for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20391","snapshot_observed_at":"2026-08-15T17:26:46.213716Z","title":"Point policy: Unifying observations and actions with key points for robot manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.213716Z"},"links":{"cited_paper":"/paper/2502.20391","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:905adc42d430517cfba18c55f5cc496c793802ad29950dcc729f418ea573126b","observation_id":"6ca1f7c4-26b5-4249-aa17-df86b5991f09","resolution":{"observed_at":"2026-08-15T17:26:46.213716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20290","last_updated":"2025-06-03T22:50:28Z","snapshot_observed_at":"2026-08-13T14:30:25.903303Z","submitted_at":"2025-05-26T17:59:17Z","title":"EgoZero: Robot Learning from Smart Glasses","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20290","snapshot_observed_at":"2026-08-15T17:26:46.219166Z","title":"Egozero: Robot learning from smart glasses,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.219166Z"},"links":{"cited_paper":"/paper/2505.20290","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:a453c7a0be37944d1efab2ce809a306f381cc46a10c238dabb66cdd940f6daa0","observation_id":"4282b0ed-6bb9-4c99-a3cf-9e403eac7d43","resolution":{"observed_at":"2026-08-15T17:26:46.219166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.395259Z","title":"Benchmarking llms via uncertainty quantification,","venue":null,"work_id":"2ee2ed84-f338-4e91-8874-6c395ba4de08","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.225208Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:0f05a2dc91819cca20434d08c02b470992cc69de5fcaa79d40132ed9bac6982e","observation_id":"928846b3-4d29-4eb9-a011-b133ed328716","resolution":{"observed_at":"2026-08-15T17:26:47.403664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15850","last_updated":"2025-06-03T22:16:32Z","snapshot_observed_at":"2026-08-16T12:48:24.492574Z","submitted_at":"2025-03-20T05:04:29Z","title":"Uncertainty Quantification and Confidence Calibration in Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15850","snapshot_observed_at":"2026-08-15T17:26:46.232837Z","title":"Uncertainty quantification and confidence calibration in large language mod- els: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.232837Z"},"links":{"cited_paper":"/paper/2503.15850","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:ce3973e4836fcf66cc470e146d6a527bc0513a1213d10b522f6d66dcd1fb2c43","observation_id":"e61e6569-5acd-400c-847f-2fcd7e441218","resolution":{"observed_at":"2026-08-15T17:26:46.232837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-15T17:26:46.238063Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodal- ity, long context, and next generation agentic capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.238063Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:70fb51b681abe5147cfc410f331c6205f17cc8f1d5320538f7566b14acc4f7eb","observation_id":"71251d19-784b-4d17-a541-bdfe0b72748d","resolution":{"observed_at":"2026-08-15T17:26:46.238063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-15T17:26:46.243073Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.243073Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:c6d7ae3dcc88ba5fdc228bad0c2c18b93f7e8d29d54a62f95db40d969366bd2c","observation_id":"6957bc19-cc67-491e-a16e-56def8b7f8a6","resolution":{"observed_at":"2026-08-15T17:26:46.243073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.07375","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:46.510064Z","title":"Novel diffusion models for multimodal 3d hand trajectory prediction,","venue":null,"work_id":"277fff49-69c5-476c-96d0-5d615b4f4bcb","year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.249220Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:c7ef375143cd2174ed65ef86c5201fe20bdaff2f12d69bed2c5e07ae2818982f","observation_id":"482dfc3e-f5ac-400e-b42d-fc715ab49515","resolution":{"observed_at":"2026-08-15T17:26:46.520937Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12957","last_updated":"2025-04-03T10:12:23Z","snapshot_observed_at":"2026-08-16T13:33:18.623066Z","submitted_at":"2024-07-17T18:59:56Z","title":"R+X: Retrieval and Execution from Everyday Human Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12957","snapshot_observed_at":"2026-08-15T17:26:46.254801Z","title":"R+ x: Retrieval and execution from everyday human videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.254801Z"},"links":{"cited_paper":"/paper/2407.12957","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:e5251f20027260b5d9c570bd95ac40c42fac41ad5f0339ee61a7a2f1eccdab75","observation_id":"3356358c-6a8c-47c8-a18b-ae2253ba4981","resolution":{"observed_at":"2026-08-15T17:26:46.254801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.370515Z","title":"Sapien: A simulated part-based inter- active environment,","venue":null,"work_id":"30a27338-7a9d-4345-af21-c1b08e2e94d6","year":2020},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.260613Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:a3af4bbd218145902ec9b6e4c5e0b24cbfaa2ff726b1439487cdacf2c3c86c34","observation_id":"0c6630dd-cb02-48d2-9d84-62a6a0f9f61a","resolution":{"observed_at":"2026-08-15T17:26:47.379657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.336810Z","title":"Articulated object estimation in the wild,","venue":null,"work_id":"a6b8beee-2b1d-40fc-8181-a462a72d9c32","year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.265626Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:3672566208fa9411a09ae1eaee3ea5eb7d7d752862ad6b993241231e03c1ec19","observation_id":"95c2688a-490b-456f-bb4d-d8d0490b7a79","resolution":{"observed_at":"2026-08-15T17:26:47.350096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:46.270884Z","title":"Rolling-unrolling lstms for action anticipation from first-person video,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.270884Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:8bc82a1b260113a6f40ea5955365a3bcd3e818404072b38b25b011f66918238b","observation_id":"4d05d8e2-a0a7-4f64-ba45-3eb187f433bf","resolution":{"observed_at":"2026-08-15T17:26:46.270884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-15T17:26:46.275801Z","title":"Adam: A method for stochastic optimiza- tion,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.275801Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:646230d1b1d83cab903311d1d74311e378e68693208de94094bd2f8345a3dfff","observation_id":"d1486dce-8c37-4b53-9197-e54fc451f50f","resolution":{"observed_at":"2026-08-15T17:26:46.275801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T00:20:13.789338Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":57},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 1 inbound Pith citation observation for arXiv:2508.12349."}