{"as_of":"2026-08-09T15:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2f615f00d07bd8ee1a3c506f35bf7068100cdeef4e1d372cd78d31232ff7d89f","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:17:52.535638Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T11:39:15.308355Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T11:40:03.365977Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"cited_work":{"arxiv_id":"2507.03393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.03393","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked temporal interpolation diffusion for pro- cedure planning in instructional videos","venue":null,"work_id":"6f21819e-2146-4a85-ab78-efe8f2199936","year":2025},"citing_paper":{"arxiv_id":"2602.23058","last_updated":"2026-05-17T06:55:06Z","snapshot_observed_at":"2026-07-06T22:47:11.228912Z","submitted_at":"2026-02-26T14:42:53Z","title":"GeoWorld: Geometric World Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-21T11:39:15.308355Z"},"links":{"cited_paper":"/paper/2507.03393","citing_paper":"/paper/2602.23058"},"observation_digest":"sha256:a46e004f89a872d7d6860ce1d030e02e06db7ea74c90b3a2d026d3bbf58c357d","observation_id":"bae7dbac-e650-43c0-80a0-234c5b759491","resolution":{"observed_at":"2026-05-21T11:40:03.367788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.03393/citation-record","integrity":"/paper/2507.03393/integrity","json":"/paper/2507.03393/citation-record.json","paper":"/paper/2507.03393"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.670477Z","title":"Uncertainty-aware anticipation of activities","venue":null,"work_id":"b90d280c-9f24-4fe9-a8ac-79e65d9b3b49","year":2019},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.199105Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:d6bbaf6f9d2893d7879dff43398b0dbef0e3933c094027ed418a9cce27330a35","observation_id":"a64842db-4e0b-41cc-a008-28119ecc1afc","resolution":{"observed_at":"2026-08-06T20:17:53.683835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.636980Z","title":"Unsupervised learning from narrated instruction videos","venue":null,"work_id":"f005d6de-c976-4a1f-82c5-68d97713bd5f","year":2016},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.208092Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:7ec4c155016911d41133ae68e497ecbf88e34027321c3fe61f55fb51c2a1fe16","observation_id":"dd041405-cbb9-4345-8054-be2064398bb8","resolution":{"observed_at":"2026-08-06T20:17:53.644308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.610484Z","title":"Trajectory prediction for robot navigation using flow-guided markov neural operator","venue":null,"work_id":"673ce92f-1abf-43b1-bb2f-2544b61d1687","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.214051Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:078abe64400243f8bbc16a4fbce9ba10067169c591db4e3e066505704ff8bac2","observation_id":"7aaf30b4-e8a9-40a2-aa16-8ff6aefb4108","resolution":{"observed_at":"2026-08-06T20:17:53.617857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.576574Z","title":"Procedure planning in instructional videos via contextual modeling and model-based policy learning","venue":null,"work_id":"21ac8455-bf5c-4a41-b492-c0fe02b3d49e","year":2021},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.222266Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:1937d6ee9e259e826c2fae8954ccb9932ed726570ceee21887c2020ae8b62ea9","observation_id":"d4e57798-ce33-426f-89de-4ade59526ac2","resolution":{"observed_at":"2026-08-06T20:17:53.587021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.230512Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.230512Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:96fa56d87c76112a1a3ce8a59055e5bfffabdf51b589319be0d2eef36f6b42f1","observation_id":"b423e9c1-a232-441e-bdd7-6613e34267f6","resolution":{"observed_at":"2026-08-06T20:17:52.230512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.535059Z","title":"Procedure planning in instructional videos","venue":null,"work_id":"a0c36239-b116-485c-bd68-586af28dd534","year":2020},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.237145Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:6bb7ec7d0ef652fb34ff31d99690a882d5004dbd4024883c06ad04b7917a0896","observation_id":"8c7fd138-979c-486a-80da-8f4ef2df3686","resolution":{"observed_at":"2026-08-06T20:17:53.543125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.507723Z","title":"Diffusion models in vision: A survey","venue":null,"work_id":"314405e1-b153-43fa-af1b-e5d3d6d3b0e1","year":2023},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.246350Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:b8ff7699229c4f6298d5663a1128733adfcb9a3e8b8a56b87715bfaf7d569f07","observation_id":"a8b9fef0-a6c7-423a-ad8d-29af28553e82","resolution":{"observed_at":"2026-08-06T20:17:53.513708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.481930Z","title":"Who let the dogs out? modeling dog behavior from visual data","venue":null,"work_id":"5e19c356-8983-44ae-8fd9-a594089fc75a","year":2018},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.254885Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:842bd1e55645551f4aff3a779ac42b9c61a01283c5d06d51bead4d1f86501b7f","observation_id":"35ea51d1-3637-4b95-8686-de870521cadf","resolution":{"observed_at":"2026-08-06T20:17:53.487943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.449647Z","title":"Masked diffusion transformer is a strong image synthesizer","venue":null,"work_id":"6a03a8fd-1267-4afc-ad5a-bf8988c90982","year":2023},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.265217Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:92c84b8adf77daa12f39b5409f5b8649977c7503e20c1db5490974bfb12f301e","observation_id":"83952eff-6aa7-4403-8a67-35173b5f7960","resolution":{"observed_at":"2026-08-06T20:17:53.460478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.274142Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.274142Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:bfaa6ab9c7551b9a1b17babb5f3612d7ac7c97021ef7bd7afd45fccbb1926a9f","observation_id":"0d6c1bea-b606-40c6-9de6-8378635b644c","resolution":{"observed_at":"2026-08-06T20:17:52.274142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14773","last_updated":"2025-04-16T13:38:58Z","snapshot_observed_at":"2026-08-09T14:37:44.086189Z","submitted_at":"2024-03-21T18:27:29Z","title":"StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14773","snapshot_observed_at":"2026-08-06T20:17:52.280946Z","title":"Streamingt2v: Consistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.280946Z"},"links":{"cited_paper":"/paper/2403.14773","citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:baa47b10d20b1cd8ed5523f402724b5f66c0f3bd263febcfc81d871243689ca1","observation_id":"3f29c72f-c651-4c8b-a6de-661b549cb5d0","resolution":{"observed_at":"2026-08-06T20:17:52.280946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.397257Z","title":"Cnn architectures for large-scale audio classification","venue":null,"work_id":"33ef5a81-cca5-4145-b61c-b79ddfc95173","year":2017},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.288236Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:23638da608770f101101a2514ce8d1223ef0dea507efe66a8036c04a33357b81","observation_id":"35311ab0-0825-48ba-bd84-d8e64aa68cfc","resolution":{"observed_at":"2026-08-06T20:17:53.403875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.294299Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.294299Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:e0cb33c6dc2d86d637c949dfb2900d55ecfb6907e78adff4698b0eb12128a7a5","observation_id":"1be18652-4712-4de6-99f8-f02c64b07e13","resolution":{"observed_at":"2026-08-06T20:17:52.294299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.340855Z","title":"Videobooth: Diffusion-based video generation with image prompts","venue":null,"work_id":"f9067548-ef34-402e-90ab-c833c0bd17bd","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.299920Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:61f876d480787dddf060b4637dd12dfe5b0b653367c33a7eca2ab521017be638","observation_id":"e95561e4-c312-4a9b-9326-4700cd17b0b0","resolution":{"observed_at":"2026-08-06T20:17:53.350062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.315637Z","title":"Text2video-zero: Text-to-image diffusion models are zero-shot video generators","venue":null,"work_id":"5b39e06e-727e-4502-9796-69c315046a06","year":2023},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.306229Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:8af10a74cb2dcef0a0da0634cf1cc1aafadc71bc0e4d300ad8de674709c36aea","observation_id":"5fffa332-02ce-4b58-bd61-3b691fa24d70","resolution":{"observed_at":"2026-08-06T20:17:53.325831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T20:17:52.313579Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.313579Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:5770567bd4ec768c7e2d1351c78179212f9f492f0a04ceb8098ac3e0fdd74fdf","observation_id":"ae40d730-8a00-4849-a7f0-8327e557c2ec","resolution":{"observed_at":"2026-08-06T20:17:52.313579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.293592Z","title":"Skip-plan: Procedure planning in instructional videos via condensed action space learning","venue":null,"work_id":"9f3bf885-6821-4245-b6b4-5c0edf63cf57","year":2023},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.319058Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:ca87852d138faed68bf3a2c9a81a591158450352fc77bf05340a434d9f68854a","observation_id":"3562e1d9-dfb9-4291-8659-0be736a9e6d6","resolution":{"observed_at":"2026-08-06T20:17:53.299813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.260938Z","title":"Bat: Behavior-aware human-like trajectory prediction for autonomous driving","venue":null,"work_id":"469167d9-5c7f-441d-bf5c-bf57aed895a4","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.325507Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:d6be6bdd43ac4c8c8287c88caebe7da553c8187beb7f8fdf23f0cdc58c9a5143","observation_id":"ea2c997b-14d0-4429-8370-f151cc5b3041","resolution":{"observed_at":"2026-08-06T20:17:53.268479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.330812Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.330812Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:e565d2f3cae159ade9081a0076bc6c46c12e0c8a128837e13de89721d363d197","observation_id":"12ebb59e-534e-4f3c-9642-e39c81cd360e","resolution":{"observed_at":"2026-08-06T20:17:52.330812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08681","last_updated":"2020-08-13T05:42:12Z","snapshot_observed_at":"2026-07-06T08:16:16.271286Z","submitted_at":"2019-08-23T06:22:06Z","title":"Mish: A Self Regularized Non-Monotonic Activation Function","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08681","snapshot_observed_at":"2026-08-06T20:17:52.339417Z","title":"Mish: A self regularized non-monotonic activation function","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.339417Z"},"links":{"cited_paper":"/paper/1908.08681","citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:f323b68505164b74be05adc566c52149f54b8de9019182ec09b8835f72cf2a32","observation_id":"14dc7594-b590-424b-9a4a-e7106257ff0c","resolution":{"observed_at":"2026-08-06T20:17:52.339417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.220619Z","title":"Why not use your textbook? knowledge-enhanced procedure planning of instructional videos","venue":null,"work_id":"02224690-32a3-49b1-8040-659e0bb01a4d","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.345939Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:9ea430d10671297b813e111107034d429ff7b120e4c0f82f51828da0714c8b8b","observation_id":"93dadf9d-d90c-4498-b11f-c49e3298ff95","resolution":{"observed_at":"2026-08-06T20:17:53.229029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.199755Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":"c9abab13-d450-4456-bd9f-951ad25f0f88","year":2021},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.357367Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:cb4426e07544aed41161cf4e9b10da207ba6a64c7fc8ca914fe7127e8ea3866c","observation_id":"12a7f428-521e-4b3d-b574-a5c6265bb632","resolution":{"observed_at":"2026-08-06T20:17:53.206160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.177737Z","title":"SCHEMA : State CH anges MA tter for procedure planning in instructional videos","venue":null,"work_id":"98294d6b-8a2e-425d-a23d-9eba13925475","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.363448Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:0aca39951fda10f4a2089d6c9a1f5ef3d9c13af4fb7a50658d368f6fd54314b9","observation_id":"3cb2a6e2-cf17-4283-8f78-424ac316d93c","resolution":{"observed_at":"2026-08-06T20:17:53.183062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.154175Z","title":"Self-regulated learning for egocentric video activity anticipation","venue":null,"work_id":"735c0467-5725-40dd-99b4-5dc8879010b8","year":2021},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.369571Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:bfe2b97abb877ad27b1479492f1210b4ca611d72c1f20e31dae90e56f4a88ac5","observation_id":"19d3a483-4c5b-4429-b04f-a65fabb455d7","resolution":{"observed_at":"2026-08-06T20:17:53.161952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.136429Z","title":"Uncertainty-boosted robust video activity anticipation","venue":null,"work_id":"31f2d533-55d6-4f44-938a-caa234a25e8d","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.376027Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:7bf6b493fa57090fa17f4ac2caf75642e1b88c7d6bccc105f4a040e43b80fc03","observation_id":"06c791f7-7640-49b9-ad05-e2dd557b0fcb","resolution":{"observed_at":"2026-08-06T20:17:53.141419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.383132Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.383132Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:c6862be5a6578928c7e60a0c7eafc9511db005450dacfc251a63769df10369ff","observation_id":"59eee345-d7bd-4fe0-ba8c-2db173dac57b","resolution":{"observed_at":"2026-08-06T20:17:52.383132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.390658Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.390658Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:30e80cf7a84b8ba4221b4de1516880e4cbb0dfa48445088b25b387a481a41570","observation_id":"5915f15e-bfb7-48b4-9100-9e04f3cbab5c","resolution":{"observed_at":"2026-08-06T20:17:52.390658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.085805Z","title":"Robovqa: Multimodal long-horizon reasoning for robotics","venue":null,"work_id":"8b16657c-ae02-4a27-8716-954fb2a1633f","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.395774Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:c1e4df032cca30a11e4ecc56382bb9500cb94bece19ee866c20450fd5237490a","observation_id":"c4c7dc85-7b88-47bb-81fa-a1e6d8de5bb8","resolution":{"observed_at":"2026-08-06T20:17:53.094166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.406714Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.406714Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:ad6522182e491bbaf1188d5d8ef6db5f60ea901da787c2108473a9d3a718667f","observation_id":"9a501f62-4be8-45de-a6f1-90dd118d887d","resolution":{"observed_at":"2026-08-06T20:17:52.406714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.413318Z","title":"Universal planning networks: Learning generalizable representations for visuomotor control","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.413318Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:08d72f563fa6ae62145f97e5d9dfdc1cd4a59e6fe5d86ed3baa7c817faac887c","observation_id":"fd654e69-f889-4853-9be1-88eacd64e077","resolution":{"observed_at":"2026-08-06T20:17:52.413318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.037259Z","title":"Plate: Visually-grounded planning with transformers in procedural tasks","venue":null,"work_id":"35424e68-ab28-44ba-a9fe-0387004b599b","year":2022},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.417696Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:1b763060485f8483ffdce8857e20746193b4d7583e85a531e1c9e86a88d07beb","observation_id":"0cd7d96d-f4b3-4b1c-bb65-0faf353e5f1d","resolution":{"observed_at":"2026-08-06T20:17:53.042521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.426483Z","title":"Coin: A large-scale dataset for comprehensive instructional video analysis","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.426483Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:abeec68cad528e33c29ba69da04aa6ba8df28b52def1d8dcfdd30c1b98b4f59a","observation_id":"0d351948-db3f-4fcc-9beb-0f4bb32ab753","resolution":{"observed_at":"2026-08-06T20:17:52.426483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:53.002724Z","title":"Event-guided procedure planning from instructional videos with text supervision","venue":null,"work_id":"f6c5de4e-ecee-4fff-b052-79434afdc944","year":2023},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.435029Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:dfad1620729956bbb932248e6a4e37e2cee8c14a65958cdadee2153afa2622aa","observation_id":"241453a1-d267-4648-96eb-ad3b53f106de","resolution":{"observed_at":"2026-08-06T20:17:53.009073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.983013Z","title":"Pdpp: Projected diffusion for procedure planning in instructional videos","venue":null,"work_id":"5aa31f20-3082-458d-90eb-1bf5ce1b9e3f","year":2023},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.441527Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:f57dbb169a276777cc194592a875aaa46d838f791c74e886374bdb2328f7c38f","observation_id":"be051ffe-2c32-404f-af81-4dbf3d2f515b","resolution":{"observed_at":"2026-08-06T20:17:52.989961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.964113Z","title":"Driving into the future: Multiview visual forecasting and planning with world model for autonomous driving","venue":null,"work_id":"da6d7595-b3c3-49bf-afdc-6bdcd54aa756","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.447149Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:26111b458b1466d7e5330a7d80edb5df306f5c1d262fcb46a6cd4645dc75d59c","observation_id":"91587db9-7d84-43dc-93eb-2979b7e766f0","resolution":{"observed_at":"2026-08-06T20:17:52.969798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.943746Z","title":"Art-v: Auto-regressive text-to-video generation with diffusion models","venue":null,"work_id":"ff1542fb-42ab-4cf1-aeec-1ad21a71100f","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.455036Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:ad54e2403ec8d6a6c2565cbfe2230a39916d876afe9d4ab2899d7eaa69614af2","observation_id":"c97636b0-dcbe-422b-9eac-71dfca472eb5","resolution":{"observed_at":"2026-08-06T20:17:52.949459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.925336Z","title":"Group normalization","venue":null,"work_id":"60145fca-9c8e-40b1-a2ba-d759f6d1ad5c","year":2018},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.462730Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:ec3bcc30a2c45202479edfce98934925dcc2a284a71188edc253638339af72f6","observation_id":"1693e9be-50f3-4654-9795-5124c33454a1","resolution":{"observed_at":"2026-08-06T20:17:52.931341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.897582Z","title":"P3iv: Probabilistic procedure planning from instructional videos with weak supervision","venue":null,"work_id":"77afa4d2-df3d-441c-b895-3cec8ea6e17b","year":2022},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.483527Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:c4ada0ffe1add9d902d1cf16b5bdc36679a52d3c2798b80f88ac384e4fb65135","observation_id":"314c4c29-97b8-462f-82dc-9781bd43a2e1","resolution":{"observed_at":"2026-08-06T20:17:52.904847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.878653Z","title":"Upscale-a-video: Temporal-consistent diffusion model for real-world video super-resolution","venue":null,"work_id":"73e912a2-75c3-4214-a26a-d3db47ec5bb2","year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.488656Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:fb857660783843134cbf09d89ba278fb41516a5aa41e154b4f3cd7942a130588","observation_id":"b3a0bc6c-19c9-45ce-a186-2b1457ae9ced","resolution":{"observed_at":"2026-08-06T20:17:52.883947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01434","last_updated":"2024-05-02T16:25:16Z","snapshot_observed_at":"2026-07-06T18:08:52.053005Z","submitted_at":"2024-05-02T16:25:16Z","title":"StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01434","snapshot_observed_at":"2026-08-06T20:17:52.500672Z","title":"Storydiffusion: Consistent self-attention for long-range image and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.500672Z"},"links":{"cited_paper":"/paper/2405.01434","citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:e5de8d186e12c3bfa63251a5fa5aa8fcfa7e06a8b8c7902c695bc0d4f3c94808","observation_id":"051811af-993f-4bb2-aaa3-46d2926584ad","resolution":{"observed_at":"2026-08-06T20:17:52.500672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.856858Z","title":"Cross-task weakly supervised learning from instructional videos","venue":null,"work_id":"812186c2-9434-47cc-a341-0404eb1c479f","year":2019},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.510789Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:a1f3f877ab6be2cbb443a24e794edc0591db4d360a030de209b49dae6d1a0540","observation_id":"e08d4ab5-fa42-4c65-8532-1f739e2125df","resolution":{"observed_at":"2026-08-06T20:17:52.865258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.518632Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.518632Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:3ecb6910b1e65ff2f91f16b95ee1e450138f4899f5f84dbe897fd64e2596478e","observation_id":"298410d9-2d7a-442d-bf00-d6040b800b6a","resolution":{"observed_at":"2026-08-06T20:17:52.518632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.524832Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.524832Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:7d1b18a0f918948418e3a8e56ad78024a68a97e9de051e53a8bf8556160ca07a","observation_id":"726bb4bf-6ffb-4e61-b727-9c0cb962bb32","resolution":{"observed_at":"2026-08-06T20:17:52.524832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.530051Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.530051Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:b2ce78c6d2c8e298694aa76d0624a0d05004aff8317efc3d0bde4254b6739a8e","observation_id":"4948da70-8cd9-4e36-9f49-48ae05895ea0","resolution":{"observed_at":"2026-08-06T20:17:52.530051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:17:52.535638Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T20:17:52.535638Z"},"links":{"citing_paper":"/paper/2507.03393"},"observation_digest":"sha256:0040006a0de341d9c5112a47f37cee30937eda42db01c15abd2da2347dff1755","observation_id":"262ac05c-78ac-4fc4-88de-ff955d5bbcd4","resolution":{"observed_at":"2026-08-06T20:17:52.535638Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.03393","last_updated":"2025-07-04T08:54:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T14:38:21.858499Z","submitted_at":"2025-07-04T08:54:59Z","title":"Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2507.03393."}