{"as_of":"2026-08-15T14:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb4a36c28209541b7b8df512877dfc6ca5c4d6bf3c7124ba4ce410cacc0d288c","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:49:08.954450Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.11621/citation-record","integrity":"/paper/2412.11621/integrity","json":"/paper/2412.11621/citation-record.json","paper":"/paper/2412.11621"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.556521Z","title":null,"venue":null,"work_id":"062bd6bf-5af9-4eeb-85da-0e9d63b814b7","year":2016},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.771367Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:e6caa393c0514c4479c16cee4feb1f3212110a14f461738a55de40893e1ce222","observation_id":"f3704557-7b7c-4f31-8cd6-39bd177236fd","resolution":{"observed_at":"2026-08-11T14:49:09.560441Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:08.775952Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.775952Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:3e909e36aa6f2717405ffedf160ee08c99bfe13e8b94951ba574520672d9d514","observation_id":"335ed295-1e65-46e1-88cc-596fc51371fc","resolution":{"observed_at":"2026-08-11T14:49:08.775952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.532746Z","title":"W.; Fidler, S.; and Kreis, K","venue":null,"work_id":"7550a363-64a5-4304-b0c0-5be93f1eb98f","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.779774Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:f239a126893d9579c3795fbc783ddc5dd366d59c1a990c025eb5670077954ef5","observation_id":"d53646f4-ed9d-48e2-9d1c-bd94b34e96ca","resolution":{"observed_at":"2026-08-11T14:49:09.536762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.521016Z","title":null,"venue":null,"work_id":"23bbc9a1-cca4-4937-a208-9607a525117a","year":2020},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.783638Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:78eae8cc9193dc9bba237fd98285ddb22da221aee8695100da82b681a43843e8","observation_id":"fc4ce99e-b9b6-439a-bbf5-690cbf334087","resolution":{"observed_at":"2026-08-11T14:49:09.524899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.508779Z","title":null,"venue":null,"work_id":"3ebe09ce-e26b-42d1-8301-3b441d0317b2","year":2020},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.787366Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:36e39d904f3c85f19ad6f5d69e1fd209cd9c1392cfe38a250b2221a69d807edb","observation_id":"69e13dbf-1d91-4e02-8842-ebf95ba1bfcf","resolution":{"observed_at":"2026-08-11T14:49:09.512793Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08769","last_updated":"2023-03-16T01:19:06Z","snapshot_observed_at":"2026-08-13T12:42:26.907427Z","submitted_at":"2023-02-17T23:25:57Z","title":"Prompting Large Language Models With the Socratic Method","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08769","snapshot_observed_at":"2026-08-11T14:49:08.791812Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.791812Z"},"links":{"cited_paper":"/paper/2303.08769","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:cb5b6f87724b06ab18d637cdbc2ad2dffed91aae83cdcecb49b33c3ffc445cae","observation_id":"f0f099a0-f06a-4b87-accf-3b84683ab146","resolution":{"observed_at":"2026-08-11T14:49:08.791812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.498043Z","title":"M.; and Cardie, C","venue":null,"work_id":"36fdf8bc-b59b-45c7-bf55-dd1da5d98785","year":2021},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.796874Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:e998336465b663684aac332d6af64371e6420bd62ea0e6b8a412c956b96e7412","observation_id":"a090152c-e966-4ce8-8258-ab4665fec9f4","resolution":{"observed_at":"2026-08-11T14:49:09.501437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.487193Z","title":"G.; Wildes, R","venue":null,"work_id":"fe45eaaf-9735-4b37-a9ab-d87f43c27b74","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.800722Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:fc3f2cf6f8ccebcbe710744347e3ea47c88b95bb7b65c16ec44235c3f3132261","observation_id":"f6d5fc53-e486-42f4-8cf6-11c77dc60bc4","resolution":{"observed_at":"2026-08-11T14:49:09.490949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.476204Z","title":null,"venue":null,"work_id":"86515ad7-73c1-4ca0-bf05-7763b722fe81","year":2019},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.804970Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:504d277f9635bdd79fdbf74808510f5bedb819d6be2a4ea1f7bdf62f4f0f9ec9","observation_id":"42092e8e-5e8b-40ae-a81d-9e27fd1ec5f3","resolution":{"observed_at":"2026-08-11T14:49:09.479735Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07409","last_updated":"2023-09-14T03:25:37Z","snapshot_observed_at":"2026-08-13T10:14:00.856545Z","submitted_at":"2023-09-14T03:25:37Z","title":"Masked Diffusion with Task-awareness for Procedure Planning in Instructional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07409","snapshot_observed_at":"2026-08-11T14:49:08.808773Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.808773Z"},"links":{"cited_paper":"/paper/2309.07409","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:7ecce9983a1bd2b540798c9d3e69ca936d847c98ff7289e9b234e6a2c60d3e93","observation_id":"95726092-4085-4a18-8bf5-f65d9fe42131","resolution":{"observed_at":"2026-08-11T14:49:08.808773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.463830Z","title":null,"venue":null,"work_id":"4d4d0f46-1690-441f-a5fd-9edbc2ab7056","year":2022},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.813282Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:a14ebeedcd70d0e503812c50b8b9a9bfc1400fa10537124d47c1331eb8a2670f","observation_id":"d32aa3d6-7551-4f38-b0ec-450175a8d828","resolution":{"observed_at":"2026-08-11T14:49:09.467848Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.449850Z","title":"F.; Song, C.; Chen, J.; Gao, D.; Lei, W.; Xu, Q.; Lim, J.; and Shou, M","venue":null,"work_id":"a351aad9-4548-43e8-a85a-9e6d39e94c9d","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.817561Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:083f0b2f5df78e65569fa3425880eba6ffd26cc4eb249f9b3f3b44b0c2a2b133","observation_id":"bbb01c25-d681-4ccf-b080-b6caf2b07682","resolution":{"observed_at":"2026-08-11T14:49:09.454996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T14:49:08.821527Z","title":"Q.; Sablayrolles, A.; Mensch, A.; Bamford, C.; Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.821527Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:53179a33092b8df791794ae976324f0341674546c6bed4aa44b7b54c83d596a9","observation_id":"149f6b9a-9f9f-42e0-b150-3b4cc7aab241","resolution":{"observed_at":"2026-08-11T14:49:08.821527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.434451Z","title":null,"venue":null,"work_id":"7bb193e4-61fa-4293-bd1c-381fc8f81c35","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.825759Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:abb3de8e6f307a17b6b28a6ba105376a9f5e707b5a99157fb7b184adc1521b4c","observation_id":"04983b0e-a886-42a0-8d35-e1aeba6aec35","resolution":{"observed_at":"2026-08-11T14:49:09.439353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.420814Z","title":"S.; Reid, M.; Matsuo, Y.; and Iwasawa, Y","venue":null,"work_id":"968efbb3-dde4-40c4-be4a-6957aacbdaba","year":2022},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.829227Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:8eb3ead7c4ad6a3365c5952b60c52df0895d72879a97cf0e5e1b675dc424ff4e","observation_id":"74f526f3-895a-4219-895c-7e73c1c056af","resolution":{"observed_at":"2026-08-11T14:49:09.424290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.409050Z","title":"B.; and Serre, T","venue":null,"work_id":"e4d2872c-87cf-47dd-9531-f3c69051e258","year":2014},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.832764Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:1cfce8ee50939c8fff45dfb1bb90773cc7c58b26d54423508532d643f2a9a839","observation_id":"033db58e-43ba-42b5-9e20-57cec483aad4","resolution":{"observed_at":"2026-08-11T14:49:09.412834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.397019Z","title":null,"venue":null,"work_id":"ee3d730f-4752-445f-b76d-538abd6b866f","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.836447Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:04c0db580ca489e0a8b6f4324f6858a48bc7955a352f863b3bac05c7e58c8d45","observation_id":"c790b25b-f0cb-4854-9dfb-80459f26cf61","resolution":{"observed_at":"2026-08-11T14:49:09.400947Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17444","last_updated":"2024-05-04T19:28:10Z","snapshot_observed_at":"2026-08-13T10:01:55.605067Z","submitted_at":"2023-09-29T17:54:46Z","title":"LLM-grounded Video Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17444","snapshot_observed_at":"2026-08-11T14:49:08.840008Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.840008Z"},"links":{"cited_paper":"/paper/2309.17444","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:a9acd5087f78af0af1c1c068b2dc16ac7c5b67b8d3be16eace001a867f3ce0fc","observation_id":"545c1ac0-e76b-4f31-9eb4-25ccb4cc5f66","resolution":{"observed_at":"2026-08-11T14:49:08.840008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15091","last_updated":"2024-07-12T18:03:29Z","snapshot_observed_at":"2026-08-15T10:22:29.321993Z","submitted_at":"2023-09-26T17:36:26Z","title":"VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15091","snapshot_observed_at":"2026-08-11T14:49:08.843675Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.843675Z"},"links":{"cited_paper":"/paper/2309.15091","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:eea884397716987db6b9085af4001d624ec34045c3f4fd1f6750845adb5bf977","observation_id":"00aa1965-8e9b-4a68-bbe8-4f771952e744","resolution":{"observed_at":"2026-08-11T14:49:08.843675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.383116Z","title":"Q.; and Lei, S","venue":null,"work_id":"daf39139-a60a-4bf4-b999-07369098a50d","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.847944Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:ece6e784ee68f433d4772218115481503a4c50665d55d945708f56d533c72afe","observation_id":"24affb3b-56d8-43e6-a6a7-830cf003d20b","resolution":{"observed_at":"2026-08-11T14:49:09.388594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.369711Z","title":"E.; Eckstein, M","venue":null,"work_id":"cea0b592-9e50-47b8-b7b4-dda0f96c94c2","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.851942Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:c146b06551cbf380763afabc49b9a5ba6e5e78b5935924bc9f1c4109d02ef60b","observation_id":"7b76ba1a-ecfa-401e-89e3-b9798d9a14b0","resolution":{"observed_at":"2026-08-11T14:49:09.374221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01795","last_updated":"2023-05-02T21:46:44Z","snapshot_observed_at":"2026-08-13T11:50:27.708011Z","submitted_at":"2023-05-02T21:46:44Z","title":"Multimodal Procedural Planning via Dual Text-Image Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01795","snapshot_observed_at":"2026-08-11T14:49:08.856049Z","title":"E.; and Wang, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.856049Z"},"links":{"cited_paper":"/paper/2305.01795","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:133f0dd5e46cb20c752e8013933bcc36033693158d78b80d595b422e1173ebd6","observation_id":"62fe9c8b-9799-4a95-8852-8ef2bc278224","resolution":{"observed_at":"2026-08-11T14:49:08.856049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.355551Z","title":null,"venue":null,"work_id":"9599028c-5aa8-4ad8-a3eb-87f1cb72da4c","year":2019},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.860635Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:b078e4317a88756c2374f9ca2316f381e83b259cd59a0fa12ac66f55d2f9715c","observation_id":"376e6aa1-4f9b-4510-aa98-6c91b535c724","resolution":{"observed_at":"2026-08-11T14:49:09.359713Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.343060Z","title":null,"venue":null,"work_id":"2afe552d-59ff-43dc-968d-78e54798c1d7","year":2024},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.864619Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:dd77d46059b23266001f4b27315f0370e4325eafb4b4cbabcead705dfc2bb7a3","observation_id":"ea943d56-b61a-41b4-951f-c5ab3e59e352","resolution":{"observed_at":"2026-08-11T14:49:09.346541Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T14:49:08.868882Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.868882Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:33d144570f965791173b8c4ff8d603ee199352b218474689a4b0d7489110f06a","observation_id":"4ec25088-2703-44a6-bcba-f3cfc7e71df8","resolution":{"observed_at":"2026-08-11T14:49:08.868882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:08.872878Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.872878Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:d5d75febba29d214828d62adab700dbfab47971b683b60ac58cdc57f30269ecd","observation_id":"94ae40cd-cc7f-4ce5-b8a7-c7dbc941ceab","resolution":{"observed_at":"2026-08-11T14:49:08.872878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.325009Z","title":"W.; Xu, T.; Brockman, G.; McLeavey, C.; and Sutskever, I","venue":null,"work_id":"db6424d0-de8d-4719-ada8-07967a92d217","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.877444Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:e98d2de7d8dc442ca74ba8dd5edfea6bc4a362976e3f2715823060b275e61f0c","observation_id":"7c8f02b2-111a-42ec-bdf7-73e276cba1c2","resolution":{"observed_at":"2026-08-11T14:49:09.328255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.314438Z","title":null,"venue":null,"work_id":"d1c3c0ae-fdc9-47e7-9c6b-45f6102ca8db","year":2021},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.881421Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:198e86d3845214300a0e9b8abe1adc994dc15a380b390ad91f0a4b016bfba948","observation_id":"80bbef9c-ece4-43e5-9016-23f1f6c5d06e","resolution":{"observed_at":"2026-08-11T14:49:09.317989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.302737Z","title":null,"venue":null,"work_id":"00fb3e8a-9562-4672-9e08-04f5d2adb049","year":2021},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.884976Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:842aa0eaf45815b917cb299160d80399d4a0324fd9e5966b4377b2bbededfbae","observation_id":"14ecd0dd-a6f4-472e-961b-460215eba19a","resolution":{"observed_at":"2026-08-11T14:49:09.306590Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.291089Z","title":null,"venue":null,"work_id":"2b68d33d-5945-4fbb-a9fe-3aa9eeb3ec36","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.888324Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:4d2798ba545290dae2de4cd65422a3a4a91f3bd4923c48f27993045e5918a724","observation_id":"23b1f492-326d-4dd8-b1b0-c5a864c906f6","resolution":{"observed_at":"2026-08-11T14:49:09.295544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.279275Z","title":"H.; Sadler, B","venue":null,"work_id":"01ce0a5a-3c06-4f80-bf85-7ac40461d61f","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.891605Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:2a74e167d6799ea0e1287fe0ed8a13a045b368e92b9ec6c243482a800b0af4e1","observation_id":"598ba009-f5cd-4530-8272-9e2c58842eb2","resolution":{"observed_at":"2026-08-11T14:49:09.283311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.266502Z","title":null,"venue":null,"work_id":"a450cdb4-3adc-4dbf-be51-c2c4a7de21cd","year":2024},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.895322Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:8b83e1ba6bbe40519bc6e8ccfe0c8d35674f907d448931bbb8804fc65078b099","observation_id":"5c6ef65e-f41b-4872-84ed-b9c6a83fd178","resolution":{"observed_at":"2026-08-11T14:49:09.270981Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.254413Z","title":null,"venue":null,"work_id":"e47ee852-495a-4d95-ae57-0cba8e6c36a7","year":2019},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.899103Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:127ac01ba7959f42f4386f11a062003ae635952c3f668c0e8714be65626f70c4","observation_id":"9124f636-ed3c-4f6e-ba19-9b26190776b6","resolution":{"observed_at":"2026-08-11T14:49:09.258180Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T14:49:08.902451Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.902451Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:e90ba0b0b3af158f35d120cd3341965f151b9bd3bb12da34f852d218a1133a8f","observation_id":"dd4fa7a6-4250-42e6-ac1d-289d73622c29","resolution":{"observed_at":"2026-08-11T14:49:08.902451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.241279Z","title":null,"venue":null,"work_id":"50b8b07b-aa46-417a-a64b-98deb8f1852b","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.905627Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:731602ca24479f1f12a58df8da3f3eb4475429d0a908779ac59de5f17ec46595","observation_id":"fc121910-51f0-486a-a7f3-67ca2a509bc0","resolution":{"observed_at":"2026-08-11T14:49:09.244619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-14T13:59:50.878772Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-11T14:49:08.909066Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.909066Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:a7e41dad1fa82fb509e2188e15624fd4ecfc1f915b2d7d454f84557b1f5a1fa4","observation_id":"263817a5-8948-426c-bbda-94e44b92593e","resolution":{"observed_at":"2026-08-11T14:49:08.909066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.229267Z","title":"Z.; Ge, Y.; Wang, X.; Lei, S","venue":null,"work_id":"cda7c9e1-398f-4503-b320-4698a3ad2cb5","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.912657Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:58e2ab5cec7ee0c58f5eaaf706f72ff0a374759e5726bb5ae59e36a576c93a16","observation_id":"2deac228-7cb7-4aa9-9c5f-88a36854967d","resolution":{"observed_at":"2026-08-11T14:49:09.233322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.215022Z","title":"H.; Miech, A.; Pont - Tuset, J.; Laptev, I.; Sivic, J.; and Schmid, C","venue":null,"work_id":"e3449b93-22c6-4e82-a848-6110010e33fb","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.915869Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:7363b75ef3373670df18463cb5016034fc4edeb27fd1b313062f3e71d319be12","observation_id":"3a5dc640-8b66-4a9b-a0ea-dc86b1d8a70f","resolution":{"observed_at":"2026-08-11T14:49:09.220251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.202440Z","title":null,"venue":null,"work_id":"69596414-b266-4343-ac2d-bbbb3a921bda","year":2022},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.919591Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:b47012665c1b8749620592bcd31033c31b3ded7e5534478aec3cb5dc2a0b342c","observation_id":"39972daa-76e7-4027-bbe8-784006803196","resolution":{"observed_at":"2026-08-11T14:49:09.206886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-11T14:49:08.923237Z","title":"B.; Versari, L.; Sohn, K.; Minnen, D.; Cheng, Y.; Gupta, A.; Gu, X.; Hauptmann, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.923237Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:ff77d79a053adf60c767fded8d5a52ee1b6aa97e8acc31f32dc63361c03b729f","observation_id":"784b6a82-36b1-4ffe-9c22-1619ecd18db8","resolution":{"observed_at":"2026-08-11T14:49:08.923237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.189157Z","title":"G.; Wildes, R","venue":null,"work_id":"4357e253-b685-483b-aae4-457aa6d153b5","year":2022},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.927426Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:680975b0c26615e0dd648e86840f46d2ee4463156e26247fe842bd784999d537","observation_id":"c17ebd86-dcb9-49a2-8308-8f94be3ee6bc","resolution":{"observed_at":"2026-08-11T14:49:09.193535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-11T14:49:08.931033Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.931033Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:a1248b437708762e19f872c2d11de4ff1240f5ff9945a79981ead7401c1e07ad","observation_id":"9820123e-4482-43f6-bbaf-d247a33215a4","resolution":{"observed_at":"2026-08-11T14:49:08.931033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.176711Z","title":null,"venue":null,"work_id":"59768bf9-1eba-4a52-a696-e5946765af48","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.935214Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:05a5f46f2a0f4fdc3d7c09f599177a082931c1c50bf8e170fdc9ba4b9f526918","observation_id":"10658eb0-4a2c-472f-9925-e6ed54ea9942","resolution":{"observed_at":"2026-08-11T14:49:09.180515Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.163391Z","title":null,"venue":null,"work_id":"7d2b53aa-13e5-4d89-9248-74cf8e4f3b38","year":2018},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.938944Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:db8a2d6d05e85d1ddc816d48303301422bdd5b0177e08914b1e8d8a74f049431","observation_id":"6dcd6dfa-435f-49f7-aabc-98b375f1bcb8","resolution":{"observed_at":"2026-08-11T14:49:09.167551Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.149727Z","title":null,"venue":null,"work_id":"00f07207-d8e3-4da6-9523-20d639f80a8f","year":2020},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.942721Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:b6fd3e2d63863df1e525e2fff3eddb2dea8a2d82e1c51d7efcd58c5cea7331be","observation_id":"1e4c5177-b20d-49d4-92e9-a7b8df3ffaf0","resolution":{"observed_at":"2026-08-11T14:49:09.154446Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.135370Z","title":"G.; Fouhey, D","venue":null,"work_id":"4bcd8264-98ca-42a0-8092-9ad9285b8fc9","year":2019},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.946423Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:791a4682af14e1f5f9a7af8df4eabbfa937fa6c0115cb7548f53517693140148","observation_id":"ad2dbf87-0579-46ce-bd2d-1804976dbdf5","resolution":{"observed_at":"2026-08-11T14:49:09.140752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:08.950286Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.950286Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:1d2a93c90cb16d03721cb2bc7ead550d1238299c1f8d8fe6fd3465949645093f","observation_id":"63549908-fe39-45f7-ae68-14993bd8d06a","resolution":{"observed_at":"2026-08-11T14:49:08.950286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:08.954450Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.954450Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:d8412ac3040a32612ac66cf85eb8fb46713a70a4ecce41056fd5025cce1e7423","observation_id":"b0daf325-8131-4ca7-8b22-a331bb7f1e31","resolution":{"observed_at":"2026-08-11T14:49:08.954450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T00:16:36.679699Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2412.11621."}