{"as_of":"2026-08-16T20:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f3b226633e8b8630998dded351c742aaafcb370d6af38ec3758a104637ef9ca","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:00:48.182756Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T15:42:41.363422Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T15:42:41.510492Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"cited_work":{"arxiv_id":"2505.08444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.08444","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Symbolically-guided visual plan inference from uncurated video data","venue":null,"work_id":"403b2f55-a4f8-4e07-990f-0f26ad96564b","year":2025},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2505.08444","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:b701386bfecbee1d6d99c2f022504b40a1b44f2e631f29c1d632df8a1c42768a","observation_id":"ec162aea-6d77-4f74-8740-ada7e37229fd","resolution":{"observed_at":"2026-05-16T15:42:41.512351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.08444/citation-record","integrity":"/paper/2505.08444/integrity","json":"/paper/2505.08444/citation-record.json","paper":"/paper/2505.08444"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.08576","last_updated":"2023-10-12T17:59:23Z","snapshot_observed_at":"2026-08-16T14:52:35.031233Z","submitted_at":"2023-10-12T17:59:23Z","title":"Learning to Act from Actionless Videos through Dense Correspondences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08576","snapshot_observed_at":"2026-08-15T22:00:47.699756Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.699756Z"},"links":{"cited_paper":"/paper/2310.08576","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:9ef05ddc081baafc3f870fa920360aca38b1151df63f5fd12f4171664f5ea98e","observation_id":"b8897fac-a6c5-40f3-9052-f5c1bb2b644f","resolution":{"observed_at":"2026-08-15T22:00:47.699756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01103","last_updated":"2024-06-03T23:30:33Z","snapshot_observed_at":"2026-08-16T14:22:17.753998Z","submitted_at":"2024-02-02T02:40:51Z","title":"Compositional Generative Modeling: A Single Model is Not All You Need","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01103","snapshot_observed_at":"2026-08-15T22:00:47.706292Z","title":"Du and L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.706292Z"},"links":{"cited_paper":"/paper/2402.01103","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:659802734a24e890a53cc5f727f00ed4c569114d1a1e3e16b4d5101983d80e36","observation_id":"8406e470-f6b7-41a8-a1bf-e046cc2009a2","resolution":{"observed_at":"2026-08-15T22:00:47.706292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:47.711659Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.711659Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:1a9eaf98e8aecc1440507d736cf936b5469e18639a4d2f5ce56a353ae7898ef6","observation_id":"b9a72b90-01fb-43df-a642-a122d5a717c7","resolution":{"observed_at":"2026-08-15T22:00:47.711659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18072","last_updated":"2024-10-23T17:56:11Z","snapshot_observed_at":"2026-08-16T13:06:31.854495Z","submitted_at":"2024-10-23T17:56:11Z","title":"WorldSimBench: Towards Video Generation Models as World Simulators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18072","snapshot_observed_at":"2026-08-15T22:00:47.716454Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.716454Z"},"links":{"cited_paper":"/paper/2410.18072","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:243a373e7737a10fd052470d76429c79aaa74b012c0459f1bb8ea6af69c3cc76","observation_id":"e20c3197-28ba-4c4e-842b-03b4af548b5f","resolution":{"observed_at":"2026-08-15T22:00:47.716454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03825","last_updated":"2022-10-07T21:27:16Z","snapshot_observed_at":"2026-08-16T16:25:59.886427Z","submitted_at":"2022-10-07T21:27:16Z","title":"See, Plan, Predict: Language-guided Cognitive Planning with Video Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03825","snapshot_observed_at":"2026-08-15T22:00:47.721856Z","title":"Attarian, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.721856Z"},"links":{"cited_paper":"/paper/2210.03825","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:57e9285080f5f97edc479723075f21d32587dfb02aedb29c7b8e9762b947f770","observation_id":"a32c2573-8bbe-4ae8-ab85-2592bca59d30","resolution":{"observed_at":"2026-08-15T22:00:47.721856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:47.727154Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.727154Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:9caff35694458a847e023b0c8aeddc1c01689a1adda0f305fe7ab68aab30d8b6","observation_id":"1cad1ec6-808c-4cb2-a3d4-7c85b027c902","resolution":{"observed_at":"2026-08-15T22:00:47.727154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-08-13T21:27:22.538668Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-08-15T22:00:47.731947Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.731947Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:189aa2242172f2245b2ee15c5fe4eab45d1c4a1350225d45e3c2cbeee1791b5c","observation_id":"bd787fd1-6d96-437a-90c1-d4e7154e988d","resolution":{"observed_at":"2026-08-15T22:00:47.731947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06465","last_updated":"2024-06-10T17:02:08Z","snapshot_observed_at":"2026-08-16T13:44:28.228457Z","submitted_at":"2024-06-10T17:02:08Z","title":"AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06465","snapshot_observed_at":"2026-08-15T22:00:47.737612Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.737612Z"},"links":{"cited_paper":"/paper/2406.06465","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:d258ed782d39bf6ff8341a166b420cbee21cb24b3738f687e2ce3be75bb23465","observation_id":"d65a51ce-ee68-48bd-a014-fec77fa44f98","resolution":{"observed_at":"2026-08-15T22:00:47.737612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:47.748043Z","title":"Favero, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.748043Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:940320054721ee70e790aac590890e82b6bea7aa48380d0658aa97093140a28c","observation_id":"f5321015-d32e-410a-9264-18d2eb39be6f","resolution":{"observed_at":"2026-08-15T22:00:47.748043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04023","last_updated":"2023-11-28T09:01:12Z","snapshot_observed_at":"2026-08-07T14:17:12.140094Z","submitted_at":"2023-02-08T12:35:34Z","title":"A Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04023","snapshot_observed_at":"2026-08-15T22:00:47.752711Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.752711Z"},"links":{"cited_paper":"/paper/2302.04023","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:09f2a266d8509c1e9bd7144b638cdc1bd40d3e9081ca881b75c95320a5db5817","observation_id":"6550f760-de29-4d86-8373-33da39a8ecfc","resolution":{"observed_at":"2026-08-15T22:00:47.752711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:47.757739Z","title":"Mei, G.-N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.757739Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:11b0fb4fff3ccca3b1c6ba351c2b57b855ad8a711ceaffa1886d4038a11d304d","observation_id":"40358cc9-1a55-4527-9295-c1c77ddec30f","resolution":{"observed_at":"2026-08-15T22:00:47.757739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:47.767161Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.767161Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:ff697ff297a6fae36bb97d66a35e2e63601fc1fef416cc07f6a61939382dc370","observation_id":"5ed02ed6-d8a3-400f-a491-0781990d6fe4","resolution":{"observed_at":"2026-08-15T22:00:47.767161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:47.771926Z","title":"Sermanet, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.771926Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:cb150a48d3caae7c628016b218e2c18bcff74267c8a22b31671fe1665ef3aca2","observation_id":"42151bdc-4bbc-4728-9a72-d4c4a0aaeb10","resolution":{"observed_at":"2026-08-15T22:00:47.771926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:47.776378Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.776378Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:44fa48e0afdb1b1da77ed6b23021d7763a651ac0ba9a69bd3cc71ef27266a49d","observation_id":"f831ef78-9b7d-448c-bcb0-f3b51227ad32","resolution":{"observed_at":"2026-08-15T22:00:47.776378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10047","last_updated":"2022-12-15T23:47:39Z","snapshot_observed_at":"2026-08-16T16:23:06.450064Z","submitted_at":"2022-10-18T17:59:55Z","title":"From Play to Policy: Conditional Behavior Generation from Uncurated Robot Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10047","snapshot_observed_at":"2026-08-15T22:00:47.780904Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.780904Z"},"links":{"cited_paper":"/paper/2210.10047","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:c23e397f41e7c3d3601c0f18c63f5acbccffef2620ca3a3f5c1839f26c4ca4f1","observation_id":"861f79cf-957f-4a2b-804e-7963a29fc678","resolution":{"observed_at":"2026-08-15T22:00:47.780904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:47.786253Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.786253Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:66b4cf80b2b2b04d1b69041bcf3fd5c94c7a6a72bdd1bd7ddaa15d23a52d47d9","observation_id":"8e6718b9-4579-4463-a2f4-a47d1cab1608","resolution":{"observed_at":"2026-08-15T22:00:47.786253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.980970Z","title":"Lynch, M","venue":null,"work_id":"d890e7d0-a25a-484b-8001-9d4cdaa08872","year":2020},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.790982Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:e9b320e68370f8f9891a3474d6a0970541c7da0a7a02ed621bb50564cd04025d","observation_id":"a5417e87-09e1-4be9-9d65-9a6727a59006","resolution":{"observed_at":"2026-08-15T22:00:49.985883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:47.795755Z","title":"Rosete-Beas, O","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.795755Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:75aab2d59744762d22967b452ac377f1d53a13e73b8307a948cb37c2514dd8b5","observation_id":"0b2b4b78-1814-45c8-8869-602d3443892b","resolution":{"observed_at":"2026-08-15T22:00:47.795755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.965824Z","title":null,"venue":null,"work_id":"76967f33-5ca9-4fa9-b9ac-177e8c3420d1","year":2023},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.800686Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:bb72942cf76492c95db1a9227829f5146814a15b5288915b855abeb3856ff9f9","observation_id":"91ce6116-d60a-4bfd-9bbb-2852d8df089e","resolution":{"observed_at":"2026-08-15T22:00:49.970514Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17772","last_updated":"2024-10-26T07:39:56Z","snapshot_observed_at":"2026-08-16T13:06:39.994322Z","submitted_at":"2024-10-23T11:19:48Z","title":"Scaling Robot Policy Learning via Zero-Shot Labeling with Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17772","snapshot_observed_at":"2026-08-15T22:00:47.805523Z","title":"Blank, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.805523Z"},"links":{"cited_paper":"/paper/2410.17772","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:8ef174b77c518ae85f2d996ae079458612ef2bc08f79404ee71730584d6f1616","observation_id":"3926f1e5-cb6a-48ad-a24e-5a28e7e74117","resolution":{"observed_at":"2026-08-15T22:00:47.805523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:47.810371Z","title":"Athalye, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.810371Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:efd6f9fdd28103d216b59e77ac40dfba11c1f5fb5cb31e585961871faf2872aa","observation_id":"8f1f79db-37f1-4c71-a472-331d60d7bbc7","resolution":{"observed_at":"2026-08-15T22:00:47.810371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:47.815183Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.815183Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:f268c40595bacc80ea406a4dca85769690f0f6e3e6d7d30d86c4af3724836e2f","observation_id":"0ebd9998-e7a7-44c6-96f7-c7f6024cf704","resolution":{"observed_at":"2026-08-15T22:00:47.815183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.950625Z","title":"Konidaris, L","venue":null,"work_id":"c1ed6545-6e8d-4ce1-90e1-e5d7af687568","year":2018},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.825218Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:9d03236f870993cc5758ab3753cd16f5bd61693428de25374cf3429317ec3735","observation_id":"7928837b-9c4a-4cf5-b84e-7151fb7a228c","resolution":{"observed_at":"2026-08-15T22:00:49.955397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.933757Z","title":"Grounds and D","venue":null,"work_id":"6991a8b4-7469-414d-81ee-1a453833ff36","year":2005},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.830055Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:4ba7cec11d981063daab2422214c31323036878d40239d95ab181e5b30991070","observation_id":"5d5434dc-0e16-4c89-afc8-15287fd45d10","resolution":{"observed_at":"2026-08-15T22:00:49.939048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.918408Z","title":null,"venue":null,"work_id":"ac471257-0881-493b-8d9a-793a2a58c2d8","year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.835282Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:63543a3bd997104b16e750dcee3aebd82adf4767cd646133401d0c5d0271d794","observation_id":"b61c1304-70bd-414f-b926-bbd408b02f02","resolution":{"observed_at":"2026-08-15T22:00:49.923053Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.903515Z","title":null,"venue":null,"work_id":"4ea8e3f9-727a-4bee-ad89-5244d676765e","year":1988},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.840373Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:ff6a560a1e89482649e78f96d01dd0cdfb24b486cb4313e4eeb559b036cd3e54","observation_id":"9f1f577f-a6a6-4578-a314-e69726499369","resolution":{"observed_at":"2026-08-15T22:00:49.908147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.886167Z","title":null,"venue":null,"work_id":"65ba95ae-da4c-4c7d-b832-136ef0166b8c","year":2011},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.845180Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:8d21cd5709d6ef4db10d613ee7da9c09859b1b0baf0866944ed2419126d26111","observation_id":"b08c14af-0371-443b-b8ef-96d051aada06","resolution":{"observed_at":"2026-08-15T22:00:49.891697Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.870337Z","title":"Aeronautiques, A","venue":null,"work_id":"65e840f5-cf87-48da-a168-5c60d6ab0f9d","year":1998},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.849784Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:abb9e9f4558b237334d024c4051e0484b03adc518ebda5406c464b429d24a390","observation_id":"528ac371-9c50-4e22-847a-19fa24c3b736","resolution":{"observed_at":"2026-08-15T22:00:49.875447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.854979Z","title":"Ahmetoglu, M","venue":null,"work_id":"bde8bf49-40c4-4e6f-9027-e4c504c79d20","year":2022},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.865296Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:21ce7fde053de9f49bf164d437b160c148477fbb40391fbb724a691af64cc78e","observation_id":"0bf8ba1e-b8f8-46c9-9c87-0ec6fea831b4","resolution":{"observed_at":"2026-08-15T22:00:49.859908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.839522Z","title":"James, B","venue":null,"work_id":"17259d3f-31a1-49f2-a928-48c6c33fcb9a","year":2022},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.870107Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:317ac2d9aadf23fc76b1882de19a4ec83857045df6dcc5b235e4edcdba838e4e","observation_id":"3dbb8cc6-cde6-4ebc-92c0-4b9274afc09f","resolution":{"observed_at":"2026-08-15T22:00:49.844217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.824253Z","title":"Cheng and D","venue":null,"work_id":"ef6eae82-4498-4902-a2f2-d0b083e31ed5","year":2022},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.874848Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:6a4bea797f5b18dce3a536302efe319d0814f7cc59243a179cf87b313ed77261","observation_id":"9398009d-67a2-4921-a6b6-9fe6e463ff34","resolution":{"observed_at":"2026-08-15T22:00:49.829180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.808931Z","title":"Asai and A","venue":null,"work_id":"5b31b784-f525-4102-ae5c-be1a624006d7","year":2018},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.880026Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:b818cc78f1f5c51249041281c47d532a09224d33c6302dd05f43cc95a02a6174","observation_id":"98789cbe-86aa-42d5-b2bf-98df88f5a13d","resolution":{"observed_at":"2026-08-15T22:00:49.814061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.793649Z","title":"Asai and A","venue":null,"work_id":"6db587ce-7966-4cc4-9f0c-8a3ed21b799c","year":2017},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.884933Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:2ba8b74f6ea72df0f16435af0bb4347f020b3dfbcbabf8bb5e542bd327ecc4d6","observation_id":"57ccec24-5395-484b-bc67-86f5cce0ad49","resolution":{"observed_at":"2026-08-15T22:00:49.798566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.778214Z","title":null,"venue":null,"work_id":"7dc76889-5f65-47c7-95ff-d3ba8b92b889","year":2022},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.889899Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:b2b7d716ccb4ac45a313f0e0961efdd9a7268aa8af96ce239ce2ff9d532c1a3c","observation_id":"547df49e-41d0-4bb6-892d-4f15bffb44c7","resolution":{"observed_at":"2026-08-15T22:00:49.783209Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.762245Z","title":"Chitnis, T","venue":null,"work_id":"c689b736-1e4f-49e0-95c3-5f5498882247","year":2022},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.894951Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:d76e3d2ce111fc3893210b01db9a5646668d974dc3ddf2d1bcea369dfae66c01","observation_id":"f0f414af-ea1f-461a-b565-5d357e4983a1","resolution":{"observed_at":"2026-08-15T22:00:49.767095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18201","last_updated":"2024-11-27T10:26:14Z","snapshot_observed_at":"2026-08-16T18:07:05.633009Z","submitted_at":"2024-11-27T10:26:14Z","title":"Learning for Long-Horizon Planning via Neuro-Symbolic Abductive Imitation","version":1},"cited_work":{"arxiv_id":"2411.18201","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18201","snapshot_observed_at":"2026-08-15T22:00:48.878701Z","title":"Learning for Long-Horizon Planning via Neuro-Symbolic Abductive Imitation","venue":"cs.LG","work_id":"71f02474-9dd4-4c2a-b7bb-b57ce59040d2","year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.900131Z"},"links":{"cited_paper":"/paper/2411.18201","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:c739bf6e23ec838bdae8f94eee7c0012a4e2a25e4edf596697f1d4a4d63ce93a","observation_id":"1c85bbf1-3708-44a1-8b58-56f70014b3e6","resolution":{"observed_at":"2026-08-15T22:00:48.884057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.745341Z","title":"Ahmetoglu, E","venue":null,"work_id":"40648fab-6d67-4188-ae04-4957ebdf3f7b","year":2025},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.906602Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:1c6d51086214fa728860c4a80b55b0f2019d84ece98179cce63c07acc9701408","observation_id":"2491ff46-e81e-49b5-bf48-bdb799e4b7d9","resolution":{"observed_at":"2026-08-15T22:00:49.750549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23156","last_updated":"2025-02-28T19:50:42Z","snapshot_observed_at":"2026-08-16T13:04:29.334801Z","submitted_at":"2024-10-30T16:11:05Z","title":"VisualPredicator: Learning Abstract World Models with Neuro-Symbolic Predicates for Robot Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23156","snapshot_observed_at":"2026-08-15T22:00:47.911642Z","title":"Liang, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.911642Z"},"links":{"cited_paper":"/paper/2410.23156","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:397422e5d0e26afb32e6a7761a1e70f70663c016d0926b8ac7646a43764029ac","observation_id":"6940d391-efe4-4d06-95ea-b77697ec4f18","resolution":{"observed_at":"2026-08-15T22:00:47.911642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19758","last_updated":"2024-05-30T07:08:40Z","snapshot_observed_at":"2026-08-16T13:47:54.085068Z","submitted_at":"2024-05-30T07:08:40Z","title":"InterPreT: Interactive Predicate Learning from Language Feedback for Generalizable Task Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19758","snapshot_observed_at":"2026-08-15T22:00:47.917123Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.917123Z"},"links":{"cited_paper":"/paper/2405.19758","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:dbf8d22e045aa71887f51cc2cb8f9ceebedf9a485c9977c12a506a243609097c","observation_id":"ddc1091f-4c1a-4a66-8dbf-9b6c0d9e7291","resolution":{"observed_at":"2026-08-15T22:00:47.917123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.729687Z","title":null,"venue":null,"work_id":"38c883fe-dbc1-4159-98eb-3c1d088465bb","year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.922204Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:2429a3caf0083dec5a933cd02434c0e3c3a082b7a846f1e434c51764e8b611bd","observation_id":"7ec212f8-62de-41e5-8b11-81f9399469f5","resolution":{"observed_at":"2026-08-15T22:00:49.734413Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23254","last_updated":"2024-10-30T17:37:31Z","snapshot_observed_at":"2026-08-16T13:04:26.512641Z","submitted_at":"2024-10-30T17:37:31Z","title":"Keypoint Abstraction using Large Models for Object-Relative Imitation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23254","snapshot_observed_at":"2026-08-15T22:00:47.928181Z","title":"Fang, B.-R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.928181Z"},"links":{"cited_paper":"/paper/2410.23254","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:4f10b3ba96fdfaffb75222adfc27da4ee7312d553c9ac9546f20404d3ffe62af","observation_id":"93929445-72af-4972-a0e6-831e10c4ca7a","resolution":{"observed_at":"2026-08-15T22:00:47.928181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.710930Z","title":"Silver, S","venue":null,"work_id":"21a15e59-87d7-4ecb-b6a8-0efd4f7cb50e","year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.933598Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:d59c0d22eef6589aabaa663480a0df1f05c761b00bef4c58bec7aac913a091ca","observation_id":"49981dbe-2b85-4f64-a8a6-223a4c82f20f","resolution":{"observed_at":"2026-08-15T22:00:49.716021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17842","last_updated":"2023-12-24T03:48:40Z","snapshot_observed_at":"2026-08-16T14:39:09.587564Z","submitted_at":"2023-11-29T17:46:25Z","title":"Look Before You Leap: Unveiling the Power of GPT-4V in Robotic Vision-Language Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17842","snapshot_observed_at":"2026-08-15T22:00:47.939759Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.939759Z"},"links":{"cited_paper":"/paper/2311.17842","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:76c89110d316ae021c3ab9711d3262d85818cbcc751244cd99688545ec65f7f0","observation_id":"74ec949d-9c73-43ab-9f10-7cc7f2146e7e","resolution":{"observed_at":"2026-08-15T22:00:47.939759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02193","last_updated":"2024-10-03T04:14:21Z","snapshot_observed_at":"2026-08-16T13:13:06.020109Z","submitted_at":"2024-10-03T04:14:21Z","title":"Guiding Long-Horizon Task and Motion Planning with Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02193","snapshot_observed_at":"2026-08-15T22:00:47.944965Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.944965Z"},"links":{"cited_paper":"/paper/2410.02193","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:1b902c6d05fc11b554125e786f1460d94bde7315362827f0a9b470bb5c7b57ba","observation_id":"2dac3aec-562b-41ed-90f0-9a549a55924e","resolution":{"observed_at":"2026-08-15T22:00:47.944965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.693643Z","title":null,"venue":null,"work_id":"af3ba86a-1919-4ac3-9c89-bbf00ab3c3fe","year":null},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.949897Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:4246767af92891ffc2c65369f91a89738faa3b8046cf4de9d9ed178268591b8c","observation_id":"19d70268-9649-4cc3-b003-0349c6e58107","resolution":{"observed_at":"2026-08-15T22:00:49.699014Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.08981","last_updated":"2022-03-10T18:17:08Z","snapshot_observed_at":"2026-08-16T18:09:02.389927Z","submitted_at":"2021-07-19T15:56:01Z","title":"Hierarchical Few-Shot Imitation with Skill Transition Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.08981","snapshot_observed_at":"2026-08-15T22:00:47.955180Z","title":"Hakhamaneshi, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.955180Z"},"links":{"cited_paper":"/paper/2107.08981","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:ec3d043044a662d19229ff8e1fb745c4c5f1000bf109e442965d271e6ffa574a","observation_id":"cbad9554-c7d9-4679-a895-3b11be4c1276","resolution":{"observed_at":"2026-08-15T22:00:47.955180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:47.960348Z","title":"Lippi, P","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.960348Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:a6c0c54eed44f522807b680913831ae93e33eb13a2230136042fcd7cbb66642f","observation_id":"55e02693-aa3d-4771-90ac-cdb688fbd707","resolution":{"observed_at":"2026-08-15T22:00:47.960348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.677160Z","title":"Rosete-Beas, O","venue":null,"work_id":"a7d473e3-64d5-4888-b3c2-f72f5dc6f2a9","year":2023},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.964739Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:d6afb03dd37652ccd49894c4a4135974ecc260bd3a39af4c26273bb2dec2fcb4","observation_id":"d6263bfd-f2fc-412d-a17d-bb8c9dd90cc1","resolution":{"observed_at":"2026-08-15T22:00:49.682367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.657383Z","title":"Shin and Y","venue":null,"work_id":"7117b397-923b-478c-94fc-e226a23416d8","year":2023},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.969329Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:8340910e567ce744cab8f694bb4d7c2915f196e4405bf405b08060c53c58bd30","observation_id":"a74da446-4b82-4fb8-a177-3622507a0092","resolution":{"observed_at":"2026-08-15T22:00:49.664255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07933","last_updated":"2025-03-18T15:30:08Z","snapshot_observed_at":"2026-08-16T13:10:42.294092Z","submitted_at":"2024-10-10T14:00:21Z","title":"Offline Hierarchical Reinforcement Learning via Inverse Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07933","snapshot_observed_at":"2026-08-15T22:00:47.973886Z","title":"Schmidt, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.973886Z"},"links":{"cited_paper":"/paper/2410.07933","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:8d4483aabf94fc39f3f4de69c2e07c2eee43354887ed751c6dafbc16c8f3e328","observation_id":"ded9a6da-120d-4024-8232-e6b3a1acdb32","resolution":{"observed_at":"2026-08-15T22:00:47.973886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.01266","last_updated":"2019-03-12T02:06:19Z","snapshot_observed_at":"2026-08-14T18:21:40.629822Z","submitted_at":"2018-09-29T18:40:13Z","title":"Directed-Info GAIL: Learning Hierarchical Policies from Unsegmented Demonstrations using Directed Information","version":2},"cited_work":{"arxiv_id":"1810.01266","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.01266","snapshot_observed_at":"2026-08-15T22:00:48.693259Z","title":"Directed-Info GAIL: Learning Hierarchical Policies from Unsegmented Demonstrations using Directed Information","venue":"cs.LG","work_id":"dbf7b12c-cc3d-4ff2-bb4a-a3676d012fc4","year":2018},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.978962Z"},"links":{"cited_paper":"/paper/1810.01266","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:548c9d3050a5fa7a3829ef68615b6e57866ffd00fb531e9b093f0a7678ddbf81","observation_id":"965061e3-3756-4633-964b-ea4783716dab","resolution":{"observed_at":"2026-08-15T22:00:48.700822Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09513","last_updated":"2024-09-14T19:30:53Z","snapshot_observed_at":"2026-08-16T13:18:31.939658Z","submitted_at":"2024-09-14T19:30:53Z","title":"Planning Transformer: Long-Horizon Offline Reinforcement Learning with Planning Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09513","snapshot_observed_at":"2026-08-15T22:00:47.983972Z","title":"Clinton and R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.983972Z"},"links":{"cited_paper":"/paper/2409.09513","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:8e8907bcfab13e96b35f6696f81391b69cb3ae1e4d18cab6c03eac28160733b4","observation_id":"a7271087-e232-4abf-b703-d0e0a81bfe55","resolution":{"observed_at":"2026-08-15T22:00:47.983972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.638794Z","title":null,"venue":null,"work_id":"73f16f5f-1ed5-4012-8fc8-bfbb85f83349","year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.989182Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:666ec52da107252b6e84a7adf417bc647d9ee33e67a24f6360d21613852b1851","observation_id":"0074a685-ee20-4bce-aeb8-9af1158d233c","resolution":{"observed_at":"2026-08-15T22:00:49.644025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08697","last_updated":"2025-05-11T15:19:44Z","snapshot_observed_at":"2026-08-14T03:11:51.236849Z","submitted_at":"2025-02-12T18:59:56Z","title":"Bilevel Learning for Bilevel Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08697","snapshot_observed_at":"2026-08-15T22:00:47.994006Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.994006Z"},"links":{"cited_paper":"/paper/2502.08697","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:c6c6fd9497dcb1a51898c3791557a4122d238fdc66a66383eba662b59e5cf0fb","observation_id":"55c565a1-5bab-4b4d-8a9c-4fb60c351f44","resolution":{"observed_at":"2026-08-15T22:00:47.994006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.622718Z","title":null,"venue":null,"work_id":"68c86eb0-2152-416d-a315-eae4413dfcf6","year":2022},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:47.998666Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:b995b7a3a2fddf77c54d13269f1c65bd0a53c931f34c0bb62c42f3aad48a1664","observation_id":"277489ff-1372-43fe-8cc2-c0d468679d6f","resolution":{"observed_at":"2026-08-15T22:00:49.627586Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.591122Z","title":null,"venue":null,"work_id":"f3f3b870-506d-47e2-a2a7-73209ba4f0c1","year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.013532Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:ff4c701acf3ab9387289016ec465d60ce9f0ce62898ae20dc56d22716ba95c6d","observation_id":"3ad48a78-6dd1-4109-b5bc-a4c0837bc5da","resolution":{"observed_at":"2026-08-15T22:00:49.596146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.574558Z","title":"Pertsch, O","venue":null,"work_id":"9c53c751-e832-47b4-a9b3-9b98a42c73cc","year":2020},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.018382Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:f3fc649c56eb643de8c1f22958c5a2804b09b55d75fdc6cc62317b51f92f3222","observation_id":"7e67b215-37ea-4fc8-bd2e-58c1d1744e1a","resolution":{"observed_at":"2026-08-15T22:00:49.579981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.05829","last_updated":"2019-09-12T17:36:45Z","snapshot_observed_at":"2026-08-14T12:17:00.716183Z","submitted_at":"2019-09-12T17:36:45Z","title":"Hierarchical Foresight: Self-Supervised Learning of Long-Horizon Tasks via Visual Subgoal Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.05829","snapshot_observed_at":"2026-08-15T22:00:48.023342Z","title":"Nair and C","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.023342Z"},"links":{"cited_paper":"/paper/1909.05829","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:e8844fa10859e74595ffc904f49d417654a4663e2401c0b8af2dc1ff7efc2cee","observation_id":"bf011c5d-ccab-4d25-92f4-969fc48e782f","resolution":{"observed_at":"2026-08-15T22:00:48.023342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:48.028921Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.028921Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:2dd9b875987afb403dcb732ed1cb24f60297f2dee965d444635ce873af39ad3f","observation_id":"9e7f3305-7b30-4907-807a-78adf0bf1675","resolution":{"observed_at":"2026-08-15T22:00:48.028921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:48.034145Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.034145Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:d203b2c30d7b32ff4acc6de8270e77c33c32157853137a7f2a682ddf40dfc0a1","observation_id":"2bca47f3-53c1-4c01-a2e8-f3a4bffb96ba","resolution":{"observed_at":"2026-08-15T22:00:48.034145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:48.038898Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.038898Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:91c35577849e0ae585d3bab994a0e68222b4031892e3bd160c1aedf6e9556985","observation_id":"cf46eb89-bfd7-40a1-9eac-2f91148de543","resolution":{"observed_at":"2026-08-15T22:00:48.038898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.546892Z","title":null,"venue":null,"work_id":"403d59cd-1537-405e-a39f-a5d17807b321","year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.043845Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:3179cc77f48031bb4a40f9f91c2b0948684e2c3614d1eeae92aaf21f75327069","observation_id":"75189cc5-0fcc-49af-ae92-2cc7731bc121","resolution":{"observed_at":"2026-08-15T22:00:49.552435Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.530035Z","title":"Du and L","venue":null,"work_id":"520b9b45-869a-4fac-ba82-ed2f76e9b42c","year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.048651Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:8085bcd8c402fb770c679a05d3ec6b8b068d79b14c658985ff2047e844a3b669","observation_id":"6930fb2a-8846-48b1-9acb-7c8d57118a81","resolution":{"observed_at":"2026-08-15T22:00:49.535845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12422","last_updated":"2023-10-13T05:44:37Z","snapshot_observed_at":"2026-08-16T15:53:03.955730Z","submitted_at":"2023-02-24T02:54:15Z","title":"MimicPlay: Long-Horizon Imitation Learning by Watching Human Play","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12422","snapshot_observed_at":"2026-08-15T22:00:48.053549Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.053549Z"},"links":{"cited_paper":"/paper/2302.12422","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:b2fe3e2e7b96ce3d25bc6ce2848384216a5739a2a60432868b015d7dec86f709","observation_id":"fa00a71c-7fb0-4a76-ab78-c5eeab69ce28","resolution":{"observed_at":"2026-08-15T22:00:48.053549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T22:00:48.058586Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.058586Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:f332d6dbaff302cbd18e0556d580a9b58180422ce160d0454f5e02bf3846b425","observation_id":"9b105b4c-228f-4465-a560-c412c6fcc483","resolution":{"observed_at":"2026-08-15T22:00:48.058586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-15T22:00:48.063746Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.063746Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:b59265f395e8b6ffb54ca1b34d598db0157c54634f56c65070966e5bdb58cb24","observation_id":"ec510513-d8f9-4aff-a073-b4e00c2ce9d7","resolution":{"observed_at":"2026-08-15T22:00:48.063746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-15T22:00:48.069250Z","title":"Tschannen, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.069250Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:94c612ca9988bc8b11c002239cdb2ebe61380cba1ddcd7be199a4a49817f263a","observation_id":"56a3c1c1-8320-4bb4-97ef-9997745e4d66","resolution":{"observed_at":"2026-08-15T22:00:48.069250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.513840Z","title":null,"venue":null,"work_id":"c714eefe-f816-467f-ad6b-feb9767a61d1","year":2022},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.074407Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:332c8c361d96ca93f38e5201b5475c6f5efdc711abec55137ff6095eb3c94936","observation_id":"3e608586-9b28-4be9-b5c0-a5fe99ca36bb","resolution":{"observed_at":"2026-08-15T22:00:49.518933Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.07858","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:48.465972Z","title":"Palumbo, M","venue":null,"work_id":"06fd8002-6690-460b-9f3d-da4a9d46033a","year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.079485Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:deac119f6fac6834af20e680c795a910d2688539102f709784e4a972d935550e","observation_id":"811b9e12-8529-4787-90e0-a7cc38ce0c3d","resolution":{"observed_at":"2026-08-15T22:00:48.476848Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17896","last_updated":"2023-11-09T14:44:19Z","snapshot_observed_at":"2026-08-16T15:43:50.632223Z","submitted_at":"2023-03-31T08:56:29Z","title":"Exploring the Limits of Deep Image Clustering using Pretrained Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17896","snapshot_observed_at":"2026-08-15T22:00:48.084166Z","title":"Adaloglou, F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.084166Z"},"links":{"cited_paper":"/paper/2303.17896","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:717b12c3e7c50e10f77d41c941f2902328068e1064c7cf7dc324b175685581a5","observation_id":"24ba6de6-700a-423b-b84c-3fb0a2609123","resolution":{"observed_at":"2026-08-15T22:00:48.084166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07236","last_updated":"2024-06-11T13:14:04Z","snapshot_observed_at":"2026-08-16T13:44:11.314037Z","submitted_at":"2024-06-11T13:14:04Z","title":"Let Go of Your Labels with Unsupervised Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07236","snapshot_observed_at":"2026-08-15T22:00:48.089097Z","title":"Gadetsky, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.089097Z"},"links":{"cited_paper":"/paper/2406.07236","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:a007a9e919ec3884824e8a481e0902a069b4a38f7df6eab163387b48f6666a6b","observation_id":"c060c381-5cd8-4914-852f-b2faaa58414a","resolution":{"observed_at":"2026-08-15T22:00:48.089097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.495850Z","title":"Walter, K","venue":null,"work_id":"1d1f374a-2104-4636-a83a-c6cb819b91f0","year":2008},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.094187Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:e973509fa8f8a640673bb107a09f883832fecafd2d24e079af096263e0ecbb64","observation_id":"736c7a85-871f-41d8-bd2d-4b34de487150","resolution":{"observed_at":"2026-08-15T22:00:49.501432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:48.099189Z","title":null,"venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.099189Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:1237dbc4226a79871419a7bab5da235501ce9233bd4bfdaacb62f8af2b9de3eb","observation_id":"3753507f-75c2-480a-bc2a-d486011d49b6","resolution":{"observed_at":"2026-08-15T22:00:48.099189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.468805Z","title":"Aineto, S","venue":null,"work_id":"18a8c7dc-0bbd-4316-ac77-5de904d4601f","year":2018},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.104221Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:2de781e08faf11ffbba1b3270aecc08c200226e8a12435a23c753b341be03eb4","observation_id":"712ddb00-57d8-4959-a85b-06cdf7d20be7","resolution":{"observed_at":"2026-08-15T22:00:49.473927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.450830Z","title":"Silver, R","venue":null,"work_id":"5e3e4d46-6725-4549-86b6-cded1d925ced","year":2021},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.109192Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:9df3ef129916e5c4b2bdbc998132714f096f7c9aaff190e474886e5edeafe649","observation_id":"db6266c9-c341-4f6a-ad1c-ac5676fc918a","resolution":{"observed_at":"2026-08-15T22:00:49.456964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.430650Z","title":"Sliwowski and D","venue":null,"work_id":"72c2994d-33b9-4853-8391-b0655a1bc6f1","year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.114534Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:c45eff419523ee671d515936e63f376850a822f298fbdddb949f61dc3b3c5332","observation_id":"88e59254-de39-4363-90c6-277d4d436ef4","resolution":{"observed_at":"2026-08-15T22:00:49.435944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.410568Z","title":"Eysenbach, T","venue":null,"work_id":"1acf184c-1c60-4917-95eb-b03eb21ff444","year":2022},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.119626Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:4238408073b25b6ac9131aadc7cb4fb107be173615db278ceb0f129753881172","observation_id":"e179cd8d-3f07-46a0-a120-2f418e1d69cb","resolution":{"observed_at":"2026-08-15T22:00:49.416922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03346","last_updated":"2025-06-10T04:54:06Z","snapshot_observed_at":"2026-08-16T15:26:20.304806Z","submitted_at":"2023-06-06T01:36:56Z","title":"Stabilizing Contrastive RL: Techniques for Robotic Goal Reaching from Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03346","snapshot_observed_at":"2026-08-15T22:00:48.124659Z","title":"Zheng, B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.124659Z"},"links":{"cited_paper":"/paper/2306.03346","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:349269c91bd269f65b41439834cfbb247e157e641156156724ed500096402268","observation_id":"5fff2a86-6387-4089-bf91-c0771b23d003","resolution":{"observed_at":"2026-08-15T22:00:48.124659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:48.130420Z","title":"Zheng, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.130420Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:0f50b36f955d42cad178da73c96fb2b0a59b8bdc675773bdc5578021bd1d752f","observation_id":"dd9c0c78-1b4a-402b-a758-d19a9355418b","resolution":{"observed_at":"2026-08-15T22:00:48.130420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04292","last_updated":"2024-11-22T18:11:23Z","snapshot_observed_at":"2026-08-16T14:21:04.643378Z","submitted_at":"2024-02-06T10:15:38Z","title":"AdaFlow: Imitation Learning with Variance-Adaptive Flow-Based Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04292","snapshot_observed_at":"2026-08-15T22:00:48.135562Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.135562Z"},"links":{"cited_paper":"/paper/2402.04292","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:d56194e215fa97eb35afd48444cb4da6eafd72a795da2f5aa4e69ab28bda55ef","observation_id":"dc16f062-c13f-48dd-bc6e-c3da622fc1d8","resolution":{"observed_at":"2026-08-15T22:00:48.135562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:48.140626Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.140626Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:40977f83dde9ae70337bca6a6017239514310829a809b59be90bf16ff359254c","observation_id":"2b8fdce0-cef0-4b66-8627-78d8cdcf0e0a","resolution":{"observed_at":"2026-08-15T22:00:48.140626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02117","last_updated":"2024-01-04T07:55:53Z","snapshot_observed_at":"2026-08-15T12:54:53.410743Z","submitted_at":"2024-01-04T07:55:53Z","title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02117","snapshot_observed_at":"2026-08-15T22:00:48.145757Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.145757Z"},"links":{"cited_paper":"/paper/2401.02117","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:c03b360cda9d0e2a87a46d4d2df352d6ba214325d2068ccfe8ae431dc85cfc6d","observation_id":"e067e3e6-eeb1-4cd3-b669-bfd94cb01bac","resolution":{"observed_at":"2026-08-15T22:00:48.145757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15403","last_updated":"2024-07-22T06:12:21Z","snapshot_observed_at":"2026-08-16T13:32:15.545378Z","submitted_at":"2024-07-22T06:12:21Z","title":"Offline Imitation Learning Through Graph Search and Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15403","snapshot_observed_at":"2026-08-15T22:00:48.150988Z","title":"Yin and P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.150988Z"},"links":{"cited_paper":"/paper/2407.15403","citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:62e0d4e2897b72c9a207b8cf0fc89ae80caccea427af9e39cb5ef82ee7c9b1ce","observation_id":"34278e1d-b08b-45fa-9ab0-e92dca4cfb4f","resolution":{"observed_at":"2026-08-15T22:00:48.150988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.381679Z","title":"Zhang, Y","venue":null,"work_id":"6be7c422-d366-4e72-bce4-f07fa5e4151d","year":2024},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.155992Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:ad47018f6cab19723978fb2cafdf16dec7b79961089ec8826f88c0d0f132a743","observation_id":"07d888f4-7183-4bc5-96aa-a952a431c1ee","resolution":{"observed_at":"2026-08-15T22:00:49.386426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.607081Z","title":"Kujanpää, J","venue":null,"work_id":"32a9c537-38f6-4be1-8064-a304e89ff94b","year":2023},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.160900Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:eea15080dde201f5ce1b92bd9b158f2d65de2292b568980b348a2d44e955ab27","observation_id":"e5003d50-5a78-4149-86d6-d601c33488f7","resolution":{"observed_at":"2026-08-15T22:00:49.611976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.365087Z","title":"OptiTrack Motion Capture System","venue":null,"work_id":"fc2ede43-398b-46df-acef-22cd36286fc0","year":null},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.165676Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:d2fb5ca6a4a45197c282ebd57cb8b57c2d797956a954248745daa1da75c96038","observation_id":"5943170c-fdc4-4dd2-9647-9cbbd1a0a0fb","resolution":{"observed_at":"2026-08-15T22:00:49.370234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.332138Z","title":"The Mimicplay dataset contains 33 human play demonstrations averaging 7 minutes each (30 frames per second)","venue":null,"work_id":"37a3a278-3b8b-45ca-ae2d-90679a21a3ea","year":null},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.177294Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:32eb768797630f4f200c757aa554d49facc5b9c654561f3d56f16959b80ee196","observation_id":"c194b090-34a0-4778-bc5e-e357dbdfc5f7","resolution":{"observed_at":"2026-08-15T22:00:49.337464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.314729Z","title":"GMM\" refer to the MLP-based Gaussian mixture model, whereas those prefixed with","venue":null,"work_id":"81944cf2-ef3e-4ae7-8f28-1a246515d8e1","year":null},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.182756Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:9da6b5b5bb27e2ab8569add9908743fafdf71c3c44e7eb754e68fb698bda7fb4","observation_id":"244592fd-2de2-48a7-88f3-fe9226298b11","resolution":{"observed_at":"2026-08-15T22:00:49.319963Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:00:49.348547Z","title":"Hardware version: Prime 13W (or whichever you used)","venue":null,"work_id":"6b2ccdf8-82d4-4476-a3d3-5299f01f926a","year":null},"citing_paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T22:00:48.170945Z"},"links":{"citing_paper":"/paper/2505.08444"},"observation_digest":"sha256:949f59230bca8060400df95f5e48e63b9710f70408ae41fceb569695a34da3bb","observation_id":"fe6c9679-57cb-4baf-a959-d29022165dd9","resolution":{"observed_at":"2026-08-15T22:00:49.354056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.08444","last_updated":"2025-08-07T07:11:32Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T21:52:37.917298Z","submitted_at":"2025-05-13T11:13:00Z","title":"Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":3,"verified_fuzzy":26},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 1 inbound Pith citation observation for arXiv:2505.08444."}