{"as_of":"2026-08-21T17:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9a5af6637174323115ece5b4e33696054b2256397a6a275866bd091e56b662e6","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:15:06.119010Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T22:31:13.391859Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T22:32:10.973323Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"cited_work":{"arxiv_id":"2504.13351","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13351","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain- of-modality: Learning manipulation programs from multimodal human videos with vision-language-models","venue":null,"work_id":"62a7b566-6157-4fe6-97b6-6751ccbc863d","year":2025},"citing_paper":{"arxiv_id":"2511.12878","last_updated":"2026-05-11T01:22:42Z","snapshot_observed_at":"2026-08-10T21:40:24.450522Z","submitted_at":"2025-11-17T02:14:13Z","title":"Uni-Hand: Universal Hand Motion Forecasting in Egocentric Views","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-17T22:31:13.391859Z"},"links":{"cited_paper":"/paper/2504.13351","citing_paper":"/paper/2511.12878"},"observation_digest":"sha256:dfe99e83c15c9a46c06b22e6e62a974e260b3071e63fc14fcbbc7efc04595d9a","observation_id":"4aaef4b5-f425-411a-b59c-31eadb2ff0d2","resolution":{"observed_at":"2026-05-17T22:32:10.976303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.13351/citation-record","integrity":"/paper/2504.13351/integrity","json":"/paper/2504.13351/citation-record.json","paper":"/paper/2504.13351"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T12:15:05.823996Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.823996Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:d257ae69d29b1e9707b4985eea5b5d2d9b967cecf3ca9d415cd23afe34bb5976","observation_id":"8b5e9176-f274-4bf5-8f78-19c8935e8aaf","resolution":{"observed_at":"2026-08-16T12:15:05.823996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-08-18T11:44:22.813405Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-16T12:15:05.829473Z","title":"Do as i can, not as i say: Ground- ing language in robotic affordances,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.829473Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:2b01a288fcee070c0ae180bfe82c951af9b6191bdedff2f7287f7a563161fec0","observation_id":"953d85a8-f64c-4f59-9276-8907087ead28","resolution":{"observed_at":"2026-08-16T12:15:05.829473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.09450","last_updated":"2022-07-19T17:59:59Z","snapshot_observed_at":"2026-08-19T08:09:36.879527Z","submitted_at":"2022-07-19T17:59:59Z","title":"Human-to-Robot Imitation in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.09450","snapshot_observed_at":"2026-08-16T12:15:05.834129Z","title":"Human-to-robot imitation in the wild,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.834129Z"},"links":{"cited_paper":"/paper/2207.09450","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:63d684baf15ea25033f0ca421b2f5abf34cc6abe5425e36587410b1e83dcaf4a","observation_id":"1b7c2986-8ea6-40be-ac2a-4df0580fb00d","resolution":{"observed_at":"2026-08-16T12:15:05.834129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:05.838737Z","title":"Affordances from human videos as a versatile representation for robotics,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.838737Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:b3042d80cd7cf69879f02bb96e1609c5bf9c13c980f3ad3c24d67c61de457c97","observation_id":"c24c9671-cfc9-4b7a-a0f7-8eda2e820442","resolution":{"observed_at":"2026-08-16T12:15:05.838737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:07.047116Z","title":"Towards generalizable zero-shot manipulation via translating human interaction plans,","venue":null,"work_id":"0e0f0717-c852-4c6f-93f5-b9894bb083a6","year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.843956Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:4a4c324144b3d7f53a29e5d9967ae9a3a4b3d13362c35ec48895e92d3eb323dd","observation_id":"6566c015-5722-4ca1-9442-d503edf5b012","resolution":{"observed_at":"2026-08-16T12:15:07.051450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:07.033158Z","title":"Activitynet: A large-scale video benchmark for human activity understanding,","venue":null,"work_id":"a6b63201-3dc5-473f-b1c8-e00fc93a3201","year":2015},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.849102Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:f481b9119b0f26f9159330a063c1569589dbad7fdb304f21975dd8a25fb422d8","observation_id":"f66ebc5d-31b3-4d1c-ba56-abeb9bd5b526","resolution":{"observed_at":"2026-08-16T12:15:07.037710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:07.019220Z","title":"Procedure planning in instructional videos,","venue":null,"work_id":"d7e7c92a-9e16-44d4-b50e-ed54eb527d4c","year":2020},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.854359Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:cc6d0bc7482fedcce7a20f61e497aa77109a0946dfa8a5fb1f2f7b4220ea5e33","observation_id":"a6de1d3a-4ac8-4cc1-a888-30e335918dbc","resolution":{"observed_at":"2026-08-16T12:15:07.023693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:07.006048Z","title":"Learning generalizable robotic reward functions from","venue":null,"work_id":"e96f9629-0b06-4d1e-b060-00ec617d1e97","year":2021},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.858352Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:d6844637d62f61ee5d771935039f2a2dcec0859c170df51f147bdf085145b0cd","observation_id":"d1a7a79a-8866-4e3c-bfaf-b82b29ebe58d","resolution":{"observed_at":"2026-08-16T12:15:07.010164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.991589Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities,","venue":null,"work_id":"2ec9443f-d0d7-40c5-aade-b71718121842","year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.862463Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:83732c1a073e06b79b272cd80c5438f798b66f0ae2619038bc90f733d98482ed","observation_id":"1ec69fac-60e0-488d-806f-08500ddda4d0","resolution":{"observed_at":"2026-08-16T12:15:06.996361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07775","last_updated":"2024-07-12T14:37:08Z","snapshot_observed_at":"2026-08-16T13:35:23.650773Z","submitted_at":"2024-07-10T15:49:07Z","title":"Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07775","snapshot_observed_at":"2026-08-16T12:15:05.866636Z","title":"Mobility vla: Multimodal instruc- tion navigation with long-context vlms and topological graphs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.866636Z"},"links":{"cited_paper":"/paper/2407.07775","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:04e2357a071252f2055eeff982154bb3eca9ee7df45c7a58e22f4c58fd74993d","observation_id":"8e045913-0882-4d8d-a633-ff8ff2c3ea22","resolution":{"observed_at":"2026-08-16T12:15:05.866636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.977092Z","title":"Can foundation models perform zero-shot task specification for robot manipulation?","venue":null,"work_id":"c6b85b98-fc57-45ce-92e8-34f776d3a511","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.871228Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:9d3bccdc0644040ababf93ebc0e5ac425d5549d19569f9515b5410ce8696f361","observation_id":"562bd8c0-423d-4c76-af4c-4b8d28ab45b8","resolution":{"observed_at":"2026-08-16T12:15:06.981665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.962990Z","title":"Scaling egocentric vision: The epic- kitchens dataset,","venue":null,"work_id":"5b00941b-e441-4c02-9cd8-0d73aa068ed7","year":2018},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.875734Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:6a2d56093219400e227340efaf2900574b38a3d1e2f1770b9c591e5d56188e25","observation_id":"51339741-d041-4973-b24c-15288bb4f70f","resolution":{"observed_at":"2026-08-16T12:15:06.967585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.949937Z","title":"Model-based inverse reinforcement learning from visual demonstrations,","venue":null,"work_id":"56e55c55-7e77-49d5-b68a-a874fc79eabe","year":2021},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.880003Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:7aa8823edf88b34116aba9c27a7b8f7a7a00941f60f64e3cb6b9adce719c433e","observation_id":"1b415199-27db-4206-a35b-1a90ea1d0228","resolution":{"observed_at":"2026-08-16T12:15:06.954253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07861","last_updated":"2019-05-20T03:59:44Z","snapshot_observed_at":"2026-08-19T08:09:26.721578Z","submitted_at":"2019-05-20T03:59:44Z","title":"Perceptual Values from Observation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07861","snapshot_observed_at":"2026-08-16T12:15:05.884007Z","title":"Perceptual values from observation,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.884007Z"},"links":{"cited_paper":"/paper/1905.07861","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:eef2f4aead82a06c6470c84ebc276614e225a2927a28333ca8c007ad3778c18f","observation_id":"07a1c60b-2f91-4c1c-b40c-78ee1eb6c582","resolution":{"observed_at":"2026-08-16T12:15:05.884007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07843","last_updated":"2023-12-13T02:20:42Z","snapshot_observed_at":"2026-08-20T11:36:39.330123Z","submitted_at":"2023-12-13T02:20:42Z","title":"Foundation Models in Robotics: Applications, Challenges, and the Future","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07843","snapshot_observed_at":"2026-08-16T12:15:05.888688Z","title":"Foundation models in robotics: Applications, challenges, and the future,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.888688Z"},"links":{"cited_paper":"/paper/2312.07843","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:f5b56f8dfb9447c2a6d69380397945b02c7dffb6af3638a862ca473aa1b8d010","observation_id":"2363f667-350e-4d73-98b8-e7f87053b07d","resolution":{"observed_at":"2026-08-16T12:15:05.888688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.936840Z","title":"The” something something","venue":null,"work_id":"3c07d822-7541-4cd9-96cf-fd5c87c57f45","year":2017},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.893962Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:1a65acd49475a40e9813a5b8ff4f86ad4ceaf2078f0608b12645a30f11d9d658","observation_id":"73711770-4d0f-494a-ad7c-18cacc6d290a","resolution":{"observed_at":"2026-08-16T12:15:06.940935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.923711Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video,","venue":null,"work_id":"79ef5645-311a-4268-9bda-cd2875e0a414","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.898804Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:cf955593d9007e2c1de166c3e5abf5a4fc533356f008a7c80130277647d32b50","observation_id":"aba618a8-bbf5-45a9-a975-2baf93792f60","resolution":{"observed_at":"2026-08-16T12:15:06.928077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:05.903048Z","title":"Gu et al., Rt-trajectory: Robotic task generalization via hindsight trajectory sketches , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.903048Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:783fb1b039c2e0ea7736b412739d327f0f9c2ac93e930cee30d2caefe9656779","observation_id":"332cdff3-e8e4-46a1-a16e-80336f017610","resolution":{"observed_at":"2026-08-16T12:15:05.903048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08782","last_updated":"2024-10-01T08:54:53Z","snapshot_observed_at":"2026-08-21T14:54:47.510456Z","submitted_at":"2023-12-14T10:02:55Z","title":"Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08782","snapshot_observed_at":"2026-08-16T12:15:05.907167Z","title":"Toward general-purpose robots via foundation models: A survey and meta-analysis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.907167Z"},"links":{"cited_paper":"/paper/2312.08782","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:a6714d710c2d2901ffe98d3028baa546d220c5be032af0f5cb36a11fca0269fd","observation_id":"9df6f5cb-68e4-4f18-ae1b-b25a61b06d3e","resolution":{"observed_at":"2026-08-16T12:15:05.907167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.901725Z","title":"Neural task graphs: Generalizing to unseen tasks from a single video demonstration,","venue":null,"work_id":"62bf0e4b-91da-4557-a5a1-3c7f3ec94889","year":2019},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.911401Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:7e004dd8d28a2c96cd4352e346e280dc07d4b51914e4fe85b85efc38acb91295","observation_id":"153673ef-0b34-408b-aea2-b7b00219c727","resolution":{"observed_at":"2026-08-16T12:15:06.906112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.888586Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents,","venue":null,"work_id":"61a20113-ad20-4d2e-80d5-d3924514b275","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.915400Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:cd66fbdd123fde81166a6d867a42376903bed9b6e163c422880cf86884a460ad","observation_id":"4e09e530-64a9-4abf-bffc-429cbe81a950","resolution":{"observed_at":"2026-08-16T12:15:06.893030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01652","last_updated":"2024-11-12T04:33:26Z","snapshot_observed_at":"2026-07-29T23:37:00.228879Z","submitted_at":"2024-09-03T06:45:22Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01652","snapshot_observed_at":"2026-08-16T12:15:05.920527Z","title":"Rekep: Spatio-temporal reasoning of relational keypoint constraints for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.920527Z"},"links":{"cited_paper":"/paper/2409.01652","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:01854ee13b07db8bc936d4a1d7836c115a7809b5e192770ff629af3b26d655eb","observation_id":"ad73f741-e752-4740-8e4b-86eedd14fd18","resolution":{"observed_at":"2026-08-16T12:15:05.920527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-17T09:42:08.942018Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-16T12:15:05.924813Z","title":"Inner monologue: Embodied reasoning through planning with language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.924813Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:e3d50e09fdee1c761ab87a2d8542a45cf27a9c2b94b91ca5fce50909957e6844","observation_id":"626817ea-66c6-4e8f-bc38-27a963ee36c8","resolution":{"observed_at":"2026-08-16T12:15:05.924813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","snapshot_observed_at":"2026-08-17T12:54:40.193734Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12943","snapshot_observed_at":"2026-08-16T12:15:05.929096Z","title":"Vid2robot: End-to-end video-conditioned policy learning with cross-attention transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.929096Z"},"links":{"cited_paper":"/paper/2403.12943","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:7568ba7255e79c5aeba31d91f81fb8afa027f34911aa9ebb296e44c9d27faf08","observation_id":"dea3d730-a29c-4b51-b11c-129b69886541","resolution":{"observed_at":"2026-08-16T12:15:05.929096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.874833Z","title":"Prompting visual-language models for efficient video understanding,","venue":null,"work_id":"56bc0113-1027-4313-a524-e3ebbc96a590","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.933595Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:94086f05e4582b729a3974329aba872764c4d15df8b23710ebc27b2c87cfc1dc","observation_id":"ec8b220b-43bd-46c8-8859-31c04e85b903","resolution":{"observed_at":"2026-08-16T12:15:06.879575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.861772Z","title":"Human action recognition and prediction: A survey,","venue":null,"work_id":"e4640208-9fc2-4266-9f6a-00b9328dd3cf","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.937756Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:6bc1c2d39438c6191410e9e18efd294ff3f8cab4f8a8e51f5880ca53070258f7","observation_id":"0f4db8b3-28f7-406b-9960-8089c67be071","resolution":{"observed_at":"2026-08-16T12:15:06.865923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.849028Z","title":"Anticipating human activities using object affordances for reactive robotic response,","venue":null,"work_id":"5cef0864-72ac-4593-9701-6b22bddf74a7","year":2015},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.941701Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:e6281c28318ce809a20e5231990d614780106a13f1fe508d4279e73ee2014bca","observation_id":"7ffb5d53-ac82-452c-b8ac-cc0832839844","resolution":{"observed_at":"2026-08-16T12:15:06.853103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.835577Z","title":"Graph inverse reinforcement learning from diverse videos,","venue":null,"work_id":"0127b4c5-ea58-42e4-afea-be63ff2c842d","year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.945640Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:ffe5c2336e785e4c19fb5e91d383b2bbbb3c59630cd1ba01cf5678afde993d82","observation_id":"edf41b8e-010d-427b-9192-4445b94ad7da","resolution":{"observed_at":"2026-08-16T12:15:06.840008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.06539","last_updated":"2019-08-06T12:47:41Z","snapshot_observed_at":"2026-08-19T08:09:32.059673Z","submitted_at":"2019-04-13T12:56:17Z","title":"HAKE: Human Activity Knowledge Engine","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.06539","snapshot_observed_at":"2026-08-16T12:15:05.949799Z","title":"Hake: Human activity knowledge engine,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.949799Z"},"links":{"cited_paper":"/paper/1904.06539","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:7fd9483107baf97b51dac7c19dd5a695f71601a628225faa3348c26060ec4b9d","observation_id":"524e4606-1f1d-494e-a216-e69ba2bf4290","resolution":{"observed_at":"2026-08-16T12:15:05.949799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.822330Z","title":"Code as policies: Language model programs for embodied control,","venue":null,"work_id":"c0ea16b6-9ad0-40eb-9065-441dcd0e09d0","year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.954444Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:d997193fde4c46652ce8ece6d81a972e474ab199bb6f19758c9e5551f5bea47a","observation_id":"43e694a3-e04c-4a4c-9f6f-834dba6310ba","resolution":{"observed_at":"2026-08-16T12:15:06.826654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11450","last_updated":"2024-05-31T17:25:38Z","snapshot_observed_at":"2026-08-19T08:09:37.349416Z","submitted_at":"2024-02-18T04:16:24Z","title":"Learning to Learn Faster from Human Feedback with Language Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11450","snapshot_observed_at":"2026-08-16T12:15:05.958643Z","title":"Learning to learn faster from human feedback with language model predictive control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.958643Z"},"links":{"cited_paper":"/paper/2402.11450","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:1dc8dc5bdc335fd4c4e161d288029eb8c4cd234850eec0c5019aa834c18cb720","observation_id":"ddfeea2d-bcaf-4cdb-8549-2177c55fee32","resolution":{"observed_at":"2026-08-16T12:15:05.958643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.809041Z","title":"Text2motion: From natural language instructions to feasible plans,","venue":null,"work_id":"bc5fd075-2ef3-4720-b6c4-752b9e6417af","year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.963232Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:4792a1614d62321d79757b9dd0ac81456afb8220943c4d3327cc9906ffb13c65","observation_id":"029c77d3-91c1-44d6-a7fb-7be115bd0f9d","resolution":{"observed_at":"2026-08-16T12:15:06.813390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11477","last_updated":"2023-09-27T07:29:44Z","snapshot_observed_at":"2026-08-20T13:58:14.233571Z","submitted_at":"2023-04-22T20:34:03Z","title":"LLM+P: Empowering Large Language Models with Optimal Planning Proficiency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11477","snapshot_observed_at":"2026-08-16T12:15:05.967780Z","title":"Llm+ p: Empowering large language mod- els with optimal planning proficiency,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.967780Z"},"links":{"cited_paper":"/paper/2304.11477","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:e9a66d940edb9fbe6e590a068c8124660241395eba30d79d7c72cb2603e9911a","observation_id":"8334d377-0654-4f39-8059-f769e0eaf7d6","resolution":{"observed_at":"2026-08-16T12:15:05.967780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.795110Z","title":"Imitation from observation: Learning to imitate behaviors from raw video via context translation,","venue":null,"work_id":"ee1a9ecd-94e7-44d6-96c2-59a2fa1b3c13","year":2018},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.972747Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:58ad3b74c3914d0f3c2d597d17019e4d67159f14ed718a773afb3927a69bd995","observation_id":"af4a4e74-bada-4530-8546-c78ec375f196","resolution":{"observed_at":"2026-08-16T12:15:06.799915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00030","last_updated":"2023-03-07T02:29:59Z","snapshot_observed_at":"2026-08-11T15:42:16.204049Z","submitted_at":"2022-09-30T18:14:07Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.00030","snapshot_observed_at":"2026-08-16T12:15:05.977805Z","title":"Vip: Towards universal visual reward and representation via value-implicit pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.977805Z"},"links":{"cited_paper":"/paper/2210.00030","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:cb8593259e44d2cee1ea8916e49c9cc349ce85d9e8209636f92b67955ef6e8aa","observation_id":"62ae18b9-ac15-436c-b5d5-dc9e7809140d","resolution":{"observed_at":"2026-08-16T12:15:05.977805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-19T17:18:24.172135Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-08-16T12:15:05.982335Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.982335Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:8cefd49d997c0ecff5e67baeb9b72c308b9552e18d425f3de5cc720db8318632","observation_id":"ca246feb-1907-4498-abb9-91b4e55c323f","resolution":{"observed_at":"2026-08-16T12:15:05.982335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12957","last_updated":"2025-04-03T10:12:23Z","snapshot_observed_at":"2026-08-16T13:33:18.623066Z","submitted_at":"2024-07-17T18:59:56Z","title":"R+X: Retrieval and Execution from Everyday Human Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12957","snapshot_observed_at":"2026-08-16T12:15:05.986843Z","title":"R+ x: Retrieval and execution from everyday human videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.986843Z"},"links":{"cited_paper":"/paper/2407.12957","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:ec34fd91f23c6d91bf67550dd20b716c96cb1985372099ee46fe94c37dbb8c30","observation_id":"8012cf00-5557-49e5-a3d7-f5eac04cd3be","resolution":{"observed_at":"2026-08-16T12:15:05.986843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.781559Z","title":"Reconstructing hands in 3D with transformers,","venue":null,"work_id":"53ce532e-5da4-4d69-a29f-5fe4aa1693d3","year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.991085Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:65b94c07387498eda2d8d5f2cbfe981b9676470c6ae815dc5f528b43b28afa3e","observation_id":"ecf863bd-b2cf-4e7f-92a8-d099dd57f61f","resolution":{"observed_at":"2026-08-16T12:15:06.785927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.766591Z","title":"Planning with large language models via corrective re-prompting,","venue":null,"work_id":"b2ac44ce-3ecc-4d40-bb81-da19930b4977","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.995264Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:8c90649918bfb7f80877ce6c40a84116099969a39b432d5b6b56e446d8511021","observation_id":"3d0306c3-cfbf-44a0-ad5e-08931ec73954","resolution":{"observed_at":"2026-08-16T12:15:06.772228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-16T12:15:05.999412Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:05.999412Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:1575aa27f46af7a9ba4828b97f0c0a05f30828630800de58a6b9e42cec1aa96b","observation_id":"ce308fe6-2918-458c-a391-e35be8176faa","resolution":{"observed_at":"2026-08-16T12:15:05.999412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.752405Z","title":"First-person activity forecasting with online inverse reinforcement learning,","venue":null,"work_id":"a4603f41-bbb4-439e-b861-5195bc4268e4","year":2017},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.003775Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:6ec0001c2a7feb4f25a9ad45c8f7638d899c97db1b081636458cce4597e51ebc","observation_id":"494da36c-0ae1-49eb-b631-6315d0951129","resolution":{"observed_at":"2026-08-16T12:15:06.756810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.06507","last_updated":"2021-11-04T20:07:57Z","snapshot_observed_at":"2026-08-19T08:09:32.660815Z","submitted_at":"2020-11-12T17:15:48Z","title":"Reinforcement Learning with Videos: Combining Offline Observations with Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.06507","snapshot_observed_at":"2026-08-16T12:15:06.008300Z","title":"Reinforcement learning with videos: Combining offline observations with interaction,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.008300Z"},"links":{"cited_paper":"/paper/2011.06507","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:a22c83e6a01a6a6748316b390c46d82f412c8910b35a603d13107666d4b507a3","observation_id":"35af371c-7f12-42ac-9df6-63f1efbfe7c0","resolution":{"observed_at":"2026-08-16T12:15:06.008300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.738947Z","title":"Learning predictive models from observation and interaction,","venue":null,"work_id":"9780243e-7c77-423a-99ac-564611529861","year":2020},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.012623Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:15c46ac57f9ca0514b564a28db80f04197bd75183bc6a842063b0c6cde1dea68","observation_id":"c017f492-57b7-4e75-bb03-e249e5bd876e","resolution":{"observed_at":"2026-08-16T12:15:06.743315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.725171Z","title":"Time-contrastive networks: Self- supervised learning from video,","venue":null,"work_id":"81ea5786-04b2-4518-8dd1-f4eb61974116","year":2018},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.016846Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:b8b9f8bb6c776935b9bd87e940a8dd345379e10e462afbd90f99de30fd889d82","observation_id":"fbfba823-2a36-4ea3-a700-7213cf749988","resolution":{"observed_at":"2026-08-16T12:15:06.729483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.06699","last_updated":"2017-06-12T21:38:17Z","snapshot_observed_at":"2026-08-21T14:38:04.456194Z","submitted_at":"2016-12-20T15:04:38Z","title":"Unsupervised Perceptual Rewards for Imitation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.06699","snapshot_observed_at":"2026-08-16T12:15:06.020797Z","title":"Unsupervised perceptual rewards for imitation learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.020797Z"},"links":{"cited_paper":"/paper/1612.06699","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:85cf690ee714a853c35b08ca0497f93cb0f7dd6d471a414f9504192df8c31de4","observation_id":"5936cc87-13c4-47de-8a41-75dc2ba438d8","resolution":{"observed_at":"2026-08-16T12:15:06.020797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.711686Z","title":"Lm-nav: Robotic navigation with large pre-trained models of language, vision, and action,","venue":null,"work_id":"8b41850a-82fc-4693-826d-861ebbee6411","year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.025092Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:6cdd2fbc5d1554bed1d24e9e135fcd74ec9bb9562cfeb67b44931508da0995d3","observation_id":"5d5cca8d-92fe-425d-bbe4-94d46b2f6314","resolution":{"observed_at":"2026-08-16T12:15:06.716265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.697704Z","title":"Concept2robot: Learning manipulation concepts from instructions and human demonstrations,","venue":null,"work_id":"0520a3e0-f339-477f-bfad-7e9177f56863","year":2021},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.029196Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:e300ef767c5855e5215699965b41594da24bc84e129282b8c6d30094dc2dd216","observation_id":"53ea4167-f4bc-4391-9a69-c5eb279eaa1c","resolution":{"observed_at":"2026-08-16T12:15:06.702427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.033284Z","title":"Third-person visual imitation learning via decoupled hierarchical controller,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.033284Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:a055549c8e52a7e0812e5958731aa1908be663988aa3e3ea5a1443d1523c523a","observation_id":"64ac1d08-59bd-40d4-ae6d-1577697185fd","resolution":{"observed_at":"2026-08-16T12:15:06.033284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.675168Z","title":"Videodex: Learning dexterity from internet videos,","venue":null,"work_id":"72ab88e8-85db-4f72-9086-2128b38f0cfb","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.037238Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:ac44f35d58f99824037f524bf27398fe95155e96f70344f174fd49d2e79e0c28","observation_id":"7fdefc1e-e9de-46d6-b321-ccb76c1d509b","resolution":{"observed_at":"2026-08-16T12:15:06.679337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.661124Z","title":"Cliport: What and where pathways for robotic manipulation,","venue":null,"work_id":"9dbe9058-16bc-44ff-9d23-24471e4f9f0c","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.041470Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:5c2a3ec596217ac76c2fad6859cae7aa3777434b7338b016f8bda35cdfabea5b","observation_id":"9cbb0e9d-2e59-4dce-b269-e94561a12242","resolution":{"observed_at":"2026-08-16T12:15:06.666143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.647668Z","title":"Generalized planning in pddl domains with pretrained large language models,","venue":null,"work_id":"8607bfc5-e7e2-4266-9167-09dbbb3cce2d","year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.045413Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:412102ba2073b0f25f451fc63d62bc8a8d566323319331b14415ae696bfc56db","observation_id":"b100e8b7-b69d-47f4-8f2b-9c497e515b8d","resolution":{"observed_at":"2026-08-16T12:15:06.652030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.634019Z","title":"Progprompt: Generating situated robot task plans using large language models,","venue":null,"work_id":"4c914fcd-057a-402e-b1a6-fabc1f61accf","year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.049345Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:ba79fbfcd2adf719c19d036d42287f91648b9df0f3323451e46f62a044f83ef6","observation_id":"c8ce1d2a-f309-4ba7-9fbe-079e8c5f9771","resolution":{"observed_at":"2026-08-16T12:15:06.638380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.04443","last_updated":"2020-06-21T20:16:28Z","snapshot_observed_at":"2026-08-19T08:11:43.434400Z","submitted_at":"2019-12-10T01:36:18Z","title":"AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.04443","snapshot_observed_at":"2026-08-16T12:15:06.053396Z","title":"Avid: Learning multi-stage tasks via pixel- level translation of human videos,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.053396Z"},"links":{"cited_paper":"/paper/1912.04443","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:b7119b216e13762bd63a269c3c4fba125d95a7d12e679591dc3b9b6d9125d31e","observation_id":"5e08acf3-1ab6-4dbe-b8fb-d79b87d0f243","resolution":{"observed_at":"2026-08-16T12:15:06.053396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.619162Z","title":"Rt-sketch: Goal-conditioned imitation learning from hand-drawn sketches,","venue":null,"work_id":"e3d0ed54-202d-49e2-b496-7d2bb1686458","year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.058134Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:adaa47aea2dcccfd40808e97be74054494caa4a1e286554e5af84b014b1c453e","observation_id":"bae1268d-aecf-4e21-afd8-befc75498813","resolution":{"observed_at":"2026-08-16T12:15:06.624307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12422","last_updated":"2023-10-13T05:44:37Z","snapshot_observed_at":"2026-08-16T15:53:03.955730Z","submitted_at":"2023-02-24T02:54:15Z","title":"MimicPlay: Long-Horizon Imitation Learning by Watching Human Play","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12422","snapshot_observed_at":"2026-08-16T12:15:06.062178Z","title":"Mimicplay: Long-horizon imitation learning by watching human play,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.062178Z"},"links":{"cited_paper":"/paper/2302.12422","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:4d7372ae87b5d769210b7e53c5f208d384a7c6b1a9c9bb555a95806059431fc8","observation_id":"70c2604c-d6d6-4a9b-820f-01e4eaac77c2","resolution":{"observed_at":"2026-08-16T12:15:06.062178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.604595Z","title":"Temporal segment networks for action recognition in videos,","venue":null,"work_id":"9a5584e6-0d56-499b-84e0-84b9abd1ea44","year":2018},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.066608Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:156d4e1eed8be1aed13a6118df5c0810918a89b1138aebb092d863268967b257","observation_id":"e029ff48-0892-4c15-ae94-e09bb9b4a6a5","resolution":{"observed_at":"2026-08-16T12:15:06.609454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01560","last_updated":"2024-07-08T05:56:47Z","snapshot_observed_at":"2026-08-02T14:50:04.461434Z","submitted_at":"2023-02-03T06:06:27Z","title":"Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01560","snapshot_observed_at":"2026-08-16T12:15:06.070735Z","title":"Describe, explain, plan and select: Interactive planning with large language models enables open-world multi- task agents,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.070735Z"},"links":{"cited_paper":"/paper/2302.01560","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:89854ac206c1c1256e67c214afa404c48be71dbe33759351470ce83beb9e1f17","observation_id":"ccfc0c3a-e781-4fc8-b1e8-42124a900da9","resolution":{"observed_at":"2026-08-16T12:15:06.070735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12716","last_updated":"2022-05-06T14:46:46Z","snapshot_observed_at":"2026-08-16T17:24:57.800595Z","submitted_at":"2022-01-30T03:59:14Z","title":"You Only Demonstrate Once: Category-Level Manipulation from Single Visual Demonstration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12716","snapshot_observed_at":"2026-08-16T12:15:06.075484Z","title":"You only demonstrate once: Category-level manipulation from single visual demonstration,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.075484Z"},"links":{"cited_paper":"/paper/2201.12716","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:023f74d3e69da9a3e66f53deed3da13e2c8cb7def2022f6ee34e4e0508c5322c","observation_id":"9bad7664-3736-4466-96e9-284f630f4666","resolution":{"observed_at":"2026-08-16T12:15:06.075484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-08-16T12:15:06.080003Z","title":"Wen et al., Any-point trajectory modeling for policy learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.080003Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:8fe1beb171bb0ecd8078321dcc125946af7dbf81bfc58261036c4211aa2d1659","observation_id":"5a8437c9-a347-4a60-bd11-f753709bfdbd","resolution":{"observed_at":"2026-08-16T12:15:06.080003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.590202Z","title":"Learning by watching: Physical imitation of manipulation skills from human videos,","venue":null,"work_id":"40a8b337-5968-4520-9331-457da1a8d8ad","year":2021},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.084224Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:d5d5f9d6334b42960b74dd75f0138556added68ddc99def33602bc59c0f7535a","observation_id":"0fc53998-4711-45aa-89a6-21b936be4c15","resolution":{"observed_at":"2026-08-16T12:15:06.594823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.575567Z","title":"R-c3d: Region convolutional 3d network for temporal activity detection,","venue":null,"work_id":"462282f7-78ae-400b-83f3-09a9174fe683","year":2017},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.088928Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:e189bf84bcefd235d544abe4db37ed05fb1411f3fe508ce945dc676cd9f75e57","observation_id":"c7e02b1c-fd93-45ed-83c9-62b7ff4b66f5","resolution":{"observed_at":"2026-08-16T12:15:06.580137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.561600Z","title":"Xskill: Cross embodiment skill discovery,","venue":null,"work_id":"64638deb-80b8-49f9-9f55-adcb9d469f35","year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.092975Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:9ef540dd5b6648c2931bead90ca864633d3e82ecfbdbd0cae808d5bdadc7adcd","observation_id":"543b7814-6507-4f88-a2f9-a6cb528eb278","resolution":{"observed_at":"2026-08-16T12:15:06.566205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-08-17T12:24:00.878640Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-16T12:15:06.097274Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision),","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.097274Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:bb8812516b8c7908ee7cb04d3ea6a884cc7345cef9fa32462bea8813a23229ed","observation_id":"b81a5940-fb40-436a-aafb-63f13630f2c4","resolution":{"observed_at":"2026-08-16T12:15:06.097274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08647","last_updated":"2023-06-16T23:02:21Z","snapshot_observed_at":"2026-08-17T22:16:17.971851Z","submitted_at":"2023-06-14T17:27:10Z","title":"Language to Rewards for Robotic Skill Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08647","snapshot_observed_at":"2026-08-16T12:15:06.101518Z","title":"Language to rewards for robotic skill synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.101518Z"},"links":{"cited_paper":"/paper/2306.08647","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:fa44a33c22135d17f55f40051a2d26870248a60d024693b91c52ef0b35cf51ee","observation_id":"f5a88b61-30fd-43b7-85df-92a144c2dde7","resolution":{"observed_at":"2026-08-16T12:15:06.101518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.547592Z","title":"Xirl: Cross-embodiment inverse rein- forcement learning,","venue":null,"work_id":"c18997d0-49fe-4703-9eaa-b39d06ceeb98","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.105941Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:166be06f238e87147ab67d9d5ff69754475e6c1cb17e0d9fa5af00273409df5b","observation_id":"b4d1615e-b21a-4e42-8b67-7f36d58670b9","resolution":{"observed_at":"2026-08-16T12:15:06.551893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00598","last_updated":"2022-05-27T17:52:50Z","snapshot_observed_at":"2026-08-13T04:37:51.649726Z","submitted_at":"2022-04-01T17:43:13Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.00598","snapshot_observed_at":"2026-08-16T12:15:06.110419Z","title":"Socratic models: Composing zero-shot multimodal reasoning with language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.110419Z"},"links":{"cited_paper":"/paper/2204.00598","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:3b8d9a99508de2b0897d131747aad90e5842bbb3656a07a08bda5e1bb202baef","observation_id":"8f7de078-182a-49d8-938e-d4883ebcce9f","resolution":{"observed_at":"2026-08-16T12:15:06.110419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:15:06.532121Z","title":"Actionformer: Localizing moments of actions with transformers,","venue":null,"work_id":"b1f7f06a-ba32-4b75-b88b-696a96741e03","year":2022},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.114777Z"},"links":{"citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:182deaa09e84a2eb0f2a3b5b85e80246098b809efb69804e8700272405261bfa","observation_id":"dda92637-4a19-45f2-bcf8-3250d59a31c1","resolution":{"observed_at":"2026-08-16T12:15:06.538148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20321","last_updated":"2025-09-04T08:23:37Z","snapshot_observed_at":"2026-08-19T08:06:08.364943Z","submitted_at":"2024-05-30T17:56:54Z","title":"Vision-based Manipulation from Single Human Video with Open-World Object Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20321","snapshot_observed_at":"2026-08-16T12:15:06.119010Z","title":"Vision-based manipulation from single human video with open-world object graphs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T12:15:06.119010Z"},"links":{"cited_paper":"/paper/2405.20321","citing_paper":"/paper/2504.13351"},"observation_digest":"sha256:6b8ead37087f062344d805c3c0803f6be5e2bc758fd65cae135e7fd8da98ebf3","observation_id":"530ccaf9-7f76-4434-9786-94972fb0ade5","resolution":{"observed_at":"2026-08-16T12:15:06.119010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.13351","last_updated":"2025-04-17T21:31:23Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-19T17:18:56.744465Z","submitted_at":"2025-04-17T21:31:23Z","title":"Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 1 inbound Pith citation observation for arXiv:2504.13351."}