{"as_of":"2026-08-21T09:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b80522132a307734149d557c5e648af70917c9916ab0445337c472f79b76dfdb","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:45:47.406893Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.13211/citation-record","integrity":"/paper/2411.13211/integrity","json":"/paper/2411.13211/citation-record.json","paper":"/paper/2411.13211"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.161355Z","title":"Mas- tering the game of go with deep neural networks and tree search","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.161355Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:646a190175bcda478d4e34772470eaa912aaf2ad0b2ea7d1444967dec20d428a","observation_id":"fcc889a0-0f25-4e85-9f8f-3a7b480f2842","resolution":{"observed_at":"2026-08-12T16:45:47.161355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03539","last_updated":"2024-09-16T15:41:05Z","snapshot_observed_at":"2026-08-16T13:28:04.211521Z","submitted_at":"2024-08-07T04:35:38Z","title":"Deep Reinforcement Learning for Robotics: A Survey of Real-World Successes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03539","snapshot_observed_at":"2026-08-12T16:45:47.168907Z","title":"Deep reinforcement learning for robotics: A survey of real-world successes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.168907Z"},"links":{"cited_paper":"/paper/2408.03539","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:cdee3f6fdde577f3028c121ec8173502c3ef95c38aa9600205bdb42d85fb1eb4","observation_id":"534fdd08-0d02-4d4d-bc0a-d5ea9d2d8de7","resolution":{"observed_at":"2026-08-12T16:45:47.168907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:48.150100Z","title":"Specification gaming: the flip side of ai ingenuity","venue":null,"work_id":"eb51ad70-4856-4ebd-9b00-49e895d51ba0","year":2020},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.176949Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:c0a867f93dc85a92a76bcd0cb0b5d8263aa9c3f8bbd99ee8ccc2306e89cd0e05","observation_id":"e7042915-8ccb-4735-8104-11b6b7592550","resolution":{"observed_at":"2026-08-12T16:45:48.155246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:48.132737Z","title":"Defining and characterizing reward gaming","venue":null,"work_id":"2ef9ddfd-2092-4391-a3a2-9cc6a55f5116","year":2022},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.184902Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:8321154108d9434cdeb06cd94ed1b73ca2746cebc010a038766cdc381ff92de1","observation_id":"e93a6f76-1f30-4f21-868b-f11ca058f76c","resolution":{"observed_at":"2026-08-12T16:45:48.138168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:48.114419Z","title":"On the importance of hyperparameter optimization for model-based reinforcement learning","venue":null,"work_id":"87bc821b-08e2-47a6-92cb-fa489a27a3ce","year":2021},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.191282Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:e1adf2cd7a85145416bea4b80659bd68b9db91f0e0858e091e4a7312abdd2023","observation_id":"ae624301-8431-4ccc-9a5a-72ae93f62973","resolution":{"observed_at":"2026-08-12T16:45:48.120939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:48.096264Z","title":"Variational inverse control with events: A general framework for data-driven reward definition","venue":null,"work_id":"838e633e-881d-4afa-8409-cc5f08e6138c","year":2018},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.198072Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:3d17d715930e469476dda4bd6540c5573a87c1865346ff1132ac6f29da202f1d","observation_id":"ee53c557-2a5a-4e63-a00a-7aada7a3959c","resolution":{"observed_at":"2026-08-12T16:45:48.101686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.204429Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.204429Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:f50e0ff1d7e9aa8759bcf06dfb9a681641e0fcd9b8b617627e6ceefc39f7b21d","observation_id":"b13ec86d-3df7-422f-bb34-42b565521e38","resolution":{"observed_at":"2026-08-12T16:45:47.204429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-20T20:46:14.080067Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-12T16:45:47.211087Z","title":"Vision- Language Models are Zero-Shot Reward Models for Reinforcement Learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.211087Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:c1162efe76fb8a1f08b5e47d7b1b55e09b5bcc11e23f19d1038f2a40b15b1f4c","observation_id":"1c616136-d84a-46b6-ad8c-e02bdf1af33c","resolution":{"observed_at":"2026-08-12T16:45:47.211087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07899","last_updated":"2023-10-11T21:10:21Z","snapshot_observed_at":"2026-08-16T14:52:53.872056Z","submitted_at":"2023-10-11T21:10:21Z","title":"RoboCLIP: One Demonstration is Enough to Learn Robot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07899","snapshot_observed_at":"2026-08-12T16:45:47.217346Z","title":"Sontakke, Jesse Zhang, Sébastien M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.217346Z"},"links":{"cited_paper":"/paper/2310.07899","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:5c1e6c58e237f3a09e67b492d4ea52dcc57f30449d26cb208ae75a05f7a37857","observation_id":"ae1fa5bf-97f7-4b05-8bdb-1c3086adaa46","resolution":{"observed_at":"2026-08-12T16:45:47.217346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04210","last_updated":"2024-08-11T07:13:50Z","snapshot_observed_at":"2026-08-21T00:13:33.359886Z","submitted_at":"2024-02-06T18:07:43Z","title":"Task Success is not Enough: Investigating the Use of Video-Language Models as Behavior Critics for Catching Undesirable Agent Behaviors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04210","snapshot_observed_at":"2026-08-12T16:45:47.222909Z","title":"Task Success","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.222909Z"},"links":{"cited_paper":"/paper/2402.04210","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:9456afb3a17801778373dc0fa76f201567f75f2d567be5092637a8ab69365f9f","observation_id":"aa9aa0c6-3229-493d-a173-15357e8c13cb","resolution":{"observed_at":"2026-08-12T16:45:47.222909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.16817","last_updated":"2021-03-31T05:25:05Z","snapshot_observed_at":"2026-08-19T08:06:13.843034Z","submitted_at":"2021-03-31T05:25:05Z","title":"Learning Generalizable Robotic Reward Functions from \"In-The-Wild\" Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.16817","snapshot_observed_at":"2026-08-12T16:45:47.228810Z","title":"in-the-wild","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.228810Z"},"links":{"cited_paper":"/paper/2103.16817","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:77f6bf0ae756b155e19488213af21f5ddbbb4cda698f9593298caec30c9d918c","observation_id":"a0169577-c9f9-4b4f-aace-dcf08d21b2bf","resolution":{"observed_at":"2026-08-12T16:45:47.228810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:48.065549Z","title":"The unsur- prising effectiveness of pre-trained vision models for control","venue":null,"work_id":"bc887f70-1d49-4964-96b0-a0283788614a","year":2022},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.233963Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:997fd7a9e36961f6ce5823edd21188dc7755d9d522194c39229a173705ccdecf","observation_id":"6718bc60-6efa-4b08-99ee-8934da57ee5c","resolution":{"observed_at":"2026-08-12T16:45:48.070961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-18T08:56:17.187633Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-12T16:45:47.239421Z","title":"Reward design with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.239421Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:f9e5e6ea6de577fd1d9f0735c1abb961cd8746e407ea510d5d1e7e65b4df768c","observation_id":"e8819983-5ecb-496f-bbce-4df5d85468f5","resolution":{"observed_at":"2026-08-12T16:45:47.239421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-19T21:41:44.622958Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-12T16:45:47.244847Z","title":"Smith, and Han- naneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.244847Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:afcdbb768dc97280865bf43ff1539935667a5d5728026d5276c1b826f01a084c","observation_id":"ed1eaabf-97a8-4d83-ba2c-94c173cec3a2","resolution":{"observed_at":"2026-08-12T16:45:47.244847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:48.047859Z","title":"Reward learning from narrated demonstrations","venue":null,"work_id":"ce72351f-16fa-4ddb-99c9-7330486a32e8","year":2018},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.251372Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:f8f063de03c32ea3ade7a01b2c3aeb7a6cfdd030d8785c8c8271ec211e0755fe","observation_id":"2d89699d-a082-48fc-9303-2e05cfd4779b","resolution":{"observed_at":"2026-08-12T16:45:48.053066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:48.029943Z","title":"Zero-shot reward specification via grounded natural language","venue":null,"work_id":"6678180b-b16b-4578-864c-647234694f7c","year":2022},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.256190Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:07df02d504aa3293d7541892aaa5066706a061272cea87e61d996420d711584a","observation_id":"710e80fd-f955-423f-8ebe-7018aaa971bc","resolution":{"observed_at":"2026-08-12T16:45:48.035370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-16T14:21:09.886387Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-12T16:45:47.260990Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.260990Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:6286d3e46dc123a5e5a1f7bc6e3a4ca82b8ce5a4ad8679c805ef2c646f7be91b","observation_id":"cc57d9c5-0e98-4c8f-95e1-cf4e4564c3f0","resolution":{"observed_at":"2026-08-12T16:45:47.260990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15527","last_updated":"2024-02-21T07:09:58Z","snapshot_observed_at":"2026-08-16T14:16:42.452734Z","submitted_at":"2024-02-21T07:09:58Z","title":"PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15527","snapshot_observed_at":"2026-08-12T16:45:47.265925Z","title":"PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.265925Z"},"links":{"cited_paper":"/paper/2402.15527","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:770f7b538084dbdaf794bce814d146754784f120f5dec5d5734f5e4d8ce528ed","observation_id":"e93e662b-5681-4cfe-b64a-ed702c29e75b","resolution":{"observed_at":"2026-08-12T16:45:47.265925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:48.013118Z","title":"Paxion: Patching Action Knowledge in Video-Language Foundation Models,","venue":null,"work_id":"8997d793-6741-47a8-92fa-b9240dae9c70","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.271210Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:8b467a444772708ba1f08f76697bb0cbe272c2ef30bf0535f35a32e818b484b0","observation_id":"bd236a1c-d166-4044-b0fc-81fa4e9e125e","resolution":{"observed_at":"2026-08-12T16:45:48.018311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09227","last_updated":"2024-03-14T09:48:36Z","snapshot_observed_at":"2026-08-16T07:36:37.508005Z","submitted_at":"2024-03-14T09:48:36Z","title":"BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09227","snapshot_observed_at":"2026-08-12T16:45:47.281865Z","title":"Matthews, Ivan Villa-Renteria, Jerry Huayang Tang, Claire Tang, Fei Xia, Yunzhu Li, Silvio Savarese, Hyowon Gweon, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.281865Z"},"links":{"cited_paper":"/paper/2403.09227","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:3c12c36f03d30babb2da0bcfdcf4bb0667ab26868fe19426b5f0874428fad3b4","observation_id":"12d3fae1-9b50-49d4-b082-a0c025bed755","resolution":{"observed_at":"2026-08-12T16:45:47.281865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07011","last_updated":"2018-06-19T02:16:44Z","snapshot_observed_at":"2026-08-15T04:16:07.694047Z","submitted_at":"2018-06-19T02:16:44Z","title":"VirtualHome: Simulating Household Activities via Programs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.07011","snapshot_observed_at":"2026-08-12T16:45:47.286943Z","title":"VirtualHome: Simulating Household Activities via Programs, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.286943Z"},"links":{"cited_paper":"/paper/1806.07011","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:975c894787fd219b7fcd84bbf123629a7b311cfff09e36c6ded4e856e205f11b","observation_id":"5874afd9-ede9-4663-bd7a-ac3b4119de37","resolution":{"observed_at":"2026-08-12T16:45:47.286943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.997194Z","title":"Habitat: A Platform for Embodied AI Research, 2019","venue":null,"work_id":"b61bb28a-5195-425f-9ca9-9a7dd35fa7ca","year":2019},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.292786Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:1d3a0b4e176d006f02dd6f922212eace4a8c3360e18c3c5e69dae1cfc2f92552","observation_id":"71db451c-40d2-45f9-8b25-7e66452edb7b","resolution":{"observed_at":"2026-08-12T16:45:48.002322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13724","last_updated":"2023-10-19T17:29:17Z","snapshot_observed_at":"2026-08-16T14:50:37.751196Z","submitted_at":"2023-10-19T17:29:17Z","title":"Habitat 3.0: A Co-Habitat for Humans, Avatars and Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13724","snapshot_observed_at":"2026-08-12T16:45:47.297556Z","title":"Turner, Oleksandr Maksymets, Zsolt Kira, Mrinal Kalakrishnan, Jitendra Malik, Devendra Singh Chaplot, Unnat Jain, Dhruv Batra, Akshara Rai, and Roozbeh Mottaghi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.297556Z"},"links":{"cited_paper":"/paper/2310.13724","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:9ed9e3f7722d52fccc10724d584f1bfc07452679d691fa822ab5e8a812d9e86c","observation_id":"bb1bd04c-aecc-4cc9-89e0-8037a97f1019","resolution":{"observed_at":"2026-08-12T16:45:47.297556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01734","last_updated":"2020-03-31T01:18:33Z","snapshot_observed_at":"2026-08-16T19:41:20.153905Z","submitted_at":"2019-12-03T23:18:59Z","title":"ALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01734","snapshot_observed_at":"2026-08-12T16:45:47.303205Z","title":"ALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday Tasks, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.303205Z"},"links":{"cited_paper":"/paper/1912.01734","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:60538c39d620d7e58d938a2b72d511ac888edefa833cde6ed9a37e6799220f2f","observation_id":"2279356c-1ac0-415b-9d63-798035e8fa5d","resolution":{"observed_at":"2026-08-12T16:45:47.303205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-08-14T16:05:50.720818Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-12T16:45:47.308527Z","title":"A short note on the kinetics- 700 human action dataset","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.308527Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:54c3ac1d69334ea4db647615daf6a4fffffefd4bf8bcc1ed21d047ffb5afa5cd","observation_id":"f0770c95-1ffe-4f66-bf58-fe6bfe25b17b","resolution":{"observed_at":"2026-08-12T16:45:47.308527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.980302Z","title":"BEDD: the minerl BASALT evaluation and demonstrations dataset for training and benchmarking agents that solve fuzzy tasks","venue":null,"work_id":"c9817328-e008-492d-a892-4b983cee36e9","year":2023},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.314036Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:d1446a26509039920a4c2663ea099e7cf201bbfaac5f85f5bd47fb053a5f8cf5","observation_id":"c5d0ccb6-c9d5-4759-9588-a02d4e5e6e0b","resolution":{"observed_at":"2026-08-12T16:45:47.986056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16563","last_updated":"2023-12-04T14:53:15Z","snapshot_observed_at":"2026-08-16T15:44:27.441172Z","submitted_at":"2023-03-29T09:45:50Z","title":"Skill Reinforcement Learning and Planning for Open-World Long-Horizon Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16563","snapshot_observed_at":"2026-08-12T16:45:47.319151Z","title":"Plan4mc: Skill reinforcement learning and planning for open-world minecraft tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.319151Z"},"links":{"cited_paper":"/paper/2303.16563","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:951225df15a103d6f04db624b62a01624873a82a2b478f2e9b2e0df69debb776","observation_id":"7826661d-af97-436e-821c-bab9a859cffa","resolution":{"observed_at":"2026-08-12T16:45:47.319151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.324717Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.324717Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:5ce404e8d930348ebf8396753bf49bdfe64f0ddce37cf070a0300b8a5c52a56c","observation_id":"d2683055-6a7f-4111-9dd9-1f7db5471581","resolution":{"observed_at":"2026-08-12T16:45:47.324717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07143","last_updated":"2024-07-13T14:20:07Z","snapshot_observed_at":"2026-08-18T07:59:02.349146Z","submitted_at":"2022-12-14T10:24:50Z","title":"Reproducible scaling laws for contrastive language-image learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07143","snapshot_observed_at":"2026-08-12T16:45:47.329565Z","title":"Reproducible scaling laws for contrastive language-image learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.329565Z"},"links":{"cited_paper":"/paper/2212.07143","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:325a32823cb86a8a0c9639b0c471709227a39f0e6118f95a91e11ad1b67feda8","observation_id":"e028cb0c-5dc6-43e0-a6a0-b2a019949f23","resolution":{"observed_at":"2026-08-12T16:45:47.329565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-08-13T17:36:16.794649Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-12T16:45:47.334727Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.334727Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:e69b4dd91b387fd1cb9035951def8cfa3dfdd6484138fd70dd367dcbec7128f6","observation_id":"7cb16373-0c7a-453d-b7b7-d9eb3609c871","resolution":{"observed_at":"2026-08-12T16:45:47.334727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-12T16:45:47.339786Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.339786Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:5775ed524e4d168c4c009afaf55b25f174e6dc946ef16ce1a40c021557a0ac93","observation_id":"b1c1dc7f-dd84-4c26-a1f5-56965d91caf5","resolution":{"observed_at":"2026-08-12T16:45:47.339786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-12T16:45:47.344793Z","title":"break-craft","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.344793Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:7c6f71342b6cca8933d6450b0b6d00363da8f8841ecd8aa101424b3996484132","observation_id":"a5599288-1fb0-4b3a-a851-82adc3c08e5a","resolution":{"observed_at":"2026-08-12T16:45:47.344793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.953872Z","title":null,"venue":null,"work_id":"16ddfbcd-75d7-42cb-b2f5-15391ef4f171","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.350936Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:99c1a1553b3701746fc9a9a0b6b05491ec51d8a6928aef7b7f2316bbed73e75e","observation_id":"b56b9f6a-7f3e-411b-b0e0-2f5d1da7985b","resolution":{"observed_at":"2026-08-12T16:45:47.959247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.935986Z","title":"likely does not describe the video","venue":null,"work_id":"e65cc248-605b-4a2e-9e66-d4d5f83c8684","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.356076Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:c210caafe2aa1ac790d7d8bc31ab9f18664b412c278a71e275c614ce3ef18698","observation_id":"0d463477-81d5-4b03-80d1-0e4d632067d4","resolution":{"observed_at":"2026-08-12T16:45:47.941465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.919290Z","title":"Player holds an oak fence block in their hands","venue":null,"work_id":"4643399c-6021-4eac-88a6-6873487b09ec","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.361398Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:7d825093907e829fec4bee2c767238792e5acac4dffa97560d9dff6a111c7fe3","observation_id":"30a37c82-3666-4da5-88af-79c089e76955","resolution":{"observed_at":"2026-08-12T16:45:47.924572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.902873Z","title":null,"venue":null,"work_id":"ae788318-21e1-4dfb-8a6b-3aefe61e0c02","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.366264Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:75baf4713fba58638dd7495a95796287d25fb428bcd3e7ed0eb4b9a41374fbb5","observation_id":"70e1214b-42bd-4e42-9f27-ab6895ef9a60","resolution":{"observed_at":"2026-08-12T16:45:47.907865Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.886503Z","title":null,"venue":null,"work_id":"5df16f21-726f-4c3d-8897-94fcb5080266","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.371881Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:d39b9bf9be75e97bec3443186c3baf02e9333dbfab4dfe3c0f3c20566954140c","observation_id":"df5360ce-2569-4aa7-b5ad-0b5ad313d235","resolution":{"observed_at":"2026-08-12T16:45:47.891764Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.871099Z","title":null,"venue":null,"work_id":"f57fd327-b795-41a5-aa34-a5c4dd24e85c","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.377065Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:0304751284a54de45ca3d24fd8b70f32acbd0c12b95272889900e4fcaf62bac0","observation_id":"a87f0140-0eb4-4f33-af8e-bb5b875d2568","resolution":{"observed_at":"2026-08-12T16:45:47.876042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.852675Z","title":null,"venue":null,"work_id":"e906522b-2a9f-48ef-b546-711fd8c2a095","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.382130Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:53a55109ad3de39fa2f79fea34cbc334d1014961df2c3a78cb482f9dfdea1aea","observation_id":"57397734-49ee-4851-95fa-7ba559af7cbb","resolution":{"observed_at":"2026-08-12T16:45:47.858713Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.835062Z","title":null,"venue":null,"work_id":"dd78f4d6-6cad-4946-9f96-5a41e14f8cba","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.387037Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:8b0dcc9002d1f64103b68dfff071fb4d3f65e58a83cbcd0c49184962c6bf667d","observation_id":"1514cef4-3eb7-405d-aa8d-230ac9932723","resolution":{"observed_at":"2026-08-12T16:45:47.840209Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.818855Z","title":null,"venue":null,"work_id":"632e79d2-cb10-41de-89e2-9596d0426099","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.392457Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:3fb8a7b467c8450c95eef2167933d43100d5d96bfd93df07ccdfd36ea1056431","observation_id":"17260624-6b44-4002-beb6-dc5def08f35c","resolution":{"observed_at":"2026-08-12T16:45:47.823881Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.803170Z","title":null,"venue":null,"work_id":"d9166d08-6801-4ab8-b9d7-2b7cb52d1784","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.397470Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:f223916bb694545f523bb2a852a20c31dc2617accd2f2249b5b57263a855948a","observation_id":"6b87587f-48bf-46ac-b72a-5ea90ab7105e","resolution":{"observed_at":"2026-08-12T16:45:47.807962Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.787949Z","title":null,"venue":null,"work_id":"1f757a3a-4aeb-4057-8438-172bf4271446","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.402130Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:4a98f253b76160d06520e01a73ac60625454cbba99121c93fda82154addc988f","observation_id":"23868eb5-550a-4cdc-aaaf-bc4eb6984541","resolution":{"observed_at":"2026-08-12T16:45:47.792703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.769571Z","title":"Figure 10: The prompt used to obtain frame-by-frame descriptions for Minecraft videos","venue":null,"work_id":"98e24b3d-1d2a-4b5a-ae1f-cd45618b08d0","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.406893Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:22c2db8a67da0181d216f25ae2981152bab77825ce6a9041af8c691a48b8e737","observation_id":"89dd84ec-b538-41e0-aba9-af172bd47aad","resolution":{"observed_at":"2026-08-12T16:45:47.776841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10683","last_updated":"2023-10-21T16:34:03Z","snapshot_observed_at":"2026-08-16T15:32:08.729897Z","submitted_at":"2023-05-18T03:53:59Z","title":"Paxion: Patching Action Knowledge in Video-Language Foundation Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10683","snapshot_observed_at":"2026-08-12T16:45:47.276058Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.276058Z"},"links":{"cited_paper":"/paper/2305.10683","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:5d92e580f30d275c90579476476c8ba2841f61ec23bc9ea572b0fe448b912311","observation_id":"70ef0f7b-7277-46a0-89bb-879759f4bd46","resolution":{"observed_at":"2026-08-12T16:45:47.276058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2411.13211."}