{"as_of":"2026-08-16T18:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:53b76ba2fd140d86f43114c881c84d4c397784e52f282e0e9e6d4a7b197eb32c","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:44:49.592008Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T11:39:15.308355Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T11:40:03.350024Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"cited_work":{"arxiv_id":"2507.15130","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15130","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhanc- ing visual planning with auxiliary tasks and multi-token pre- diction","venue":null,"work_id":"3718eda6-ed58-4744-98bf-a2faa8f983e7","year":2025},"citing_paper":{"arxiv_id":"2602.23058","last_updated":"2026-05-17T06:55:06Z","snapshot_observed_at":"2026-08-16T11:20:25.251810Z","submitted_at":"2026-02-26T14:42:53Z","title":"GeoWorld: Geometric World Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-21T11:39:15.308355Z"},"links":{"cited_paper":"/paper/2507.15130","citing_paper":"/paper/2602.23058"},"observation_digest":"sha256:912cbbabdf3f533ee270e4fd95afb1188652a820734c6f3a054237e418129a8d","observation_id":"115e9f3b-1d83-4ccd-9d0b-7f6cbd293e61","resolution":{"observed_at":"2026-05-21T11:40:03.352082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.15130/citation-record","integrity":"/paper/2507.15130/integrity","json":"/paper/2507.15130/citation-record.json","paper":"/paper/2507.15130"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.170617Z","title":"When will you do what?-anticipating temporal occurrences of activities","venue":null,"work_id":"47ac1765-7c0f-40e0-874f-03f643083aea","year":null},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:43.981738Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:d3e80337bfb1bf4831e0667b23dc62c33f7a2445b7487a431b9d2344c1ca1227","observation_id":"d1ef1572-a27c-4efd-b6ee-8a89deccadc8","resolution":{"observed_at":"2026-08-06T15:44:50.173046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T15:44:44.065986Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:44.065986Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:79b2e5dfb16245b87337f8c498e0b8ff9c94fe04375123d7f086948e48a674be","observation_id":"cb381446-e785-4243-9a8f-b90d5f812668","resolution":{"observed_at":"2026-08-06T15:44:44.065986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:44.155587Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:44.155587Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:a15f8cb15dde4b948768b9a54f26c1d1be3046c43d682a9c8d259f022f9ac9bf","observation_id":"72238229-4323-4029-bb15-8fa4759981fb","resolution":{"observed_at":"2026-08-06T15:44:44.155587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.158651Z","title":"Hiervl: Learning hierarchical video- language embeddings","venue":null,"work_id":"26a793f8-71f4-4b18-9bac-997b139b6216","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:44.281924Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:38e0653479f31da454599e252538e0e549c26b596a52fc2f80a9255f754ed9ff","observation_id":"fff40a00-3055-483b-99c0-73bf8ca694e5","resolution":{"observed_at":"2026-08-06T15:44:50.161138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.151050Z","title":"Procedure planning in instructional videos","venue":null,"work_id":"01e4f963-ed53-471b-b80d-411483f33e25","year":2020},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:44.356600Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:2c02692bb10e6535e42385950644b927bb33a5df5f5be0b3ab6f82e96bcfafee","observation_id":"f9f18253-afc6-42b3-9605-c383a5d72b26","resolution":{"observed_at":"2026-08-06T15:44:50.153750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.143871Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabili- ties","venue":null,"work_id":"f23a56eb-77cf-4f4e-b24b-4dff7b232b1d","year":null},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:44.497438Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:d47a50ed58016fd4dc9d41396479b85d6339ad9d01dbe7dc1d881641096c93b2","observation_id":"fbf579ff-4efe-43d4-889e-b9e8957a91b8","resolution":{"observed_at":"2026-08-06T15:44:50.146331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06722","last_updated":"2024-06-11T06:53:44Z","snapshot_observed_at":"2026-08-16T14:36:01.627076Z","submitted_at":"2023-12-11T03:35:58Z","title":"EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06722","snapshot_observed_at":"2026-08-06T15:44:44.617672Z","title":"Egoplan-bench: Benchmarking egocentric embodied plan- ning with multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:44.617672Z"},"links":{"cited_paper":"/paper/2312.06722","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:256b01034a6e4362bdbb3dfd3a16d9a66cc456e76a316aee7b20378e26992a99","observation_id":"b1b39347-9368-4e03-9849-e3285bb02838","resolution":{"observed_at":"2026-08-06T15:44:44.617672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T15:44:44.712467Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:44.712467Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:92b52ad02f4231a1091d12a2b0ecb9633e6f7f40afb8e523c637f14196e51b25","observation_id":"92f198ec-ee75-48ac-8f2a-66d84f03eb99","resolution":{"observed_at":"2026-08-06T15:44:44.712467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19737","last_updated":"2024-04-30T17:33:57Z","snapshot_observed_at":"2026-08-16T14:11:52.376290Z","submitted_at":"2024-04-30T17:33:57Z","title":"Better & Faster Large Language Models via Multi-token Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19737","snapshot_observed_at":"2026-08-06T15:44:44.806734Z","title":"Better & faster large language models via multi-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:44.806734Z"},"links":{"cited_paper":"/paper/2404.19737","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:9c2c8569e543e78deedaf2558d3027abfe8ae1ab569a51078569df56174e82fd","observation_id":"6c23d4da-96e1-43a4-b120-7c4db34acdaa","resolution":{"observed_at":"2026-08-06T15:44:44.806734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.136199Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"b9119467-5ba8-4ab7-bc2c-a6b2dedadd1b","year":2022},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:44.914759Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:c060ee3eaae12694cfad1997a6ef82bf501d49c452311ea78296c7b1e457b299","observation_id":"9b8f4eb0-eead-471e-a8b0-4397c62e683a","resolution":{"observed_at":"2026-08-06T15:44:50.138897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14992","last_updated":"2023-10-23T07:24:28Z","snapshot_observed_at":"2026-08-15T11:39:07.998070Z","submitted_at":"2023-05-24T10:28:28Z","title":"Reasoning with Language Model is Planning with World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14992","snapshot_observed_at":"2026-08-06T15:44:45.036118Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.036118Z"},"links":{"cited_paper":"/paper/2305.14992","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:afde312757546f4cccbaa5b555282b3e78d20a22e042fe669596d786ba3718fb","observation_id":"1e7b96ed-19db-489a-b249-63f02ce724b2","resolution":{"observed_at":"2026-08-06T15:44:45.036118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T15:44:45.143895Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.143895Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:c77a66a2011204395617a2ae6ceb8ece5184a28337f20681664371f901bd337c","observation_id":"66bf25b6-aa1e-4d23-82b3-1a50ffecafe2","resolution":{"observed_at":"2026-08-06T15:44:45.143895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:45.259004Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.259004Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:07df42139ec3e9569a7c70200aea9f9523dec97dcdf6d0abf5dd2f2b91e06c31","observation_id":"3231d02b-bfad-4a3e-9862-4454351e6988","resolution":{"observed_at":"2026-08-06T15:44:45.259004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.064198Z","title":"Language models as zero-shot planners: Extract- ing actionable knowledge for embodied agents","venue":null,"work_id":"913ff6e1-2c00-415d-adc3-f3f283ec7609","year":2022},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.361973Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:97f9d2698eb28cd972fa3d775cda4fd0951492a82214e35b3784eec1ac678371","observation_id":"b452a7b1-8d21-4b5b-a131-554a48270480","resolution":{"observed_at":"2026-08-06T15:44:50.066608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20557","last_updated":"2024-09-30T17:57:28Z","snapshot_observed_at":"2026-08-16T13:14:01.326783Z","submitted_at":"2024-09-30T17:57:28Z","title":"Propose, Assess, Search: Harnessing LLMs for Goal-Oriented Planning in Instructional Videos","version":1},"cited_work":{"arxiv_id":"2409.20557","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.20557","snapshot_observed_at":"2026-08-06T15:44:49.789289Z","title":"Propose, Assess, Search: Harnessing LLMs for Goal-Oriented Planning in Instructional Videos","venue":"cs.CV","work_id":"ad691b60-ec41-425d-be39-f1ed40f86782","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.482849Z"},"links":{"cited_paper":"/paper/2409.20557","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:0dcf76ba22e9c7286784e6feb48a707698ef4d51577d21c6a14f2d0ed9bd53a1","observation_id":"5ebe8f6a-baad-455f-a467-80ef575e3610","resolution":{"observed_at":"2026-08-06T15:44:49.792034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.057088Z","title":"Palm: Predicting actions through language models","venue":null,"work_id":"084581e3-249c-4e6b-9d45-126ab6133094","year":2025},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.617947Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:ccaa388813b1a9502afb2eae28114401d7a45f21ad068cf522ca6586698fd662","observation_id":"0f03c10e-7a52-4b22-a0c9-7d99c64ba0c9","resolution":{"observed_at":"2026-08-06T15:44:50.059681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T15:44:45.736431Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.736431Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:e60cb9143af29493c6b1ece44fd9662fda4596d1acd6043494abc60161e7af75","observation_id":"df76deea-f9a7-4c2b-9cea-6dc95f0b37bf","resolution":{"observed_at":"2026-08-06T15:44:45.736431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.050234Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"dedcee43-5da6-43bf-920b-e4064d8df947","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.818880Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:29bb2e6c383d532ca54df9bb584aa098752170a3f170d8119f79e2830d8d9b04","observation_id":"bbd8abc5-45e6-4a6a-9c4d-1e2ad8ac49ec","resolution":{"observed_at":"2026-08-06T15:44:50.052622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-06T15:44:45.907158Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.907158Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:61f7b7caceb44ad237d2625ed0f00f11b3243aa2a394667a7a2e90dca92ffcb2","observation_id":"010fbb76-6cf4-4479-82d7-62955d2fc731","resolution":{"observed_at":"2026-08-06T15:44:45.907158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.043357Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"ae0e4acc-ef24-41c6-9423-a955e28e22ed","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.981792Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:37d614a676ad1f613fd9e0f83c26dd2cbb25a804876ccee61a1b0c2ed3b2afe6","observation_id":"8e2c3f67-7f3d-463a-ae90-eab374619d4d","resolution":{"observed_at":"2026-08-06T15:44:50.045748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.035803Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"db5d5a5b-4a9d-4d0d-9c5d-dd923c7519a5","year":2025},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.075955Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:7def4a85ec4a6648c7d69326d2ba569a3587638b580195fe7c817d629f9e8b5f","observation_id":"83e61c2f-2559-4abc-bed2-2b054d6e6cc0","resolution":{"observed_at":"2026-08-06T15:44:50.038452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.028872Z","title":"Skip-plan: Procedure plan- ning in instructional videos via condensed action space learn- ing","venue":null,"work_id":"f913cef5-1af7-42d0-b8e4-f696e76e48f4","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.185631Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:8f8f18200186bb6489b4b701dfa26a6a2b53a15d17cae7875e46f795db5a3378","observation_id":"e32811d9-557a-45dc-8a30-0dcf25808e09","resolution":{"observed_at":"2026-08-06T15:44:50.031304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T15:44:46.272623Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.272623Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:e0ca66a07eff37de0d58d44fa8242182bca46198cc0c1243702ff2db5e70137f","observation_id":"5d031845-fb8f-4d37-83cd-620bed5edc2f","resolution":{"observed_at":"2026-08-06T15:44:46.272623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11477","last_updated":"2023-09-27T07:29:44Z","snapshot_observed_at":"2026-08-12T21:21:48.006892Z","submitted_at":"2023-04-22T20:34:03Z","title":"LLM+P: Empowering Large Language Models with Optimal Planning Proficiency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11477","snapshot_observed_at":"2026-08-06T15:44:46.355848Z","title":"Llm+ p: Empower- ing large language models with optimal planning proficiency","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.355848Z"},"links":{"cited_paper":"/paper/2304.11477","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:e68c2f87ca476dfffb25cc811ec91a717390153a1eac9252e7aac8cff670e766","observation_id":"1826b2e1-b5d0-4166-95ad-9199fcbaf75d","resolution":{"observed_at":"2026-08-06T15:44:46.355848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.021865Z","title":"Visual instruction tuning","venue":null,"work_id":"cd9237af-cc63-4ce5-87b9-7972202f63a7","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.434456Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:321d0c9540eaedc94d740de3c7b8d2b6dabaeba9b5101c935edb31f46f84d62c","observation_id":"0d423aea-4a84-411c-8400-7a297d87cd58","resolution":{"observed_at":"2026-08-06T15:44:50.024103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.014534Z","title":"A language-first approach for procedure planning","venue":null,"work_id":"24df45cc-699b-4cad-9e7f-acdf9055cfdf","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.528710Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:8b6c24f99d6e3628ce66dbfae325310240a82467a81426ebe5c2162f95fde330","observation_id":"19b722b5-fe3a-422c-807c-cf83d362d10d","resolution":{"observed_at":"2026-08-06T15:44:50.017054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.007051Z","title":"Intention-conditioned long-term human egocentric action anticipation","venue":null,"work_id":"80961b54-4064-4366-9ce5-fd10000193b1","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.610609Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:3864a9c284a8d025349a2a0f5e73eeab4a7b98231cfeac288ee754dac43dc926","observation_id":"ec54eccf-757e-4470-a178-8c20ac2ca022","resolution":{"observed_at":"2026-08-06T15:44:50.009663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.999645Z","title":"Can’t make an omelette without breaking some eggs: Plausible action anticipation using large video- language models","venue":null,"work_id":"6f807542-d63f-44a8-ac25-5dde79d575c8","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.680605Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:1f0da1f83282d9672adadbb4d139c3c57d8a630925aface49fe8618caa1d6713","observation_id":"e70b9c84-0c3a-4466-b36c-262583ebbfa4","resolution":{"observed_at":"2026-08-06T15:44:50.002240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.991549Z","title":"Any- mal: An efficient and scalable any-modality augmented lan- guage model","venue":null,"work_id":"2584af62-0734-4004-a34a-9bfa152c9292","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.734541Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:e2cede25df07e1613063f8e4a124f3b7e0639b60c5e559f8443b7fc0bf898a01","observation_id":"7e57bf75-9560-4cb3-a881-8c99d592fa92","resolution":{"observed_at":"2026-08-06T15:44:49.994645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.983869Z","title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought","venue":null,"work_id":"63944f1b-2106-4c49-8ca9-56970f8d8097","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.817312Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:a4a65e4699115c6df0576d0521bb74b2d4ededa3d0db85d1e4f693146e794c9e","observation_id":"acc44834-e809-4f34-9a37-ff9452287226","resolution":{"observed_at":"2026-08-06T15:44:49.986211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.976517Z","title":"Ego-topo: Environment affordances from egocentric video","venue":null,"work_id":"a8bd20c3-5657-4f30-a1cb-10639f4dba1a","year":2020},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.889917Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:f4610a87ecc5ff36f229c2b9bf30f3d86b6d58cc5a7d21d4e2447d6fdf89ad4f","observation_id":"c0cd7f5f-bff3-49d8-b818-96adb1df2653","resolution":{"observed_at":"2026-08-06T15:44:49.979003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.968986Z","title":"Why not use your text- book? knowledge-enhanced procedure planning of instruc- tional videos","venue":null,"work_id":"5a1a1bef-5017-4a81-82de-52eb84bec433","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.976969Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:f7c4429e9ad849dbad8c0379e027375c29d274584bb6681dccaf0e5d3a6103be","observation_id":"b8de1b13-6e6a-4cc0-b53e-59a503d393c0","resolution":{"observed_at":"2026-08-06T15:44:49.971464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.961546Z","title":"Re- thinking learning approaches for long-term action anticipa- tion","venue":null,"work_id":"f6f43d17-c7a8-41cc-ac17-4d664712820a","year":2022},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.046680Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:bc532fe47e22f2e3a8521b1a6c4ff094236a65fbe0fe5b9e76d32a434ef25c3f","observation_id":"4d55b9dd-512e-4f59-9f33-0bc19cd72ffc","resolution":{"observed_at":"2026-08-06T15:44:49.964005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10488","last_updated":"2024-09-16T17:22:18Z","snapshot_observed_at":"2026-08-16T13:18:05.651849Z","submitted_at":"2024-09-16T17:22:18Z","title":"Do Pre-trained Vision-Language Models Encode Object States?","version":1},"cited_work":{"arxiv_id":"2409.10488","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10488","snapshot_observed_at":"2026-08-06T15:44:49.749031Z","title":"Do Pre-trained Vision-Language Models Encode Object States?","venue":"cs.CV","work_id":"f14ed7bb-137b-48fe-b1d2-10f2b30b5a0b","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.143277Z"},"links":{"cited_paper":"/paper/2409.10488","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:51279d9a77df53c29dfc4d9578a82b5bd326822727314a82c4aa77e9795b19a1","observation_id":"003f8245-b33f-43fc-8cb8-f28d80703fbb","resolution":{"observed_at":"2026-08-06T15:44:49.751802Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01599","last_updated":"2024-03-03T19:53:06Z","snapshot_observed_at":"2026-08-16T14:13:18.284643Z","submitted_at":"2024-03-03T19:53:06Z","title":"SCHEMA: State CHangEs MAtter for Procedure Planning in Instructional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01599","snapshot_observed_at":"2026-08-06T15:44:47.232091Z","title":"Schema: State changes matter for pro- cedure planning in instructional videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.232091Z"},"links":{"cited_paper":"/paper/2403.01599","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:3c4905d31c22b0d833f5bf637de6a8ad5a86dbe800af7805a01e30e9f3201a4b","observation_id":"23e267b8-7b9e-44fa-ba12-6ecdce73340d","resolution":{"observed_at":"2026-08-06T15:44:47.232091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.953866Z","title":"Pretrained language models as visual planners for human assistance","venue":null,"work_id":"63ef98f1-008f-4d1f-843a-ccb640d156b7","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.334176Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:3c179403cccea28d424d25bcc267acd24794ae2a95e36a7f886f93bf966f46d1","observation_id":"eb7d0d66-827a-41ca-975d-84c6678d8883","resolution":{"observed_at":"2026-08-06T15:44:49.956596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18070","last_updated":"2024-07-01T02:44:11Z","snapshot_observed_at":"2026-08-16T13:39:33.398967Z","submitted_at":"2024-06-26T05:01:37Z","title":"EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18070","snapshot_observed_at":"2026-08-06T15:44:47.422726Z","title":"Egovideo: Exploring egocentric founda- tion model and downstream adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.422726Z"},"links":{"cited_paper":"/paper/2406.18070","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:2a99a6637067cec48298ff082665f271991ba38b4cdd2fb5858bc88b53755ea0","observation_id":"ad121c6a-9f47-4e65-820a-c8f927d7c9d2","resolution":{"observed_at":"2026-08-06T15:44:47.422726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-06T15:44:47.520419Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.520419Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:d01039546ca0091dd629c3f022c0b8d0134108af90b4517425944f45e5dad466","observation_id":"212abde4-2bc1-42ed-82a1-c02e251bec32","resolution":{"observed_at":"2026-08-06T15:44:47.520419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:47.619011Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.619011Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:8e2d3733a0371913acf1d1efab50de25ea9a6758fef7456bdc3a093d527f8fe6","observation_id":"8d5e895f-1c46-43d7-9700-6300edf4e55b","resolution":{"observed_at":"2026-08-06T15:44:47.619011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.941863Z","title":"Llm-planner: Few-shot grounded planning for embodied agents with large language models","venue":null,"work_id":"e12a410b-93b6-4562-8cba-f33a57404818","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.715754Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:132fd47f1216a00590f3c16886db863c4460acab2296660d73c0e1ac3d762f6f","observation_id":"9f2e9711-22f4-4fe6-98c5-e186b4b5e058","resolution":{"observed_at":"2026-08-06T15:44:49.944499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:47.800874Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.800874Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:3dc9e8af703869c8f0b054279e3c33950244e055526edc43a6160a6dd5e600a6","observation_id":"0332c79f-4bd2-4097-a37d-4d215e106510","resolution":{"observed_at":"2026-08-06T15:44:47.800874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.930137Z","title":"Coin: A large-scale dataset for comprehensive instructional video analysis","venue":null,"work_id":"2a3fc59b-042a-4f0f-a531-81b2174fa6e7","year":2019},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.933683Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:eb1210a5a0b8b198572c18434e79db5d615c4bbeb29a19345208d81ea4e9da67","observation_id":"5d54eda3-0659-45a6-9c88-e1e0f13aaf97","resolution":{"observed_at":"2026-08-06T15:44:49.932602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01090","last_updated":"2024-11-06T11:44:50Z","snapshot_observed_at":"2026-08-16T13:56:03.923062Z","submitted_at":"2024-05-02T08:43:16Z","title":"Learning Multiple Object States from Actions via Large Language Models","version":2},"cited_work":{"arxiv_id":"2405.01090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01090","snapshot_observed_at":"2026-08-06T15:44:49.714421Z","title":"Learning Multiple Object States from Actions via Large Language Models","venue":"cs.CV","work_id":"2bea8894-1c1b-428b-9e6d-d126270eab32","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.030903Z"},"links":{"cited_paper":"/paper/2405.01090","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:3a3a8fa6790f7e2f8eadf0c8b2167d8f96994f0f11875101824a52d2dc287448","observation_id":"f219ca49-d55a-4d09-96f2-08470039b654","resolution":{"observed_at":"2026-08-06T15:44:49.717370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T15:44:48.175250Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.175250Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:f9bf0ac57daae92c103edf24a6685d9c093326d7d41a79543b1dc5d939bd92d0","observation_id":"5f6f2c71-ab4a-44a8-a5de-3d2bf337fcc5","resolution":{"observed_at":"2026-08-06T15:44:48.175250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03160","last_updated":"2024-08-12T01:59:00Z","snapshot_observed_at":"2026-08-16T13:28:42.466046Z","submitted_at":"2024-08-04T06:12:42Z","title":"User-in-the-loop Evaluation of Multimodal LLMs for Activity Assistance","version":2},"cited_work":{"arxiv_id":"2408.03160","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.03160","snapshot_observed_at":"2026-08-06T15:44:49.694895Z","title":"User-in-the-loop Evaluation of Multimodal LLMs for Activity Assistance","venue":"cs.CV","work_id":"0bb37d01-9386-41c2-a152-61c1a3b68d20","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.352122Z"},"links":{"cited_paper":"/paper/2408.03160","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:f0e304dda8702f21e1fb1d8baf638795d7bc49848f2d9044bde57d734b16c04c","observation_id":"ddc243e0-b54d-4218-ba0d-974bfd281f57","resolution":{"observed_at":"2026-08-06T15:44:49.697709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.922867Z","title":"Event-guided procedure planning from in- structional videos with text supervision","venue":null,"work_id":"f32c699b-7974-43b0-89bb-f68ec1e42343","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.507610Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:a5562f872a97516b6318a39b964ea148cc0ff99af2ff43ab8ba2a2d116beafc8","observation_id":"3b647031-8ff2-4b39-9107-29dbc407fde3","resolution":{"observed_at":"2026-08-06T15:44:49.925468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.915073Z","title":"Pdpp: Projected diffusion for procedure planning in instructional videos","venue":null,"work_id":"b4013855-25d1-47e3-bdbd-ce2c070140f8","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.650999Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:2caf003a76f3af586c712084cb5dc4b6de2c255091cbc5996ddfb369fcb41220","observation_id":"7bd79037-3e2b-4fd2-afcb-c52500d9e309","resolution":{"observed_at":"2026-08-06T15:44:49.917737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13627","last_updated":"2024-07-13T22:10:57Z","snapshot_observed_at":"2026-08-16T14:41:05.754607Z","submitted_at":"2023-11-22T17:44:24Z","title":"Vamos: Versatile Action Models for Video Understanding","version":3},"cited_work":{"arxiv_id":"2311.13627","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.13627","snapshot_observed_at":"2026-08-06T15:44:49.684407Z","title":"Vamos: Versatile Action Models for Video Understanding","venue":"cs.CV","work_id":"996a7071-91ef-426f-b328-432e8e9d29c3","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.688715Z"},"links":{"cited_paper":"/paper/2311.13627","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:ceb4416c2a0427312d6fdc77b25693d8bd47ef346602d1d502239a8b72441abd","observation_id":"9cb4e834-73d3-49bc-aaee-44abd6ea5728","resolution":{"observed_at":"2026-08-06T15:44:49.687256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.907020Z","title":"Learn- ing object state changes in videos: An open-world perspec- tive","venue":null,"work_id":"887e9b5f-1149-419b-8bfc-86dc9c914e56","year":null},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.748675Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:d7227e126a246cbdad967f25a7088997a271570d3c6d1c755fdd0618e09cfadb","observation_id":"a088458d-7634-4f1c-8ca8-51e26ea5be01","resolution":{"observed_at":"2026-08-06T15:44:49.909513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.899336Z","title":"Octopus: Embodied vision- language programmer from environmental feedback, 2023","venue":null,"work_id":"908e00cd-2436-47b0-a975-79ce70cab87c","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.801693Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:71e1e42793200e99fb21198f70a21e99ee208f4d43bbdafb771e07e4983839df","observation_id":"956f8e27-856e-4355-936d-0666a9808099","resolution":{"observed_at":"2026-08-06T15:44:49.901873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18600","last_updated":"2024-09-25T14:20:39Z","snapshot_observed_at":"2026-08-16T14:05:52.632724Z","submitted_at":"2024-03-27T14:22:40Z","title":"RAP: Retrieval-Augmented Planner for Adaptive Procedure Planning in Instructional Videos","version":2},"cited_work":{"arxiv_id":"2403.18600","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.18600","snapshot_observed_at":"2026-08-06T15:44:49.670915Z","title":"RAP: Retrieval-Augmented Planner for Adaptive Procedure Planning in Instructional Videos","venue":"cs.CV","work_id":"f54d139a-3a41-4ac3-92e1-71c67a818d17","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.842813Z"},"links":{"cited_paper":"/paper/2403.18600","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:4cdc58241805fdc958b1965ccf2fc1d26680ba1e21d46ed16aff16bc88029ea0","observation_id":"1d5423c0-02f8-49f9-9e76-ff78bfff4087","resolution":{"observed_at":"2026-08-06T15:44:49.675996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.891362Z","title":"Object-centric video representation for long-term action anticipation","venue":null,"work_id":"a54eca2e-e0c2-4d3a-aee0-a59766e10662","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.910963Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:33185de946c9554a2a7e8f00d33078c13d8ff66f46c3b3ffed47ed67bf04f1f4","observation_id":"a03f4ecb-e404-4648-bf90-07472dcd2fc3","resolution":{"observed_at":"2026-08-06T15:44:49.894247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T15:44:48.976855Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.976855Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:e4016fff220a75ebae7593be8438f45caf9ecdf8015fb5f1cd3b1430c8c2a20e","observation_id":"23a278c6-bd3f-43e7-ab9b-259c65b1eb56","resolution":{"observed_at":"2026-08-06T15:44:48.976855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.883376Z","title":"P3iv: Prob- abilistic procedure planning from instructional videos with weak supervision","venue":null,"work_id":"a926041c-216b-4eb2-8487-773f90b4469f","year":2022},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:49.021366Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:6df2391d395a28b7a87a52d501989a8bc5872a3e621ad2a723f07308a82ddd02","observation_id":"b78c2393-32b0-4215-884f-cf024c8db353","resolution":{"observed_at":"2026-08-06T15:44:49.886095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16368","last_updated":"2024-04-01T01:33:53Z","snapshot_observed_at":"2026-08-16T15:12:07.171085Z","submitted_at":"2023-07-31T02:14:19Z","title":"AntGPT: Can Large Language Models Help Long-term Action Anticipation from Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16368","snapshot_observed_at":"2026-08-06T15:44:49.029086Z","title":"Antgpt: Can large language models help long- term action anticipation from videos? arXiv preprint arXiv:2307.16368, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:49.029086Z"},"links":{"cited_paper":"/paper/2307.16368","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:3a8f7b9df0af3e8323ef0a3db7273dd193f67d54c3b5b13912d0b894110e5372","observation_id":"70571645-9ad2-4347-bea0-571aa42e7e8b","resolution":{"observed_at":"2026-08-06T15:44:49.029086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.875739Z","title":"Towards learning a generalist model for embod- ied navigation","venue":null,"work_id":"990c59dd-71d1-47df-bae5-a1c2deb42c7f","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:49.034663Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:136c35b615b0506e3be1ed919f3b24b1864a1ace9d37088e37d476db6e0f52e6","observation_id":"653059be-6758-4f8a-ad93-a510d079ded0","resolution":{"observed_at":"2026-08-06T15:44:49.878331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.120307Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:49.120307Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:84d970533a76fcf35c9b32acc5426f020f8eb9898b4ec7debfe3b31f37706823","observation_id":"c8f553c1-b4d0-4bc1-9634-e562077195be","resolution":{"observed_at":"2026-08-06T15:44:49.120307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T15:44:49.190266Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:49.190266Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:8ee88a4ee2fbe50e203b2dc8e30f4218332751c91e0e816dc9175c524926c024","observation_id":"ed1535af-4470-4e8e-bb0b-5efafbe389f7","resolution":{"observed_at":"2026-08-06T15:44:49.190266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.863839Z","title":"Cross- task weakly supervised learning from instructional videos","venue":null,"work_id":"0b03fc74-dd13-4eef-8161-a37a70a4b591","year":2019},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:49.288340Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:0caca7eba42946f6b31d05b18fa7c565bf8227a24c148830ba76026689e99e74","observation_id":"58977a31-b981-4e08-ae42-3f13da79417e","resolution":{"observed_at":"2026-08-06T15:44:49.866298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.856534Z","title":"before” with “after","venue":null,"work_id":"f3dc8adb-0f0a-420c-a35d-d2bff00e6109","year":null},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:49.417662Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:664b2de679a0ca9a6e9926ae104f8edc7dbe370e9b770b78716170a349775e9a","observation_id":"aa874697-635c-4d25-8905-c864c4106a8e","resolution":{"observed_at":"2026-08-06T15:44:49.858942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.849005Z","title":"Training We train our model for 1 epoch with a batch size of 1024","venue":null,"work_id":"48172f7a-62cf-4532-bb54-e711b793489f","year":null},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:49.495928Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:cb6ae1c3378a292310059c5207b58e44a25494b097d9f21896907e3a09467d79","observation_id":"df875fdf-dfaf-490e-b2ae-bd12d17b3fe7","resolution":{"observed_at":"2026-08-06T15:44:49.851659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.841105Z","title":"dough”, “container","venue":null,"work_id":"5fa08f45-3d4e-419a-a4ea-f96d2b8b3c24","year":null},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:49.592008Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:6ba15faac6e09c25d22ce337cce03acf2845f95affd2719dd3c86a89e663163e","observation_id":"889eb96f-8bc6-4f6a-b0ec-b5d88ce41d6b","resolution":{"observed_at":"2026-08-06T15:44:49.843986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T02:34:16.599342Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":6,"verified_fuzzy":34},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2507.15130."}