{"as_of":"2026-08-19T05:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:efb39c1986d5a03322216e670d80f970cffb5b1aa4f2accee9df8135088e8bae","coverage":[{"denominator":91,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:27:18.614377Z","state":"measured"},{"denominator":94,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":94,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T22:00:28.350003Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:27:15.161769Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.12231","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12231","snapshot_observed_at":"2026-07-02T17:27:15.161769Z","title":"Install: Context-aware instructional task assistance with multi-modal large language models","venue":null,"work_id":"a201cef5-73f6-4932-b72a-a808a598a761","year":2025},"citing_paper":{"arxiv_id":"2511.18127","last_updated":"2026-05-15T06:06:57Z","snapshot_observed_at":"2026-08-17T15:14:40.490371Z","submitted_at":"2025-11-22T17:22:24Z","title":"SFHand: Learning Embodied Manipulation by Streaming Egocentric 3D Hand Forecasting","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T17:53:19.002603Z"},"links":{"cited_paper":"/paper/2501.12231","citing_paper":"/paper/2511.18127"},"observation_digest":"sha256:306521eb94258f08e399993cc439fcf60ab7fc7faec92f69176869a15d2a9cfe","observation_id":"1a817673-2a56-4d5d-916d-4a9b06e41a2b","resolution":{"observed_at":"2026-05-21T17:54:18.278334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.12231","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12231","snapshot_observed_at":"2026-07-02T17:27:15.161769Z","title":"Install: Context-aware instructional task assistance with multi-modal large language models","venue":null,"work_id":"a201cef5-73f6-4932-b72a-a808a598a761","year":2025},"citing_paper":{"arxiv_id":"2604.03486","last_updated":"2026-04-08T04:29:20Z","snapshot_observed_at":"2026-08-11T04:39:37.187316Z","submitted_at":"2026-04-03T22:17:10Z","title":"VisionClaw: Always-On AI Agents through Smart Glasses","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T18:12:34.183092Z"},"links":{"cited_paper":"/paper/2501.12231","citing_paper":"/paper/2604.03486"},"observation_digest":"sha256:e7e55725d98a77cac02590e3124290ac664aa4b03b2161369832b99078a50c91","observation_id":"94abaaac-ea99-486a-89b4-b240171202ed","resolution":{"observed_at":"2026-05-13T18:13:05.498964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.12231","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12231","snapshot_observed_at":"2026-07-02T17:27:15.161769Z","title":"Install: Context-aware instructional task assistance with multi-modal large language models","venue":null,"work_id":"a201cef5-73f6-4932-b72a-a808a598a761","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2501.12231","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:7c054bdb31ebce32b4d8f488b45d5f1bfb30af6853bbe81344caa7c062c9399f","observation_id":"3b18f4b1-b9d9-41b9-9fb7-55667d3f9008","resolution":{"observed_at":"2026-07-02T17:27:15.163371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12231/citation-record","integrity":"/paper/2501.12231/integrity","json":"/paper/2501.12231/citation-record.json","paper":"/paper/2501.12231"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T17:27:18.147094Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.147094Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:fe40cd92ee557a554a4ae0f42e39729f3a9ff39d1e913748cc8418138c6dca2e","observation_id":"0f054d61-0dba-499f-bdf7-2471f4a6d132","resolution":{"observed_at":"2026-08-10T17:27:18.147094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.153382Z","title":"Ht-step: Aligning instructional articles with how-to videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.153382Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:8c88b1b10bd91dfc489ac595c189173ac23a83dfc92d89029e63effe4b426be4","observation_id":"bbc7e294-1f2e-42a4-baa8-c94c11f1c69b","resolution":{"observed_at":"2026-08-10T17:27:18.153382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.159361Z","title":"Unsuper- vised learning from narrated instruction videos","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.159361Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:7d04ca9f6d809e531fc27264f6cd2e12483656aad0c44fdab0c36bbef7bc79a9","observation_id":"0fd5688d-92c4-439c-9b05-de697e4f6142","resolution":{"observed_at":"2026-08-10T17:27:18.159361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.164584Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.164584Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:3366bf1d9c945852c5b342fd946fa69ff5dc43297ae896fcccae8fb331c08842","observation_id":"3a441990-3e0c-4b3b-9787-2254fbc2ab74","resolution":{"observed_at":"2026-08-10T17:27:18.164584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.169866Z","title":"Localizing moments in video with natural language","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.169866Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:f188cfc22c0b6c9f9eac11d129934c1f5dc4dcce6f3fbbe9c9b1ba6b8f10691f","observation_id":"c9fb148e-45cb-41a0-b77a-feb5ee36bcc4","resolution":{"observed_at":"2026-08-10T17:27:18.169866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.175183Z","title":"https://www.anthropic.com/news/developing- computer-use, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.175183Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:0402675263960c3fc8d5808aea8983a4f8fe01b71e7261e83961823cf5361591","observation_id":"f91d33f1-4595-4952-b0cb-f65cf552446a","resolution":{"observed_at":"2026-08-10T17:27:18.175183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.180832Z","title":"Video-mined task graphs for keystep recognition in instructional videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.180832Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:9200b44f71ba66075f8c2a5e764b7f63cad614b2f73ebe85b0de0623b47d30f2","observation_id":"f612e43d-53cd-4fbc-b5f4-4c457b0e5899","resolution":{"observed_at":"2026-08-10T17:27:18.180832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.186508Z","title":"Detours for navigating instructional videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.186508Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:d4719fb091178ea020efb4c1a6c882e244f04f2f2347fa75c0c79229a630215a","observation_id":"bd3ec09d-363e-4712-a532-65b93d9943f6","resolution":{"observed_at":"2026-08-10T17:27:18.186508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.191609Z","title":"Is space-time attention all you need for video understanding? In ICML, page 4, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.191609Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:7d4ae9f8f0b4874bff9d3102bd873f3f736dd4cc3faaca45d895f9968b3b009b","observation_id":"6a74ed87-5bf5-4e06-b027-655d79e4f239","resolution":{"observed_at":"2026-08-10T17:27:18.191609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.196739Z","title":"Procedure planning in instructional videos via contextual modeling and model-based policy learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.196739Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:2a921d4155b16f9bc289987c713fef2d1923277e13426dc32bdf4e2084816f62","observation_id":"5a9d14d8-935c-4e9b-a745-08498ce1091a","resolution":{"observed_at":"2026-08-10T17:27:18.196739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.201677Z","title":"Activitynet: A large-scale video bench- mark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.201677Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:d20c8173f73a2984887959edbd4b9de722ecf8c7e8db4d92fca0b2765cbb964e","observation_id":"fe6c2e33-9f1f-4e96-bbd2-b2531c6b019d","resolution":{"observed_at":"2026-08-10T17:27:18.201677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.206432Z","title":"Procedure planning in instructional videos","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.206432Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:ec8b9694bb06b987aae734b0cd7333cfc616435137574a453397edb548f0dd6c","observation_id":"ef2fe9c7-d606-4e31-9992-1f3a3d34a5f7","resolution":{"observed_at":"2026-08-10T17:27:18.206432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:20.071259Z","title":"Temporally grounding natural sentence in video","venue":null,"work_id":"06c8c049-c40b-45d0-999a-35457d73f7a8","year":2018},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.211601Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:35da53696a7da4264f3f18f26710db486e0664ac64413a582479215dd6541d29","observation_id":"9c129299-5f51-4509-88bb-069ccd546940","resolution":{"observed_at":"2026-08-10T17:27:20.077125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:20.045583Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":"420c7c23-e247-4ae4-b48c-fce63f459b0e","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.216331Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:ebf072fcd48ef57300d747410a00dbcb91321d9f1196deca1fcadb6f85c204bb","observation_id":"0564b7c4-b66d-427d-b20f-8925c9539acf","resolution":{"observed_at":"2026-08-10T17:27:20.051969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:20.026993Z","title":"Semantic proposal for activity localization in videos via sentence query","venue":null,"work_id":"aaa689ff-39e0-4fb0-8db7-0c6f2fe83acc","year":2019},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.221166Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:de18db5815ae6e735bc3dcfbb353a0102375bac94f395d1d2671bfe11a1a096c","observation_id":"86bbecf3-2c85-4636-a1de-28804f6ceac4","resolution":{"observed_at":"2026-08-10T17:27:20.032877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:20.008102Z","title":"KGPT: Knowledge-grounded pre-training for data-to-text generation","venue":null,"work_id":"f932bb4a-f0ec-42bd-9fde-a2a0bfbc9139","year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.226036Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:10e7db4257f707238b3d03003dac26b7025d83e48ff09f05ee3546d2db227e9e","observation_id":"f00acf7c-0e9b-4e87-bb24-a4de1732b50c","resolution":{"observed_at":"2026-08-10T17:27:20.014111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.990126Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"a99f5571-f657-4873-b8ec-5a426ebabb9d","year":2021},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.230690Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:ffe73d382a47a04839de94bbd694443eb6b1056bc1c6849184c4906b0fc762b6","observation_id":"c78474aa-08c1-4bfe-9001-d22221ae367e","resolution":{"observed_at":"2026-08-10T17:27:19.995691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16130","last_updated":"2025-02-19T10:49:41Z","snapshot_observed_at":"2026-08-16T12:38:40.131901Z","submitted_at":"2024-04-24T18:38:11Z","title":"From Local to Global: A Graph RAG Approach to Query-Focused Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16130","snapshot_observed_at":"2026-08-10T17:27:18.235459Z","title":"From local to global: A graph rag approach to query-focused summarization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.235459Z"},"links":{"cited_paper":"/paper/2404.16130","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:66d400cf4c760a375b72f3f150cfe951e21f05f105b7855fde5ba9c4a5ddd960","observation_id":"2ed87957-4a6a-47db-acb3-e2d79d793410","resolution":{"observed_at":"2026-08-10T17:27:18.235459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07409","last_updated":"2023-09-14T03:25:37Z","snapshot_observed_at":"2026-08-16T15:14:33.322437Z","submitted_at":"2023-09-14T03:25:37Z","title":"Masked Diffusion with Task-awareness for Procedure Planning in Instructional Videos","version":1},"cited_work":{"arxiv_id":"2309.07409","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.07409","snapshot_observed_at":"2026-08-10T17:27:18.789177Z","title":"Masked Diffusion with Task-awareness for Procedure Planning in Instructional Videos","venue":"cs.CV","work_id":"e0659bfa-e332-41d1-b501-4ed03522e36e","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.240608Z"},"links":{"cited_paper":"/paper/2309.07409","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:f6f7e89a45cd71c4d71f164676209f9e4752178e1eb1e549cb55707136871ac7","observation_id":"d04cc3f4-08c4-41c6-bd1a-7323530553ce","resolution":{"observed_at":"2026-08-10T17:27:18.797148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.972639Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"cbe0a6fe-0f94-4f5b-9d31-15373c892436","year":2019},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.246444Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:dc7c569ed6b63d6ff33750c591133cae4f8627733e98df8259779eadef6097d7","observation_id":"b72e409f-5eea-483d-8074-0b85a7d1c6be","resolution":{"observed_at":"2026-08-10T17:27:19.977834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.251469Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.251469Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:5831e4c810ed4aeaf8396ad64f2b88a53bc71de474269ac6f61183d8d4a3ed29","observation_id":"248d6cc9-cd8e-4fe7-aeb6-f54c9509f8ed","resolution":{"observed_at":"2026-08-10T17:27:18.251469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-10T17:27:18.256148Z","title":"Retrieval- augmented generation for large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.256148Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:4e2c40862558475ed65d1b6873d7affd4b4f12c0f5cf09eb6a50625c1a95ca4f","observation_id":"629d54ac-d2a0-4cf0-a721-22f9663b7c5e","resolution":{"observed_at":"2026-08-10T17:27:18.256148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.261755Z","title":"Mac: Mining activity concepts for language-based temporal local- ization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.261755Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:c2566b80b6217676c8a82bc62d004b99b2ee1c65f3c2ce3920cc4a7621de6b2a","observation_id":"cc755edc-ea2f-4e1c-8cd0-93431f93e330","resolution":{"observed_at":"2026-08-10T17:27:18.261755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.266660Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.266660Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:eec2e8a8a15844a1a3719297392c78e23e1d9d878f2e63ead49af19546ba1af9","observation_id":"537d9060-b12a-4da7-8cec-e84dec96dfc6","resolution":{"observed_at":"2026-08-10T17:27:18.266660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.923160Z","title":"Radar: automated task planning for proactive decision support","venue":null,"work_id":"e5a7f6db-81bc-489b-9b3f-46bbda0e5a55","year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.271492Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:5774b033042dc7949a3cf6f3451eabcc72c8e5647046c5a7de6f06fe478f7c0a","observation_id":"81d1ae0f-f85d-46d6-b357-d1cc5c09400d","resolution":{"observed_at":"2026-08-10T17:27:19.928432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.904028Z","title":"Retrieval augmented language model pre- training","venue":null,"work_id":"ca232471-604f-489d-aae2-584225a724cd","year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.276299Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:4a2037fa37d65217ab5818a9a0f7243285f72504eafc33735829914e7e4ab1eb","observation_id":"170d0ab5-d947-44b1-9229-e48d410d753d","resolution":{"observed_at":"2026-08-10T17:27:19.911731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.886427Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":"e1a27699-2a00-4bfc-b02f-3596b3ebb3b5","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.281075Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:45f3e205a15e4d722daae26ddd497471df4cf71905b3d00b37286e451c549b72","observation_id":"246d6b37-dad7-46cf-83e6-2d983773ddd9","resolution":{"observed_at":"2026-08-10T17:27:19.892002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.286179Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.286179Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:f8add948e5a35abceb8d2058003b091fdac77066a4553b849f1cda716fdd7af6","observation_id":"fd43daab-b8d6-491e-b28b-8a999a1cfcae","resolution":{"observed_at":"2026-08-10T17:27:18.286179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.858515Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":"84f8c44f-cb66-4585-bb26-30b4cae87e12","year":2022},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.291143Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:584c6a18241f02dd2ba8f89e6ae95d2853ea539b129d29d1af4736fdadcace76","observation_id":"2d50f50e-e48c-4099-b735-611dcdb025ad","resolution":{"observed_at":"2026-08-10T17:27:19.864426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.840818Z","title":"Audiogpt: Understanding and generating speech, music, sound, and talking head","venue":null,"work_id":"630a7b36-5e30-4767-83cb-05fa1cfa52d5","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.296118Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:9eb7fabe58031b9a7fc4d9a1f07792ab98a77db5607f212e1c756077bf97a1ad","observation_id":"048154c4-394f-48b6-a5e4-456912107e24","resolution":{"observed_at":"2026-08-10T17:27:19.846787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.824316Z","title":"Language is not all you need: Aligning perception with language models","venue":null,"work_id":"757f2d1f-e700-489f-b83e-741f8302efea","year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.301317Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:d561349df80918533d0fddbf619f8d3f7e14446468db547cd0338de9f2d403d1","observation_id":"b5ed1157-9431-4931-a58e-1f8b0c20658a","resolution":{"observed_at":"2026-08-10T17:27:19.829639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.807266Z","title":"Leveraging passage retrieval with generative models for open domain question answering","venue":null,"work_id":"f94bc3e1-f6d4-4466-bc36-e433ad182201","year":2021},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.306835Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:bfc8219488d9afc2b2565f59bfef170f348156a2168295e0520ffe870d2618d1","observation_id":"300761ce-e88f-4c10-981d-959ac6b77067","resolution":{"observed_at":"2026-08-10T17:27:19.813004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T17:27:18.311567Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.311567Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:c71cdabb542de82727be3614d291bbec803699afc5b6b9cd2b4340de88a09805","observation_id":"3ef6a6de-5536-4722-b939-7b113c4ef4fa","resolution":{"observed_at":"2026-08-10T17:27:18.311567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.317157Z","title":"Gen- erating images with multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.317157Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:d997d8eb6da14bde1de470f895f5749ee5fedb624c9fbf30d6eac27ed31f0008","observation_id":"a0310a70-554e-4f9b-9f44-de75ffca7a9a","resolution":{"observed_at":"2026-08-10T17:27:18.317157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.09305","last_updated":"2018-10-18T05:29:41Z","snapshot_observed_at":"2026-08-14T18:12:51.564754Z","submitted_at":"2018-10-18T05:29:41Z","title":"WikiHow: A Large Scale Text Summarization Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.09305","snapshot_observed_at":"2026-08-10T17:27:18.322049Z","title":"Wikihow: A large scale text summarization dataset","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.322049Z"},"links":{"cited_paper":"/paper/1810.09305","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:e0bb681aedf250a4907d893dc1cd625cdb9a832006b87ef0cd6ce3c00debf388","observation_id":"1aa40df6-34c4-4764-9a09-ecfe61dc25a9","resolution":{"observed_at":"2026-08-10T17:27:18.322049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.779599Z","title":"A survey on temporal sentence grounding in videos","venue":null,"work_id":"eb386220-d646-488a-b958-28b819034b20","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.328096Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:79477115aedfadf8103cb5438f2ed9fae8c5a0a548b42ac0348111e761124827","observation_id":"9bad06d2-7f42-44ae-96b8-95d227ef9d82","resolution":{"observed_at":"2026-08-10T17:27:19.785086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.761795Z","title":"Tvr: A large-scale dataset for video-subtitle moment retrieval","venue":null,"work_id":"ea8607d0-98b4-46ae-8ffe-7b2b770e19bf","year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.333044Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:7463b71ac021f2cc135036277627e2067ee80d5b32a3fe7318d65507afe38440","observation_id":"4f859fb8-ec1e-47e5-bdac-e4c9aa136e71","resolution":{"observed_at":"2026-08-10T17:27:19.767356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.743848Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling","venue":null,"work_id":"6f091ae0-13fe-4df5-86fe-18d844b6af0b","year":2021},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.338050Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:3080174b93c16157191c951f3b068402a1ab367cd15e39f15dfce292770468ec","observation_id":"b3dabebf-3f94-4b74-a5b4-6ec0448383ea","resolution":{"observed_at":"2026-08-10T17:27:19.749524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.343420Z","title":"Chatting makes perfect: Chat-based image retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.343420Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:e887fbee5b4751559059cb1c1d7582c32366efe9d90c011bf01cdaf6d54ccf53","observation_id":"596d4a41-5f75-49d6-be14-de21ac0339ef","resolution":{"observed_at":"2026-08-10T17:27:18.343420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.714730Z","title":"Retrieval- augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":"dce349d5-391b-4661-b58e-79234d659af5","year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.348350Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:17bb49050923a250ef16be612ce1a06731d886411a5a04cf867bbf0f14d4f1be","observation_id":"c7e9112a-b8ab-44e2-92bf-84a31838eade","resolution":{"observed_at":"2026-08-10T17:27:19.721183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.353346Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.353346Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:c9a11614cf9e699fd725885316b7c101ce8288a71e1bd47334dafba012906511","observation_id":"e8f42b6c-0d31-470d-8001-d8f90161d8e3","resolution":{"observed_at":"2026-08-10T17:27:18.353346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.684507Z","title":"Skip-plan: Procedure planning in instructional videos via condensed action space learning","venue":null,"work_id":"1a030462-8933-4a8d-b993-9d354d0d0c3f","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.358932Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:7c91fe91389ca53d73201e1a3ce604f42aa2cda77a03ae69b89af3e952a419c1","observation_id":"07b40416-83e2-4efc-bbd4-0a23843c2bbb","resolution":{"observed_at":"2026-08-10T17:27:19.690149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.659420Z","title":"Cohn, and Janet B","venue":null,"work_id":"44d7e473-bad9-4434-9d65-97a10c21d545","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.363704Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:833052f5fd5515166aa3f7ae0c266b48ca04f20de2d89c2eb23c1ff231df4498","observation_id":"a7f9a262-5fb1-419d-b595-0fca782911c5","resolution":{"observed_at":"2026-08-10T17:27:19.665546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.635271Z","title":"Learning to recognize procedural activities with distant supervision","venue":null,"work_id":"899dbdcc-7df2-4d34-a3cd-9590e5f95400","year":2022},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.368912Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:427e2901b30f3dc05a8c443dfc37447e9acac7c84542f793b8dc67e1fe50ed1e","observation_id":"40b457fb-a7cd-44a8-a55b-8708313d02b8","resolution":{"observed_at":"2026-08-10T17:27:19.643121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.609051Z","title":"Jointly cross-and self-modal graph attention network for query-based moment localization","venue":null,"work_id":"43b83f51-0869-4bc3-b203-35aed0c95c2c","year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.374456Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:17c62d47ed659cb384491432379f027285a80420b9e692c10156b9a8e1417349","observation_id":"4713edc8-2e9f-4a33-acec-590ae14c0c9d","resolution":{"observed_at":"2026-08-10T17:27:19.617330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.380143Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.380143Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:c92cda699ed35d06a1a7180b1f04b935ac991ddf93faeb09255c208d4f737c9f","observation_id":"d8bfad8e-0392-4876-af25-c9613c35bd01","resolution":{"observed_at":"2026-08-10T17:27:18.380143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.385014Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.385014Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:b689787dfca18914c5d94ff11e230abbeb6eb983a9f054c130804bcbf19add55","observation_id":"b8aec459-d859-4fbd-9f72-631649fb012d","resolution":{"observed_at":"2026-08-10T17:27:18.385014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.562407Z","title":"Attentive moment retrieval in videos","venue":null,"work_id":"5dfe6c88-4486-4935-82e7-2ceced61b079","year":2018},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.390493Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:1cc605f7197103ace96af36ad02a49286379e53396e7df4ec8ba33153e2ccc26","observation_id":"46da08f4-c521-47d8-8139-6a60145d8163","resolution":{"observed_at":"2026-08-10T17:27:19.569112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.538096Z","title":"Language models of code are few-shot commonsense learners","venue":null,"work_id":"ccfa4033-32c2-415c-907e-36f4a26aba80","year":2022},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.395669Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:3d40b1b1d9c6692bbbd80c4e6c09ae7536d0c60689dbf28355d1d94f7419b290","observation_id":"26decaed-decf-42f3-85d4-e172b0f4d7a6","resolution":{"observed_at":"2026-08-10T17:27:19.545580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.510874Z","title":"What’s cookin’? interpreting cooking videos using text, speech and vision","venue":null,"work_id":"49fd8656-67f1-4518-a372-04d48548951b","year":2015},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.400639Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:2fb85cc6a57f8126c7588bf6c4e6222af25ec4e1954ebc5e499780b6faa916c3","observation_id":"ebe4190f-1994-4be1-b33b-a277349828bf","resolution":{"observed_at":"2026-08-10T17:27:19.517289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.489144Z","title":"Howto100m: Learning a text-video embedding by watching hundred mil- lion narrated video clips","venue":null,"work_id":"b9e6ed97-e636-4f8c-907d-dbe73bcd2c3d","year":2019},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.405575Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:bf7886224a7b8dff8edfa30e2757e55c424cee63ea9ee780f9a8da8998048152","observation_id":"8abe8ae2-99f4-4a9e-8f58-fab46928dc7c","resolution":{"observed_at":"2026-08-10T17:27:19.496609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.464028Z","title":"End-to-end learn- ing of visual representations from uncurated instructional videos","venue":null,"work_id":"af1409e7-91ee-40cf-b677-d0445f08b9cf","year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.410996Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:5d383f68679581c99548007870b63d140ee702b5f8e09e670a4d2e834fa5be50","observation_id":"0f3350a2-a0a3-4501-ad92-c2c0d25d5f24","resolution":{"observed_at":"2026-08-10T17:27:19.470230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13519","last_updated":"2023-03-23T17:59:54Z","snapshot_observed_at":"2026-08-16T15:45:49.534568Z","submitted_at":"2023-03-23T17:59:54Z","title":"Learning and Verification of Task Structure in Instructional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13519","snapshot_observed_at":"2026-08-10T17:27:18.415992Z","title":"Learning and verification of task structure in instructional videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.415992Z"},"links":{"cited_paper":"/paper/2303.13519","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:8ff341ae5904a8330db614a017563d9758d409f3dc787726b099704da448112f","observation_id":"ad815325-c0ba-41c6-a0dd-6595078478a7","resolution":{"observed_at":"2026-08-10T17:27:18.415992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.444925Z","title":"SCHEMA: State CHanges MAtter for procedure planning in instructional videos","venue":null,"work_id":"0e52f8c6-431b-4adf-8353-854bade910a1","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.421653Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:1573d26b7e5252feb2c123c8b05c6c94c03b5aa81fa7c16abfdbbdf6f3403173","observation_id":"ae29bc64-05ae-4610-b9f1-c961e70fb6e0","resolution":{"observed_at":"2026-08-10T17:27:19.451365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.424085Z","title":"Virtualhome: Sim- ulating household activities via programs","venue":null,"work_id":"4526518b-23bb-4135-8c37-66dc9898eb09","year":2018},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.427256Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:3d0e8185509c778e309ec6143b408d6221ac0506de34c6e331293ab9a0cd0086","observation_id":"46042b3c-b577-4cd8-a223-dec461577ac3","resolution":{"observed_at":"2026-08-10T17:27:19.430224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.432722Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.432722Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:9b9ba1c48db502020e44672267e0700520af1fe946a14cc1ae3f211103b91802","observation_id":"1d462551-7fc9-4673-824b-d3ef509b4255","resolution":{"observed_at":"2026-08-10T17:27:18.432722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.392528Z","title":"Grounding action descriptions in videos","venue":null,"work_id":"f32046c2-32a9-4b3c-8cd6-74a415227bfe","year":2013},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.437992Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:3185f73c288204dc407a04e623f6fa7e5dfb0c1f664ed92dedb03705d6af8de5","observation_id":"f28cd14f-2aa5-49f4-b2f8-1edd37df038a","resolution":{"observed_at":"2026-08-10T17:27:19.398146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.374611Z","title":"FLAP: Flow-adhering planning with constrained decoding in LLMs","venue":null,"work_id":"d64df349-f2cd-417c-8080-5fe36886fb93","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.443152Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:48d52ead5402681e124282c83fe1ca324b851f8bbb31553c67ebe49cb3508594","observation_id":"8f268d0b-267a-4bcd-b7ac-7362cd2a945d","resolution":{"observed_at":"2026-08-10T17:27:19.380232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.357281Z","title":"proScript: Par- tially ordered scripts generation","venue":null,"work_id":"efbe4f4b-1138-4cd2-bc23-e07eb7eef5e2","year":2021},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.448309Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:32cf1dbd9b4fa35c8bde9a0aee4d77c8377aaf3a375fd0b3437d00a53dda36b2","observation_id":"69608492-668a-46ee-a34e-8077fe24d1a5","resolution":{"observed_at":"2026-08-10T17:27:19.363004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.339927Z","title":"As- sembly101: A large-scale multi-view video dataset for un- derstanding procedural activities","venue":null,"work_id":"35adcc99-5470-4a34-a1b3-3b21be8602c9","year":2022},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.453462Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:7a24e57e6b28c05df5139a1b4026d1ad386475eb610d5f5151b581807ccf4300","observation_id":"88d099c9-b89b-4ee9-b1a2-b817958e3567","resolution":{"observed_at":"2026-08-10T17:27:19.345705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.322329Z","title":"Hugginggpt: Solving ai tasks with chatgpt and its friends in hugging face","venue":null,"work_id":"fe3e1201-c4a4-4667-93dc-e4ac162777b2","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.458789Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:2a8ed0a5be748fe586067f64aa9fed9c8608704470aa375ea3496241f43779da","observation_id":"374b58e8-0949-41aa-ae82-225144ebb97e","resolution":{"observed_at":"2026-08-10T17:27:19.327594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.305127Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"2d7e3401-e2da-41cb-adc2-3fc41dded381","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.464824Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:6fc4b93dc281d1efbaadf9230fd734ac4ac8d94e6097f239266c04838bb7f8ba","observation_id":"5c00df61-fe98-42ae-aa1e-54de161d9b76","resolution":{"observed_at":"2026-08-10T17:27:19.310703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.287747Z","title":"Mpnet: Masked and permuted pre-training for language understanding","venue":null,"work_id":"c5bacdd7-7693-41cf-92a1-e559d648a20b","year":2020},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.469567Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:767fd55ecac5c24d6d40c4d0b014e0e3a983142d2308a55ff54f3f87f914478e","observation_id":"ebf6b249-9a9b-4921-b8c6-45eb5f078a1a","resolution":{"observed_at":"2026-08-10T17:27:19.293438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.02655","last_updated":"2022-05-30T19:45:05Z","snapshot_observed_at":"2026-08-16T17:02:22.622571Z","submitted_at":"2022-05-05T13:56:18Z","title":"Language Models Can See: Plugging Visual Controls in Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.02655","snapshot_observed_at":"2026-08-10T17:27:18.474723Z","title":"Language models can see: Plugging visual controls in text generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.474723Z"},"links":{"cited_paper":"/paper/2205.02655","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:c6d8e91f06b268dc33a19de1700eca8de40e23658be25c39f65a489066e183b4","observation_id":"c3a0b2e7-5820-41df-a9ef-2d276b799ea7","resolution":{"observed_at":"2026-08-10T17:27:18.474723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.271321Z","title":"PandaGPT: One model to instruction-follow them all","venue":null,"work_id":"53bf6ea9-5382-480d-9487-38a07996419a","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.479891Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:28b9541d59eec91c1261a2a8148ac6ba39058b82840f31867a3d9b649ce25589","observation_id":"6019f744-9b5d-4a78-9201-ffe1265ca81f","resolution":{"observed_at":"2026-08-10T17:27:19.276653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.252052Z","title":"Plate: Visually-grounded planning with transformers in procedural tasks","venue":null,"work_id":"44682dae-8583-4591-8811-270b24e3bfaf","year":2022},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.484978Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:450ce2ef45f56a412f50973c9520ba39a6b580e4ac98ae53dec70028e5225a62","observation_id":"f9f1a374-9afe-4810-83be-9ba1448966c0","resolution":{"observed_at":"2026-08-10T17:27:19.258622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.233608Z","title":"Coin: A large-scale dataset for comprehensive instructional video analysis","venue":null,"work_id":"c9ba0a7f-c095-4627-8884-5a4e87d4169f","year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.489713Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:cb48807754efcd984f4faa65a0eda61688fcbf4bac29a6ba70dcaa45a13b8169","observation_id":"76415b0a-33bb-4fbd-98bb-489517242b8a","resolution":{"observed_at":"2026-08-10T17:27:19.239508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.215758Z","title":"On the planning abilities of large language models-a critical investigation","venue":null,"work_id":"1f9aaf08-a850-4386-9d37-4cc35766d3f1","year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.495158Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:bd20be951f6fa596fd821f38fb1964f02c102500305630e8af0260c891674dd8","observation_id":"a2a0d350-3c6b-4c88-ad2a-6c639902c601","resolution":{"observed_at":"2026-08-10T17:27:19.222261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.197302Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"ea7f57a1-485a-475e-b00a-412ce3b73f12","year":2017},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.500019Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:c4e9e03f08be8b097e6b032ed455bdf7aab427a97c83a8a34e83c439676d14fd","observation_id":"ecf651f8-0f62-4594-85cc-a4041e7331b5","resolution":{"observed_at":"2026-08-10T17:27:19.203062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.180024Z","title":"Event-guided procedure planning from in- structional videos with text supervision","venue":null,"work_id":"b9670287-a731-4dd8-a171-9a1c8908cb21","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.504726Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:cb49b164c16b2a51a7c7605466d355d1efe62941979c40aedd9d8a2512e06656","observation_id":"d7d46fa4-61ed-4a8f-8c20-036ce1a5e244","resolution":{"observed_at":"2026-08-10T17:27:19.185574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.162551Z","title":"Pdpp: Projected diffusion for procedure planning in instructional videos","venue":null,"work_id":"90c64c05-5a37-455f-a9d4-bc1a5f91c40f","year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.509417Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:d2f7e911456f64d04ee5295e93d0004227989d2dfb700efeeed9b8e4e5e055c5","observation_id":"aa1704bf-798f-4e21-9317-a7a01628461f","resolution":{"observed_at":"2026-08-10T17:27:19.168578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.145157Z","title":"Temporal segment networks: Towards good practices for deep action recognition","venue":null,"work_id":"e244c50d-390b-4ead-849d-d71503e43e6b","year":2016},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.514360Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:4026b367ff9cad6d9e88985521c34f31a59ae7a92c52109948def9ea615c0661","observation_id":"641a44df-1b47-42d3-b018-956b5133109d","resolution":{"observed_at":"2026-08-10T17:27:19.150365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-08-15T10:03:23.497428Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-10T17:27:18.519058Z","title":"Visual chatgpt: Talking, draw- ing and editing with visual foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.519058Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:6823fa83c1e1b82e3ab8f908c07e8b3de94040587fc5532c31adaef622637e65","observation_id":"5155ce14-7170-4533-a1bc-32587b290c6d","resolution":{"observed_at":"2026-08-10T17:27:18.519058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.128195Z","title":"NExt-GPT: Any-to-any multimodal LLM","venue":null,"work_id":"fab5ffac-faa2-41fe-8637-885c064e4a9a","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.524104Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:26f0e29d7261871d368ae2af5d122d3e3c0ef4efc56ff51dd32c90e2c5a7b95e","observation_id":"9f82821f-3eaa-4d58-9597-5dec1e9624c7","resolution":{"observed_at":"2026-08-10T17:27:19.133657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.108918Z","title":"Rethinking spatiotemporal feature learning: Speed-accuracy trade-offs in video classification","venue":null,"work_id":"eaf1a940-67ea-43dd-80b7-a7d4d226c5ec","year":2018},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.528664Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:73f53e76416a5be8a6360f1eec250f9ae308cb2ce23a40147a25c721cc04ad55","observation_id":"bfe34a2f-97a6-47ab-8583-2618443845c0","resolution":{"observed_at":"2026-08-10T17:27:19.116500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05128","last_updated":"2023-02-10T09:17:52Z","snapshot_observed_at":"2026-08-16T15:56:18.890570Z","submitted_at":"2023-02-10T09:17:52Z","title":"Translating Natural Language to Planning Goals with Large-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05128","snapshot_observed_at":"2026-08-10T17:27:18.533727Z","title":"Translating natural language to plan- ning goals with large-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.533727Z"},"links":{"cited_paper":"/paper/2302.05128","citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:ddf76df60519ad097039deed195954ceb7c79df673dec3db60f1851da83c7ba3","observation_id":"b4329a38-a98a-4794-bac9-b97886dcf609","resolution":{"observed_at":"2026-08-10T17:27:18.533727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.091612Z","title":"Multilevel language and vision integration for text-to-clip retrieval","venue":null,"work_id":"1454cf49-f798-40cd-8b27-477e619e07c2","year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.539015Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:732046553f267375b4c44512ff85f7835b6e5e57c0a97976bb1dcffdcb27c776","observation_id":"d198cda2-5116-439d-ac92-f0bafaac0ec3","resolution":{"observed_at":"2026-08-10T17:27:19.097622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.073622Z","title":"VideoCLIP: Contrastive pre- training for zero-shot video-text understanding","venue":null,"work_id":"16b1545d-b24f-4ed8-a091-f531e6b41000","year":2021},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.544244Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:aec8b3f505a87c16505162d048aad7ac80331afb01187e7b8b8aee4fb4cc26f4","observation_id":"bb148e8c-adcf-4f31-b9d8-0bd1fa4bb170","resolution":{"observed_at":"2026-08-10T17:27:19.079625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.054773Z","title":"Retrieval- augmented generation with knowledge graphs for customer service question answering","venue":null,"work_id":"b5e868ab-933b-490d-a8a6-07cc5ab3490f","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.549134Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:9ecbab1b76d9090e210917b058772bc2adc81fdd0665f6d0012f7899d0517cda","observation_id":"6cc9b393-3050-4d91-a6f8-f455fe2de311","resolution":{"observed_at":"2026-08-10T17:27:19.060275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.037173Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"6bde0a67-2c83-4ca9-a677-7dd6d6d95bed","year":2019},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.554112Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:7b3ec2a14d2a9e1ee46ff0bb0f66bc7f3a8648876b5aaad7f1a104d3640865e7","observation_id":"f320f8fd-dd08-47a9-9add-799ba20f929d","resolution":{"observed_at":"2026-08-10T17:27:19.043613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.019900Z","title":"Distilling script knowledge from large language models for constrained language planning","venue":null,"work_id":"f977dee2-14df-48f5-a145-9086be80c447","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.559096Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:1bb8294422d13595591baab804aa94e2351a045f0a73fd15d18600b7a7668e53","observation_id":"4a9e3b04-e34b-4f3f-bd07-db480e1e6fe9","resolution":{"observed_at":"2026-08-10T17:27:19.025535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:19.002045Z","title":"Man: Moment alignment network for natural language moment retrieval via iterative graph adjustment","venue":null,"work_id":"d6c3925e-dc65-4839-a100-cd928d13cd1a","year":2019},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.563941Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:4ce95b805c22b3561ca09ef637c8b2c07d21e4167ed9555855226d22e7cc9c0f","observation_id":"1e5d354d-f8e9-4e08-88f6-567a49c7bad2","resolution":{"observed_at":"2026-08-10T17:27:19.007476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.985423Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversa- tional abilities","venue":null,"work_id":"815c890a-7631-406c-a46e-a9bb56c19f30","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.568729Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:5fc3f78e5875acca3449d7ef7340bfa7d91cc09bf16c9c4a4255bf647e28cc00","observation_id":"e47a14f2-1409-470a-b597-6372db2921c9","resolution":{"observed_at":"2026-08-10T17:27:18.990834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.968792Z","title":"Video-LLaMA: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":"a2c2d169-2764-412a-bb01-4a4e77d627f8","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.574278Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:cf284ae88065aa6e774058184d45cbd3783924ea8a6794b545a592683994ffe0","observation_id":"65d682a9-ad24-4ef0-9aff-985af49ebc05","resolution":{"observed_at":"2026-08-10T17:27:18.974322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.951529Z","title":"Temporal sentence grounding in videos: A survey and fu- ture directions","venue":null,"work_id":"21bd6250-3d4a-494a-bf33-a5ba97f1a39d","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.579525Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:29d8d352d9395a702ecb0623a351c440bc33f03edd7b8f85f703154890238f24","observation_id":"d628f934-164d-4b8b-a513-33d7a7b43b42","resolution":{"observed_at":"2026-08-10T17:27:18.957496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.934052Z","title":"P3iv: Probabilistic procedure planning from instructional videos with weak su- pervision","venue":null,"work_id":"1085ecbe-387f-471a-97fb-ee00beba6ac9","year":null},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.584443Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:b05b41bbdf6137cf0dad6d24fbdcb341a8c8278863c34b3f7a7d86b15a076807","observation_id":"703bc398-48a0-48c7-9795-3cb775a7a0ae","resolution":{"observed_at":"2026-08-10T17:27:18.939426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.915691Z","title":"Learning procedure-aware video repre- sentation from instructional videos and their narrations","venue":null,"work_id":"41d7b287-03f9-4e03-92fc-908ac62cb725","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.590544Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:6dd66b5667247775bd6d658a05daba2c3d9411023c4986fd06cfcddd26d84f8c","observation_id":"1bfea070-78ba-47be-a292-a0398e67453e","resolution":{"observed_at":"2026-08-10T17:27:18.921158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.898827Z","title":"Procedure-aware pretraining for instructional video understanding","venue":null,"work_id":"7d4c4a83-9f37-43b2-b0da-d2db5f31a3cb","year":2023},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.596552Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:b8f0e5a0dc6114a39107250a60d510ed8eef56b3d1b1bd80e8a72c278e58965d","observation_id":"cd6107ab-a413-41f7-ad15-d3bcb5ac5f94","resolution":{"observed_at":"2026-08-10T17:27:18.904145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.881493Z","title":"Towards auto- matic learning of procedures from web instructional videos","venue":null,"work_id":"9ee72845-3e81-4c66-bc82-499ad34f40fc","year":2018},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.602763Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:507dd95c8cb97a86ec384c34366783b1c9e12b56b5339af1529339de91a5bc3d","observation_id":"7901844d-b6bf-424c-b788-b3bd49dd1263","resolution":{"observed_at":"2026-08-10T17:27:18.887341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.864026Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"b45dc713-1853-4a54-89a7-2057e7f6d673","year":2024},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.608913Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:6aef557e95b98ae8f526893a97e38e908863ae651c4c08ab0a8a046284b18221","observation_id":"d130331b-ff3b-4241-903e-a583413649ee","resolution":{"observed_at":"2026-08-10T17:27:18.869455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:27:18.845491Z","title":"Cross- task weakly supervised learning from instructional videos","venue":null,"work_id":"d36e7bbf-a9c0-4934-918a-3321c03cbd80","year":2019},"citing_paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T17:27:18.614377Z"},"links":{"citing_paper":"/paper/2501.12231"},"observation_digest":"sha256:b427ee7e84c916f8b727874f37c800e374325078fb342dd466535a2be587979e","observation_id":"f8de0d6b-998d-4e0c-bf16-2b794b0714b4","resolution":{"observed_at":"2026-08-10T17:27:18.851520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.12231","last_updated":"2025-01-21T15:55:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T01:55:33.489626Z","submitted_at":"2025-01-21T15:55:06Z","title":"InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models"},"reference_resolution":{"displayed":91,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":60},"total_outbound_references":91},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 91 of 91 outbound references and 3 inbound Pith citation observations for arXiv:2501.12231."}