{"as_of":"2026-08-18T08:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7a4fa3148ffaab0748b2717d22e2b4be71a9aa20a30e32e58608926815757500","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:08:42.308404Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.15628/citation-record","integrity":"/paper/2411.15628/integrity","json":"/paper/2411.15628/citation-record.json","paper":"/paper/2411.15628"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T14:08:40.821947Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:40.821947Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:f16461462ba5576e6b0175c7f36d281fbe473c66d76ca833dfc4531403d94adf","observation_id":"bc9bc2a2-bd41-45fd-a3e5-6572c2935db5","resolution":{"observed_at":"2026-08-12T14:08:40.821947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.525963Z","title":"Ht-step: Aligning instructional articles with how-to videos.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"8c79c4c6-9670-468b-b324-8dde76dbc169","year":2024},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:40.888612Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:26dfb608fdb2ac6f9f3aff1a3c7a3beeea8298ecf0d4b573b4052709a21223b5","observation_id":"eb663771-06c0-4920-b6a0-434d580c9460","resolution":{"observed_at":"2026-08-12T14:08:45.540893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.434154Z","title":"Exploring synonyms as context in zero-shot action recognition","venue":null,"work_id":"f6f53384-36df-46d4-9580-bf15752f4a11","year":2016},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:40.995780Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:25dc472e754db4783aa1882632434c6f64a9d2037f417409869afa92df8e56e1","observation_id":"96065e79-07ec-478b-a35d-a020b140eec8","resolution":{"observed_at":"2026-08-12T14:08:45.472400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.420273Z","title":"Hiervl: Learning hierarchical video- language embeddings","venue":null,"work_id":"2723f836-a0c6-433c-aa90-d41ba84bf156","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.016803Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:368845386cdeea11cc0fd12267b79ed05e7192bb4b2ccec142802c29322167bc","observation_id":"84fa500b-d883-473c-b707-e4b8e2c44fa2","resolution":{"observed_at":"2026-08-12T14:08:45.425059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.405234Z","title":"The ikea asm dataset: Understanding people assem- bling furniture through actions, objects and pose","venue":null,"work_id":"b2ae6150-d81e-4678-a44e-83e7b3a55ad0","year":2021},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.022207Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:81b1296c34360c7a78e13fd5c784fb6fd1181cb0ec68d0cf284cbeb08f81b6d2","observation_id":"732405b6-5ed4-4b7a-9f92-fae80af0857d","resolution":{"observed_at":"2026-08-12T14:08:45.409979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.391212Z","title":"Is space-time attention all you need for video understanding? In ICML, volume 2, page 4, 2021","venue":null,"work_id":"e5880528-7694-4401-9eaa-86fccc0c83fb","year":2021},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.027101Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:ecb768a440a3119bb53fe50cc88a84f238f428c7be2120f4bc02b3d3de78ad93","observation_id":"e7551e14-bab1-4879-b945-d862870784d2","resolution":{"observed_at":"2026-08-12T14:08:45.396127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.355709Z","title":"Rethinking zero-shot video classification: End-to-end training for realistic applications","venue":null,"work_id":"4001f1fe-96ca-43a3-8f13-2d2a2b553dc0","year":2020},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.083324Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:7032c9b706683033dfe63a370f26fe29c4991cc5eb0a919f1ec65b8966921ba9","observation_id":"80e0cd83-12ec-4d51-a6d1-3e5312a09955","resolution":{"observed_at":"2026-08-12T14:08:45.381534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.294498Z","title":"Regen: A good generative zero-shot video classifier should be rewarded","venue":null,"work_id":"eabe0bb5-0e9b-4284-bae6-191fd3c9cbae","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.090381Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:1e4526a3dc3821ca19291021d432d595126e65b3a6a3942c65edcc12d8b99d4c","observation_id":"ff4d3c15-0b5a-44a9-8445-fed95ac1fa51","resolution":{"observed_at":"2026-08-12T14:08:45.299158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.279702Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"ceec4f9a-2eff-4319-bb8c-5ef0e0c660fa","year":2017},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.094991Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:9d4b3b2bb7dacb3c4a2402f161360dc5c3bcee17248a140048a5da04f0885a6d","observation_id":"9a249bd3-7f50-4a03-b916-3db3601cda56","resolution":{"observed_at":"2026-08-12T14:08:45.285381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.166912Z","title":"Elaborative rehearsal for zero-shot action recognition","venue":null,"work_id":"2258370b-7a02-4ff8-a465-152a8101a72c","year":2021},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.101071Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:989de9804c743f8f7e5b102c811703c7b9ab0738a870776e627936326eea61b7","observation_id":"74109dde-6953-4ac5-bf01-dbd2129eacc2","resolution":{"observed_at":"2026-08-12T14:08:45.268691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T14:08:41.148077Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.148077Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:8ece7be7fe1414ab9f05b1d837aa2be6694b2638a69e738a0a2d1087bef1639c","observation_id":"b606cf03-a89a-4827-a2cf-a92ae546cf73","resolution":{"observed_at":"2026-08-12T14:08:41.148077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.152889Z","title":"Teaching structured vision & language concepts to vision & language models","venue":null,"work_id":"f0856c67-c724-4071-bad0-8d8d0ccf1617","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.215173Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:75840f63f8b66ab30a3ffb90dc4ba34d18660b3247305d0db9835bd28ef1bc79","observation_id":"11326423-3c91-49f8-92de-fb0fedaa099c","resolution":{"observed_at":"2026-08-12T14:08:45.157402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:45.127773Z","title":"Step- former: Self-supervised step discovery and localization in instructional videos","venue":null,"work_id":"a0c5f6d8-5982-49d7-84a6-3558e892ae72","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.240189Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:e3e5989f42d0e8288de230b2bb97a5c7ee0f7f701e0ffeaba9c66063423a7bfb","observation_id":"a75dd326-4fb5-44bc-8847-7ade7db59dda","resolution":{"observed_at":"2026-08-12T14:08:45.142507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.977890Z","title":"Zero-shot action recognition in videos: A survey","venue":null,"work_id":"8d10fb1e-4a2b-4b30-9b70-d588217ba54a","year":2021},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.244645Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:27172bccd79d1dcb5474b5d3c5af24437b28ca1e1e16ccdd53e7473d8c27f413","observation_id":"2fec3f59-f902-4123-84b1-945a3c7abf3e","resolution":{"observed_at":"2026-08-12T14:08:45.071841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.964005Z","title":"Ms-tcn: Multi-stage tem- poral convolutional network for action segmentation","venue":null,"work_id":"fceb1830-b12c-4448-9a3f-3b033d88943e","year":2019},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.329232Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:030829f845d288da2bf28c896579c65af9b05cea0b3a2c5ccf216e4176b19772","observation_id":"7d0628ee-9900-45d8-868a-4c71a8f9d486","resolution":{"observed_at":"2026-08-12T14:08:44.968430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.947414Z","title":"Learning to recognize objects in egocentric activities","venue":null,"work_id":"95d287a3-5409-4bba-98fe-023d6eb3e238","year":2011},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.421730Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:66471d7ef3c434683c8ba5c703a3f00681795f7b9144bbc864e4abbb2a007c88","observation_id":"bea9a6b6-a870-40a8-bd16-a779afd8df73","resolution":{"observed_at":"2026-08-12T14:08:44.953527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.931580Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"59bab41a-2e41-4aca-9470-82c46ae5f673","year":2019},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.502547Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:65431ae34091a1833dd8e3ca51369fdeea0a54a12b7b87d56bf9c648b149245e","observation_id":"d9e4b6be-e75c-4f34-9bd5-bfb91ebfc51d","resolution":{"observed_at":"2026-08-12T14:08:44.936844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.913208Z","title":"Prego: online mistake detection in procedural ego- centric videos","venue":null,"work_id":"0ce5256e-e2fd-4d6a-ad6e-92c1b4cccc45","year":2024},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.535699Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:f8aa334813270bd0602870fbc0e69749e27235734212e247388a1ee68e074b76","observation_id":"9e8b1f8f-6ab6-4707-8485-c0dbb80803cd","resolution":{"observed_at":"2026-08-12T14:08:44.921960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.779630Z","title":"Improving zero-shot gen- eralization and robustness of multi-modal models","venue":null,"work_id":"9e12a985-2d50-4484-9228-9ef4762650d3","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.558624Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:cd8ad0d83b6386ad43ce038f39c1610614e9d5d130e65ac8ba9b95ae038971e0","observation_id":"1d271bf2-ada1-4cb9-81a9-db6c660651a9","resolution":{"observed_at":"2026-08-12T14:08:44.821681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.764647Z","title":"Weakly-supervised action segmentation and unseen error detection in anomalous instructional videos","venue":null,"work_id":"f19e19fc-098d-4938-9844-bd4786e5d66e","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.563967Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:154a496c5ee22bccd09984c4f71f6120b72b1f51f687aa1c49c6a85f4e665876","observation_id":"0d3393ef-0247-49d9-9225-eb6b77159975","resolution":{"observed_at":"2026-08-12T14:08:44.769725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.749899Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"7af971bc-15ec-42f7-a444-5ff07922acd8","year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.569698Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:9b5ae890787566929f4d050de2d93f3b9684871c763faec2bbca01024f38c0d6","observation_id":"7263b4e0-2589-4854-b751-0c54a2799b8f","resolution":{"observed_at":"2026-08-12T14:08:44.754663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:41.620096Z","title":"Temporal alignment networks for long-term video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.620096Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:df5d640cb67a718b7abd47cfae2235ffc88ad7ac908fb7efcc50f09532dad98b","observation_id":"90c21025-a295-4590-91b0-ee49897d6703","resolution":{"observed_at":"2026-08-12T14:08:41.620096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09141","last_updated":"2021-06-16T21:36:36Z","snapshot_observed_at":"2026-08-16T18:16:33.622294Z","submitted_at":"2021-06-16T21:36:36Z","title":"Probing Image-Language Transformers for Verb Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09141","snapshot_observed_at":"2026-08-12T14:08:41.680083Z","title":"Probing image-language transformers for verb understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.680083Z"},"links":{"cited_paper":"/paper/2106.09141","citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:b658d43deec1b367a3666a229a049c15c84e72626126905b1a8d3b4836ed4965","observation_id":"fa393e83-200d-46a6-825e-39e6971c9c23","resolution":{"observed_at":"2026-08-12T14:08:41.680083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.677095Z","title":"Clover: Towards a unified video-language alignment and fusion model","venue":null,"work_id":"f744e252-609b-428b-8b94-5724d91f6ac5","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.709050Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:a4a27db7080bac6e9bb874040de3d3dcade1373105be59a86dc6636fbada2e8a","observation_id":"ac89540c-787a-4938-a1f6-9275e2aa9601","resolution":{"observed_at":"2026-08-12T14:08:44.722893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.634606Z","title":"Fine-grained generalized zero-shot learning via dense attribute-based attention","venue":null,"work_id":"fa8f9b93-80e5-4392-a7a9-cead9db659af","year":2020},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.714001Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:0a41ab358aa44e8e6fa703199e21b7b1dcc91b4850b1e0925f85d2171e664093","observation_id":"be5709eb-168f-4b2c-940d-cbf8a686689b","resolution":{"observed_at":"2026-08-12T14:08:44.639994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.618554Z","title":"Objects2action: Classifying and localiz- ing actions without any video example","venue":null,"work_id":"3879fcc0-d486-481d-8d24-00326825c025","year":2015},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.718983Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:a2e9f2ba16029b2a1ee0e1ef6a84f1d06988429effecc30dbed8a56b88581f42","observation_id":"74b88be9-9871-4bae-b5b4-d24e6670ea2b","resolution":{"observed_at":"2026-08-12T14:08:44.624457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.595212Z","title":"Prompting visual-language models for efficient video understanding","venue":null,"work_id":"b8d1aa05-d002-464a-93e1-c10b24814115","year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.723234Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:72f042b16a1cd9aab614e34b37ffd9b3d50d40e728a6a329d53d8ddd86efb3ed","observation_id":"e9921a13-86a5-40c0-af2e-6a837086a824","resolution":{"observed_at":"2026-08-12T14:08:44.606588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.477551Z","title":"Error detection in egocentric procedural task videos","venue":null,"work_id":"0fb86685-8bce-464d-9ff3-13e706fe0147","year":2024},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.783002Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:867ef2d70c53ab5b00d5fb54cedf2d413827d2d70fc60d673cfb9058689661e3","observation_id":"df167b3c-640b-476e-92fe-196eaf923582","resolution":{"observed_at":"2026-08-12T14:08:44.535690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.463195Z","title":"Align and prompt: Video-and-language pre-training with entity prompts","venue":null,"work_id":"b7efb82a-9cd9-4a61-82e9-e3c8a7daf81d","year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.825070Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:5ed7bc1a63921eec49002c6a92a41b3934acf588adcca99a52ca44bff2fcb92d","observation_id":"e749117b-00d5-444c-995e-e6de40abf633","resolution":{"observed_at":"2026-08-12T14:08:44.468170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.434479Z","title":"Cross-modal representation learning for zero- shot action recognition","venue":null,"work_id":"389f2d15-37e2-4a00-a664-6fe48103a322","year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.829748Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:88eab71576bc4721396cd62a74f6dbc16d855cdd6f8fce2188afc209565f4894","observation_id":"2a32aef5-e3fe-42f0-bfeb-c374ee904f9f","resolution":{"observed_at":"2026-08-12T14:08:44.453055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.279562Z","title":"Match, expand and im- prove: Unsupervised finetuning for zero-shot action recog- nition with language knowledge","venue":null,"work_id":"49b61378-ef29-44c8-b685-f6533dc02410","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.834114Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:e058b4d5cf2c3ee0a896dd4b761fd221703aee382491e850497a2084193f301c","observation_id":"8b00805e-9d19-4f0d-93f4-716827babb06","resolution":{"observed_at":"2026-08-12T14:08:44.354680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:41.838632Z","title":"Learning to recognize procedural activities with distant supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.838632Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:bccc36326d35af723fd1435405f5cd4fcfa9609045dd78b8c3262027f0ab0781","observation_id":"bb8f3bb8-0369-4a79-ba98-800b5391f2a3","resolution":{"observed_at":"2026-08-12T14:08:41.838632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.254897Z","title":"Out-of-distribution detection for gener- alized zero-shot action recognition","venue":null,"work_id":"473e3667-d77b-4a4d-b95f-2bae9fd2a9ca","year":2019},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.917429Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:06bb85dc551b0d7a4c018d04bc0e78129f055bf60757210a159a2b37557373b7","observation_id":"56a4e60a-3ba5-486c-b277-0223da873a3d","resolution":{"observed_at":"2026-08-12T14:08:44.260818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:41.922633Z","title":"Learning to ground instructional articles in videos through narrations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.922633Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:d38063d293cb7395d59cbe05b622688cfefab56cd26f709de6c59adb8455e930","observation_id":"f768d3f8-f83e-4dc0-8c91-00a35ec1b7e3","resolution":{"observed_at":"2026-08-12T14:08:41.922633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.228184Z","title":"Object priors for classifying and localizing unseen actions","venue":null,"work_id":"80c6ccef-0361-4b72-bf3c-0c3647af8941","year":1954},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.927079Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:bdac085bd5a799edd0977c9f9ce72fc540811bac9811b275e26c1eae11543875","observation_id":"392843a1-d2b0-42bc-a566-d817eda44526","resolution":{"observed_at":"2026-08-12T14:08:44.233566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.162248Z","title":"End-to-end learning of visual representations from uncurated instruc- tional videos","venue":null,"work_id":"7f9106c2-6299-4ef5-ab1a-11b6e7f2c3ca","year":2020},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.931494Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:15eb0d10418f45b6a4445ce045e5a705926a304babde6ece4705dc2e7706583d","observation_id":"f7caf8e7-e8af-42fc-8c45-92f4ced659d3","resolution":{"observed_at":"2026-08-12T14:08:44.205632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.145896Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips, 2019","venue":null,"work_id":"16ed2e88-3006-4292-a4de-745c7724a0a5","year":2019},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.936116Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:44c341a290ff487df3be9d58b18305f196b667dd6d32cfaedf9098ee44c667f4","observation_id":"5439a55e-bf2d-4057-9040-60008bbf1ecc","resolution":{"observed_at":"2026-08-12T14:08:44.151592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1301.3781","last_updated":"2013-09-07T00:30:40Z","snapshot_observed_at":"2026-07-06T03:04:11.148340Z","submitted_at":"2013-01-16T18:24:43Z","title":"Efficient Estimation of Word Representations in Vector Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1301.3781","snapshot_observed_at":"2026-08-12T14:08:41.941389Z","title":"Efficient estimation of word representations in vector space","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.941389Z"},"links":{"cited_paper":"/paper/1301.3781","citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:ffb12f70817faa98fa85917989f65771317db5971fd2e97ed74bcf169f574667","observation_id":"d6fba638-7398-40f5-8d77-219f0861028d","resolution":{"observed_at":"2026-08-12T14:08:41.941389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.039336Z","title":"Verbs in action: Improving verb understanding in video-language models","venue":null,"work_id":"a1c083f7-7d65-4476-a712-48e3e8a034d2","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.946220Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:c656d8f7e061ea7d10f20d15ee98bf8fdf55ef047d5f76fbd94236abb8ef00ba","observation_id":"f35a470c-b545-4034-a694-4679b5b08965","resolution":{"observed_at":"2026-08-12T14:08:44.123711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:44.022610Z","title":"Spoken moments: Learning joint audio-visual representations from video descriptions","venue":null,"work_id":"6480464f-2789-4959-936a-bf0b99ec8f8e","year":2021},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.951307Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:5e3ccf46b9235258d7270171fbb4640e10e90a59d6ac8f40d198b9c20a90924c","observation_id":"366828e0-c3b9-4c9c-a70b-1df0eefb606c","resolution":{"observed_at":"2026-08-12T14:08:44.028356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.946787Z","title":"Zero-shot temporal action detection via vision-language prompting","venue":null,"work_id":"c5b48ab5-71d9-4e2d-b2ce-b63893dd7ef6","year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:41.996161Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:7f2797a852adefc526b537c9d3cb5dce16fb8c52debcd77c4b22c77ac35ff872","observation_id":"c20dc994-7087-4b41-9e42-0a02bfd86572","resolution":{"observed_at":"2026-08-12T14:08:44.007255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.890510Z","title":"Expanding language-image pretrained models for gen- eral video recognition","venue":null,"work_id":"edc0c18f-3a06-4bba-b8d1-1624be903130","year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.021559Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:ca40226309390cafd23d8651e5b0c2e5373cee884f5df42216dc83d4d0925205","observation_id":"15acba4f-6f76-4565-bc7e-44d4020b9676","resolution":{"observed_at":"2026-08-12T14:08:43.896043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.840299Z","title":"Learning multimodal representations for unseen activities","venue":null,"work_id":"428dbbd6-7611-49da-a8c6-3b5e4e631350","year":2020},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.027762Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:f13ef0bf49118f5b571a59ebb5a97d7e0d4150c7f9026a57f64237b019dfb56a","observation_id":"f86fbf1e-492b-422a-8aa7-857260a243b9","resolution":{"observed_at":"2026-08-12T14:08:43.867587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.756591Z","title":"Egovlpv2: Egocentric video-language pre-training with fusion in the backbone","venue":null,"work_id":"1b1ac8b0-fa8d-4586-846b-db4dc2427118","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.032409Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:beda30533f0f0fc3163099202d64c84f78005dcd657cd1505d7ad46d11bdb4bc","observation_id":"4cc7ed0a-b02c-45a6-9cab-ef19423003a3","resolution":{"observed_at":"2026-08-12T14:08:43.761687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:42.043056Z","title":"What does a platypus look like? generating customized prompts for zero-shot image classification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.043056Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:6387716c017bf47dd497922addf5cc9bdf54008d706bec3a4abe24994513d73a","observation_id":"5efc7eac-01e5-4a80-a6f9-02e7aae9ae5e","resolution":{"observed_at":"2026-08-12T14:08:42.043056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.713306Z","title":"Alignment-uniformity aware representation learning for zero-shot video classifica- tion","venue":null,"work_id":"fab9dfc4-fd9a-4b2f-b01e-ae0c25d81e11","year":null},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.090035Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:3790980e80147aced7f9aa9df8b06c0caf3273b555a7a86f3d9ebdbc5bbc4ea1","observation_id":"68d4deaf-c8e6-4719-bcb3-44f0b725a8b2","resolution":{"observed_at":"2026-08-12T14:08:43.736529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.590860Z","title":"Rethinking zero-shot action recognition: Learning from latent atomic actions","venue":null,"work_id":"68de3a02-fde2-4093-8500-dd51cc56ea3d","year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.101490Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:f1eb067d13b968fb78b70a4d34dfcc32d5af786e230f336eec433ba52b01ba45","observation_id":"08ddf227-795d-407f-a990-67c7f1f1ef5e","resolution":{"observed_at":"2026-08-12T14:08:43.648754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:42.105973Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.105973Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:592b120f31ad79ffd3c3d733a45269652fe29df0d380fd14d474f7db86288a84","observation_id":"28f404fb-d0db-4909-bc7a-7117967cc0c3","resolution":{"observed_at":"2026-08-12T14:08:42.105973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.547936Z","title":"Language-based action concept spaces improve video self-supervised learn- ing","venue":null,"work_id":"3596c2a7-6bee-4b82-b917-5de55d66b82b","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.110115Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:fec3062a972980e5b15c5761f351c223135be28589e550570f9eb23707225a09","observation_id":"d556de65-a245-475d-94c7-ea542c650a66","resolution":{"observed_at":"2026-08-12T14:08:43.568529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.424779Z","title":"Fine-tuned clip models are efficient video learners","venue":null,"work_id":"06f2b8fd-f72e-4dee-b581-cdb538294596","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.114311Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:06ab00dbffd53f56083a5a9884b740f3189f73d3d9af3087e4e2ea0fa744c0b5","observation_id":"60c15b2d-c2ce-4b4c-abcd-b2b204a7c148","resolution":{"observed_at":"2026-08-12T14:08:43.480138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07635","last_updated":"2022-07-15T17:50:51Z","snapshot_observed_at":"2026-08-17T01:12:02.486695Z","submitted_at":"2022-07-15T17:50:51Z","title":"Is a Caption Worth a Thousand Images? A Controlled Study for Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.07635","snapshot_observed_at":"2026-08-12T14:08:42.119921Z","title":"Is a caption worth a thousand im- ages? a controlled study for representation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.119921Z"},"links":{"cited_paper":"/paper/2207.07635","citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:fce0516bfb969655208f9bdecb2ed37e59feb04b27f080cb6f52f4be9103b6c7","observation_id":"91ad1310-2332-43cf-933a-e037b138d7c1","resolution":{"observed_at":"2026-08-12T14:08:42.119921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.409288Z","title":"As- sembly101: A large-scale multi-view video dataset for un- derstanding procedural activities","venue":null,"work_id":"731e5282-1722-4f10-b98d-3f7f0f8050ea","year":2022},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.126043Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:30ea59076fc8f6f3f481077d04f313b4d7d40b1622f685573c78fb805fc78b4c","observation_id":"2aaf919a-3816-4afe-bbb6-cd3f35a5bd35","resolution":{"observed_at":"2026-08-12T14:08:43.414332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.379628Z","title":"Mpnet: Masked and permuted pre-training for language understanding","venue":null,"work_id":"1c738df2-1fda-44ea-a103-4e98ac80c537","year":2020},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.157706Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:cee8b3a81c6a9964ec75f21b5c55151fdfb2312f1b026c77f30de3a7ce468342","observation_id":"230c78fd-ddb1-42ee-9656-e57fd4294125","resolution":{"observed_at":"2026-08-12T14:08:43.398085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.263365Z","title":"Coin: A large-scale dataset for comprehensive instructional video analysis","venue":null,"work_id":"a41778df-1d73-469d-bc0f-9333343c8c99","year":2019},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.184990Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:8adb1dc66d57be2db0d28eaa96c85f98c0c8e428789867aa2a9b6a511cdffe43","observation_id":"43391558-a256-44fc-9939-dd713ce37841","resolution":{"observed_at":"2026-08-12T14:08:43.295076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-08-18T03:30:52.103954Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-12T14:08:42.189536Z","title":"Actionclip: A new paradigm for video action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.189536Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:0c640115b14b6e590c1c3965e993ecad46f1c57c05b0ab23572caf1a13c35583","observation_id":"04979466-8c37-4949-a8df-3dead8f8a0aa","resolution":{"observed_at":"2026-08-12T14:08:42.189536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.170817Z","title":"Vilta: Enhancing vision-language pre-training through textual augmentation","venue":null,"work_id":"7059ca1c-2a50-46dd-a6d1-706f8b3e8f4a","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.193948Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:48448035bc960021f0ab1b722145ad69887eca06c9a5bbb72b97921f6bbec6f9","observation_id":"b9aa2de1-0f43-4a3e-9a2b-0f8408ebdcb6","resolution":{"observed_at":"2026-08-12T14:08:43.235796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.072361Z","title":"Pax- ion: Patching action knowledge in video-language founda- tion models","venue":null,"work_id":"ce7156fb-98a8-4ea2-a495-5017137fa06c","year":2024},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.198093Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:7c5290a6ab9c2a4e14167904b654cd9a9e84458b7bcb26ceb5e0b040527e7f7a","observation_id":"c871377a-b35e-4725-98b1-44ce9e340e4f","resolution":{"observed_at":"2026-08-12T14:08:43.152810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:43.040331Z","title":"Zero-shot event detection using multi-modal fusion of weakly supervised concepts","venue":null,"work_id":"70fc98f2-a9a3-407f-af56-4c36bd6effd7","year":2014},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.202643Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:5031a11065b4fe0ce3f00ba606c46a9fbef01abf7b1e14852cf7f4b63f53d997","observation_id":"002a0166-01aa-4425-8f9b-4ebf5272c2d3","resolution":{"observed_at":"2026-08-12T14:08:43.059961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:42.890892Z","title":"Cap4video: What can auxiliary captions do for text-video retrieval? In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages 10704–10713, 2023","venue":null,"work_id":"270987dd-f048-4737-94a4-71966e8df0a3","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.207694Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:7c84bdc5d3318616c0c59fb0918eaade5ce2c88a642d4a04bbad690f3df82900","observation_id":"fa7edda3-578f-463d-942c-58c3ed6cb094","resolution":{"observed_at":"2026-08-12T14:08:42.945797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:42.866059Z","title":"Revisiting clas- sifier: Transferring vision-language models for video recog- nition","venue":null,"work_id":"fd35bd81-5d26-4c5c-8462-755531a1884e","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.213370Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:3aea070a8b0594f4754018a59b483fd7b596732b54881bdb0b6999f66a48df85","observation_id":"d8a3b65a-cb63-4822-9401-d98af018659b","resolution":{"observed_at":"2026-08-12T14:08:42.879421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:42.775062Z","title":"Bidirectional cross- modal knowledge exploration for video recognition with pre-trained vision-language models","venue":null,"work_id":"f892c1fd-e293-429c-abdd-9afc09ff14eb","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.227643Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:300d0a852dc2b10a25e00154a327db5b201fd0da515da94adef14050f63dc24b","observation_id":"d61984bc-1b77-4ae9-894d-e0c97895b061","resolution":{"observed_at":"2026-08-12T14:08:42.835387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:42.633642Z","title":"Generative action description prompts for skeleton-based action recognition","venue":null,"work_id":"3bc6a19f-f308-4b3e-968b-9dc500d45636","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.259861Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:c7aba69b99dd1cf66f6e2aef335815f5ca832ee81ed79ca7f08d9be1b244b54b","observation_id":"cb7ad621-edbc-4d41-8701-0aad67f7b9c2","resolution":{"observed_at":"2026-08-12T14:08:42.651926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-16T17:53:18.213502Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-12T14:08:42.293896Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.293896Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:c0e72abb9e35d3bd1f28b73ea943b989108dede32c214e246fb60916462d15a5","observation_id":"31beffb7-5a7b-4c4d-b56c-48ca0150bb0e","resolution":{"observed_at":"2026-08-12T14:08:42.293896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:42.617817Z","title":"Movie genre classification by language augmentation and shot sampling","venue":null,"work_id":"7114f943-4014-46ab-8d41-2965b1f0a9e4","year":2024},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.298672Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:b11e813fadfff584bd25b413859467d04b00bdcd8155e15a43e539f07edcdd4e","observation_id":"cb277bc7-0b42-4946-9107-b6beed78ed43","resolution":{"observed_at":"2026-08-12T14:08:42.622826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:42.469278Z","title":"Learning video representations from large lan- guage models","venue":null,"work_id":"916ce107-6b59-4138-b3a6-dcf99a49b9be","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.303134Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:509e51188e85d10cbf1f15d7080fb0225b1c54393040a2f660c2bc04dd9c6eda","observation_id":"5cbe71b3-35a1-47ab-b07f-abd064bcdac0","resolution":{"observed_at":"2026-08-12T14:08:42.566586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:08:42.450135Z","title":"Learning procedure-aware video represen- tation from instructional videos and their narrations","venue":null,"work_id":"c55e2722-e2e0-4824-a0fe-18b8d449e056","year":2023},"citing_paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T14:08:42.308404Z"},"links":{"citing_paper":"/paper/2411.15628"},"observation_digest":"sha256:9fac2af2d251c5962bed34761bf3038efda735b552a1ae0be34c8992c7236b94","observation_id":"79a20398-21bc-4633-ad0f-c8d514f8455c","resolution":{"observed_at":"2026-08-12T14:08:42.457418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15628","last_updated":"2024-11-23T18:49:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T01:36:43.531267Z","submitted_at":"2024-11-23T18:49:49Z","title":"ACE: Action Concept Enhancement of Video-Language Models in Procedural Videos"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":54},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2411.15628."}