{"as_of":"2026-08-21T07:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b0384fb493ee61ce4fb320da5a7092d02f26009aa6071a4d35c2377cf94bff9e","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:36:11.822339Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:41:46.263737Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T23:35:05.394191Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08466","snapshot_observed_at":"2026-08-10T18:41:46.263737Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11124","last_updated":"2025-04-30T03:42:25Z","snapshot_observed_at":"2026-08-16T03:48:45.127682Z","submitted_at":"2025-01-19T17:31:40Z","title":"Rethinking Pseudo-Label Guided Learning for Weakly Supervised Temporal Action Localization from the Perspective of Noise Correction","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T18:41:46.263737Z"},"links":{"cited_paper":"/paper/2411.08466","citing_paper":"/paper/2501.11124"},"observation_digest":"sha256:8eed5df5eb30f596625991158179918890bb53ad169baa62eaafe2d8cd2ddf5b","observation_id":"f56252a4-3235-4d7b-86b6-5dadfd0e446e","resolution":{"observed_at":"2026-08-10T18:41:46.263737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08466","snapshot_observed_at":"2026-08-09T12:09:14.625616Z","title":"Can mllms guide weakly-supervised temporal action localization tasks? arXiv preprint arXiv:2411.08466,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02454","last_updated":"2025-04-30T03:28:52Z","snapshot_observed_at":"2026-08-16T16:09:25.972056Z","submitted_at":"2025-02-04T16:20:41Z","title":"IMDPrompter: Adapting SAM to Image Manipulation Detection by Cross-View Automated Prompt Learning","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T12:09:14.625616Z"},"links":{"cited_paper":"/paper/2411.08466","citing_paper":"/paper/2502.02454"},"observation_digest":"sha256:2923c091c53e7c76e25c0a5b94ca9e74ad4c6bac26339d870dcfb2471f71ec45","observation_id":"3678d028-2e12-4e16-9437-163810683175","resolution":{"observed_at":"2026-08-09T12:09:14.625616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08466","snapshot_observed_at":"2026-08-07T13:02:35.241122Z","title":"ProbTS: Benchmarking point and distributional fore- casting across diverse prediction horizons","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23017","last_updated":"2025-07-26T14:24:12Z","snapshot_observed_at":"2026-08-13T23:13:55.886096Z","submitted_at":"2025-05-29T02:52:59Z","title":"$K^2$VAE: A Koopman-Kalman Enhanced Variational AutoEncoder for Probabilistic Time Series Forecasting","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:35.241122Z"},"links":{"cited_paper":"/paper/2411.08466","citing_paper":"/paper/2505.23017"},"observation_digest":"sha256:b0ba34d43f81e0a9cc0e0e8e51ffcacf52200eb7c4936ef4d0554a1f5dde8c6f","observation_id":"7a53f4de-b7b7-40fc-88cd-a4056a624f73","resolution":{"observed_at":"2026-08-07T13:02:35.241122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08466","snapshot_observed_at":"2026-08-07T12:48:46.650668Z","title":"Can mllms guide weakly- supervised temporal action localization tasks?,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-12T23:07:30.958468Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:46.650668Z"},"links":{"cited_paper":"/paper/2411.08466","citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:3ecebf1362c46872253f7d036488e2394dc254dfe93fd3d3b9c8122d161b5e07","observation_id":"bedf9601-f849-45c1-893d-4433e4ec5471","resolution":{"observed_at":"2026-08-07T12:48:46.650668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08466","snapshot_observed_at":"2026-08-07T11:03:17.468809Z","title":"Can mllms guide weakly- supervised temporal action localization tasks?arXiv preprint arXiv:2411.08466, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03737","last_updated":"2025-06-04T09:10:02Z","snapshot_observed_at":"2026-08-14T22:56:03.982832Z","submitted_at":"2025-06-04T09:10:02Z","title":"ComRoPE: Scalable and Robust Rotary Position Embedding Parameterized by Trainable Commuting Angle Matrices","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:17.468809Z"},"links":{"cited_paper":"/paper/2411.08466","citing_paper":"/paper/2506.03737"},"observation_digest":"sha256:b47a32a52987f95f68a42aa35655ded451b6da4a53ff2d808f3974c7c441c89f","observation_id":"a3ed2881-9cd1-469e-bad0-9fa6ec7dcede","resolution":{"observed_at":"2026-08-07T11:03:17.468809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2411.08466","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.08466","snapshot_observed_at":"2026-08-06T23:35:05.394191Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","venue":"cs.CV","work_id":"180d3e8e-fad6-47f9-aa28-9f8a675bfacf","year":2024},"citing_paper":{"arxiv_id":"2506.17516","last_updated":"2025-06-20T23:45:51Z","snapshot_observed_at":"2026-08-15T14:10:04.334334Z","submitted_at":"2025-06-20T23:45:51Z","title":"EASE: Embodied Active Event Perception via Self-Supervised Energy Minimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:02.407618Z"},"links":{"cited_paper":"/paper/2411.08466","citing_paper":"/paper/2506.17516"},"observation_digest":"sha256:4dc5c776ddbb9ae094ecfbed1f2e6190fab285f351f1c84351dd38c9d4ba76c3","observation_id":"25f38f2e-2f51-40c5-92f9-cb4d5f11d566","resolution":{"observed_at":"2026-08-06T23:35:05.494183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.08466/citation-record","integrity":"/paper/2411.08466/integrity","json":"/paper/2411.08466/citation-record.json","paper":"/paper/2411.08466"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.696285Z","title":null,"venue":null,"work_id":"e5d53d33-7716-4c6d-8da3-1f31f8e1a7f4","year":2023},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.558097Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:590c990466088f0679c662fc2004cc443e79c90bf929f2f0aa9b036bdc9644ef","observation_id":"97085144-945e-4d1c-9114-61480fd36d05","resolution":{"observed_at":"2026-08-12T21:36:12.701361Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:11.564654Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.564654Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:6277cc7c36daa10fd2dc352a893853c256966459ae2ef1cb8ede16accb88456c","observation_id":"261affba-45d6-4c7d-a464-6ff2955a3d2e","resolution":{"observed_at":"2026-08-12T21:36:11.564654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.668200Z","title":"Boundary content graph neural network for temporal action proposal generation","venue":null,"work_id":"b681a92a-5849-4c52-98c7-a6590a1cf67e","year":2020},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.570633Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:a266cb4aa943c7229440cbd3529069ca5be175888e14063497c3409959e91ef4","observation_id":"38334622-3801-429a-8883-069d586db59c","resolution":{"observed_at":"2026-08-12T21:36:12.673530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:11.576291Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.576291Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:415354f397d7b8d02d32fcf799cc7fe4ad039b82cd016551e49c3322d4c36f20","observation_id":"09336ad7-3c97-48fb-ae14-e9c972815aed","resolution":{"observed_at":"2026-08-12T21:36:11.576291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:11.582375Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.582375Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:8eda4213c576769e8e6645d387df40e08847ff66582d9b24d6aa55803a6fa7d4","observation_id":"36779a57-94f6-4842-9b6a-eb4cb1d12b87","resolution":{"observed_at":"2026-08-12T21:36:11.582375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.630715Z","title":"Ross, Jia Deng, and Rahul Sukthankar","venue":null,"work_id":"08d5dcef-faa4-429c-a913-930647533979","year":2018},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.588189Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:0b18bb50c94f4a0eeee297313816f94fb523bacc29fa10dfe0fcc9b1c98e5b88","observation_id":"600d8cc2-c59a-4ac2-a54c-1a88469f2027","resolution":{"observed_at":"2026-08-12T21:36:12.636096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.614701Z","title":"Dual-evidential learning for weakly-supervised tempo- ral action localization","venue":null,"work_id":"884429ac-b6d8-4b02-a86c-7bd6c639cf78","year":2022},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.593446Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:d633c540410bb9edd248ed7ec9772535ce6f900a50256b374b74e3dd052969ad","observation_id":"39eaff1e-1cf9-4801-953a-17a6821f4a71","resolution":{"observed_at":"2026-08-12T21:36:12.619954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16531","last_updated":"2025-01-13T14:34:40Z","snapshot_observed_at":"2026-08-16T13:40:11.311272Z","submitted_at":"2024-06-24T11:10:41Z","title":"GIM: A Million-scale Benchmark for Generative Image Manipulation Detection and Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16531","snapshot_observed_at":"2026-08-12T21:36:11.599192Z","title":"Gim: A million-scale benchmark for genera- tive image manipulation detection and localization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.599192Z"},"links":{"cited_paper":"/paper/2406.16531","citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:4111fce3015f7297c165d8e3be3401026fac5f6937cf0a5251d9371d5b91c5c4","observation_id":"86716db9-bca9-4a6e-a39c-32888fd56e20","resolution":{"observed_at":"2026-08-12T21:36:11.599192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.597855Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":"8d26ead5-7998-4deb-9a1d-a9abb2d3372c","year":2023},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.604874Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:68d11db948e6dc83158f43392a1b76b0c3b451a868794f5acfea3a3a9cf84e23","observation_id":"20deaa4e-b21d-4519-a17a-389b31bc4c32","resolution":{"observed_at":"2026-08-12T21:36:12.603245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:11.610123Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.610123Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:20e8f3f5ee150e5e453f2f6d4bd90ae7e93a11b03dee04661507b7e039856cf8","observation_id":"8a4c02c5-c110-49fb-9a0e-b6932ae9c350","resolution":{"observed_at":"2026-08-12T21:36:11.610123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.571466Z","title":"Cross-modal consensus network for weakly supervised temporal action localization","venue":null,"work_id":"a38abc23-9122-414b-ae58-d28220321f28","year":2021},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.615303Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:42d99aa527068c82eb82b31cf98051b509c21e4bfca4a86250a47fefafa53cb7","observation_id":"1d45a2f4-09e0-433e-9012-465930d6bdd2","resolution":{"observed_at":"2026-08-12T21:36:12.576722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.554624Z","title":"in the wild","venue":null,"work_id":"360b0fe6-0b71-4134-814b-2144ef8d4554","year":2017},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.620447Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:647159b0f57e0ed805c4e7b809545fc23761dbbf2c4a80914497bcc3dae8c08e","observation_id":"4db7b917-08a1-49c1-a973-da2380f8982d","resolution":{"observed_at":"2026-08-12T21:36:12.559970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.537623Z","title":"A hybrid attention mechanism for weakly-supervised temporal action localization","venue":null,"work_id":"24c13e90-0ecd-43ac-954e-47069db75911","year":2021},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.625374Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:f8c62e2cdc05caf7ce25e29bc655ef42ecdfceb11773617b96ccffbdf246a174","observation_id":"b17a1e44-be00-404a-b803-fb4244765137","resolution":{"observed_at":"2026-08-12T21:36:12.542981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.518718Z","title":"Distill- ing vision-language pre-training to collaborate with weakly- supervised temporal action localization","venue":null,"work_id":"8a29df07-8a03-4d29-9b14-ba5132609041","year":2023},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.630650Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:fe1d560958d63dcc3dd8bdc62367a730364096c0c5914b602ec0749d671297eb","observation_id":"1a5ea49f-278e-4fd8-9397-0d422a9a5af1","resolution":{"observed_at":"2026-08-12T21:36:12.525359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.501301Z","title":"Weakly-supervised temporal action localization by uncer- tainty modeling","venue":null,"work_id":"8fa18ea7-5d4f-4bb1-8909-a72efb9e048f","year":2021},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.635969Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:4bf35b3466ffb9dd11f557610eec9e83df24352d8a99955c9f73d7210f520328","observation_id":"bcc98d08-6822-4593-825b-9bc4ab4a172b","resolution":{"observed_at":"2026-08-12T21:36:12.506597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-12T21:36:11.641219Z","title":"Otter: A multi-modal model with in-context instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.641219Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:5831d1da2685a47c3e8cb4d60d447fe70fd8564491cf4b56a366e3e92ab56849","observation_id":"bc4f8965-66ec-469e-a4ac-e83353684fac","resolution":{"observed_at":"2026-08-12T21:36:11.641219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.484117Z","title":"Boosting weakly-supervised temporal action localization with text information","venue":null,"work_id":"a8b2928f-0aff-4b37-8918-50592516e986","year":2023},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.646549Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:e833ddfdb1fbf68e733b4d44cb300a0e6a133d89ae1e89f2ed96ff4eb540cec3","observation_id":"da9dbb40-df71-4b10-863d-1ff79759fef7","resolution":{"observed_at":"2026-08-12T21:36:12.489870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.466127Z","title":"Exploring denoised cross-video contrast for weakly- supervised temporal action localization","venue":null,"work_id":"f7323302-f073-49ff-bee9-602266968582","year":2022},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.652359Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:d3712de3c0d45b674de8ce8c8e6dcd55a1667105ba780873d02d6f3c5860d4e8","observation_id":"d0ca7528-3d02-4a9f-92d1-4a5850410aab","resolution":{"observed_at":"2026-08-12T21:36:12.471770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-20T12:00:24.760146Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-12T21:36:11.657110Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.657110Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:249063617941bfa5b9f29c85ce9c42ab66b2aaf6c6dfe02b0d947f48218f710d","observation_id":"3831a3f9-736f-4389-a001-9eb0cdca190e","resolution":{"observed_at":"2026-08-12T21:36:11.657110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.446381Z","title":"Revisiting foreground and background sepa- ration in weakly-supervised temporal action localization: A clustering-based approach","venue":null,"work_id":"dc997975-ebdc-4f40-ac52-78644634a203","year":null},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.662227Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:9c512b17a6b5a6a509ea76e1ccf850c4ce81525e9a63bb2b6447405d02b99752","observation_id":"d3735fa2-fcab-41b4-8dc6-b610c4e096e3","resolution":{"observed_at":"2026-08-12T21:36:12.452071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.426624Z","title":"Pivotal: Prior-driven supervision for weakly-supervised tem- poral action localization","venue":null,"work_id":"b00197cb-81f6-426b-ae6e-15aabfa1f4aa","year":null},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.667684Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:765c23c572ef69a2e04eff9138a0f09c08f18a55a8f676e52e58f7b060a3b673","observation_id":"0e568180-5dce-46e2-b60c-d930976fead8","resolution":{"observed_at":"2026-08-12T21:36:12.433741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.401531Z","title":"Weakly supervised action localization by sparse temporal pooling network","venue":null,"work_id":"28f05d8c-29f2-4cf9-ad0e-a76bae9df975","year":null},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.673029Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:6e70f87296e96f8f2fd06cb6e8a3084d2cb053359ca16282a7b6ecf071b67d8d","observation_id":"ac17e594-17ca-45c6-93ce-91f7937f0051","resolution":{"observed_at":"2026-08-12T21:36:12.410662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.382548Z","title":"GPT-4 Technical Report","venue":null,"work_id":"a3b4a55d-0851-4a3c-89cb-5515faa7949e","year":2023},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.678221Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:fedf3a8c9c2e7ac8c77e2e7423c66f445eea3433dddb4571c616ef14ff027800","observation_id":"52fb9456-c874-41e7-997b-e4be013c4002","resolution":{"observed_at":"2026-08-12T21:36:12.388809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.357065Z","title":"W- talc: Weakly-supervised temporal activity localization and classification","venue":null,"work_id":"b8bdcff1-540a-4d60-97f5-037b3a60bb1a","year":2018},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.683356Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:116f01448480cf20064607d823fbb1d3277e961d3898bde2ab9f46a9ff2b6454","observation_id":"2ac5cd9a-1fda-4223-9a70-a8d8336a720b","resolution":{"observed_at":"2026-08-12T21:36:12.368915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:11.688551Z","title":"Glove: Global vectors for word representation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.688551Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:34b2b8feb51e8886f6cf3608cd37552f920bb598367a4e2ee37840945f724bc9","observation_id":"122c751a-a5cc-4fde-97d2-cace70bf17a2","resolution":{"observed_at":"2026-08-12T21:36:11.688551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.326016Z","title":"Proposal-based multiple instance learning for weakly-supervised temporal action localization","venue":null,"work_id":"b1ff74e4-bfea-4312-99d4-466e7edbe427","year":2023},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.693613Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:e7a3c1ed7eeca286640885994a68d59cbd99a654c5f40a722430eed306e0fa52","observation_id":"d54afbb7-1d90-4d32-8e50-a14c043255c1","resolution":{"observed_at":"2026-08-12T21:36:12.331497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.305473Z","title":"Dynamic graph modeling for weakly-supervised temporal action localization","venue":null,"work_id":"2d46ee5a-4aea-45f7-8722-a39adee6e382","year":2022},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.701763Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:d344078157cb6c60289ade3f77e2edc376081ac15b847c2c5a94f68b897f84c2","observation_id":"5fc1b78f-ec68-474d-91cb-c97c1e7414f7","resolution":{"observed_at":"2026-08-12T21:36:12.312279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.286347Z","title":"Ddg- net: Discriminability-driven graph network for weakly- supervised temporal action localization","venue":null,"work_id":"14a0ce7f-e091-4567-9f17-1f127b9ea859","year":null},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.708125Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:8c09b1912e29c931d99c803357fac79c157a8af2380f08e1fcfd250a0b6c167e","observation_id":"4d5875be-b636-47dd-9302-bcfec9d5cc99","resolution":{"observed_at":"2026-08-12T21:36:12.292693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T21:36:11.713590Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.713590Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:6160f4008cab16c92f5c25b005858bd300c1ef67a5cd141636d3d7df2181355d","observation_id":"8c245d6f-d29c-41fb-bcc3-e5165c5a259a","resolution":{"observed_at":"2026-08-12T21:36:11.713590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-08-20T14:00:35.783346Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-08-12T21:36:11.718934Z","title":"Chatvideo: A tracklet-centric multimodal and versatile video understand- ing system","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.718934Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:e2a14c86a0a328e33f96a7f45cbb69348b4064dc977721e7f5e8320a548c43f1","observation_id":"bf17ea4f-44ce-4617-b95e-5b76be27a0d3","resolution":{"observed_at":"2026-08-12T21:36:11.718934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.268275Z","title":"Untrimmednets for weakly supervised action recognition and detection","venue":null,"work_id":"af2bb7aa-92c3-4c0f-9da4-1486d3205bfc","year":2017},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.725188Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:d4ce6f4a94fc9cf6f038350196bbe6c3e56259a8343497a1ff068dde02fae84f","observation_id":"447632aa-23a4-4aca-9ad1-322b9f8c00b9","resolution":{"observed_at":"2026-08-12T21:36:12.273423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.249847Z","title":"Two-stream net- works for weakly-supervised temporal action localization with semantic-aware mechanisms","venue":null,"work_id":"dcb93dff-ac6a-48a4-b891-1339a5e3edb9","year":null},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.731447Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:815aafccdfcd05fd1ac9cddcf8ae00546563d14892ef92fc5ea463715ed7da9b","observation_id":"d2fb7309-8681-4875-ba20-01c17a89716d","resolution":{"observed_at":"2026-08-12T21:36:12.255394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.231460Z","title":"Task groupings regulariza- tion: Data-free meta-learning with heterogeneous pre-trained models","venue":null,"work_id":"66793bdd-aa69-476d-9921-975eb2b5aa2c","year":2024},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.737018Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:38f6f3e90237552796d0e417539c25f26c5cfc7aae9632f9fb357d03f616a77d","observation_id":"f2c5a812-8387-4bf7-a140-1ced0dc93316","resolution":{"observed_at":"2026-08-12T21:36:12.237316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.214935Z","title":"Free: Faster and better data-free meta-learning","venue":null,"work_id":"731e1e80-b1be-4bf5-aa65-5f6fa623fb58","year":2024},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.742306Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:303340542776b735a4515d1cf673d772500f9642634a1f645d0be182cc07ec58","observation_id":"56ebf1f4-8c3e-42b9-a47e-99c3b4e58fe4","resolution":{"observed_at":"2026-08-12T21:36:12.220371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01230","last_updated":"2025-05-26T13:01:08Z","snapshot_observed_at":"2026-08-20T17:24:36.380157Z","submitted_at":"2025-01-02T12:45:21Z","title":"Modeling Multi-Task Model Merging as Adaptive Projective Gradient Descent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01230","snapshot_observed_at":"2026-08-12T21:36:11.747711Z","title":"Modeling multi-task model merg- ing as adaptive projective gradient descent","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.747711Z"},"links":{"cited_paper":"/paper/2501.01230","citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:e12be5d1bb6dcdde78e407b5f99cc8800485751f34a93d9d7890fa4778a910d7","observation_id":"036d4442-99ef-4ce7-b05d-10dbac69da3b","resolution":{"observed_at":"2026-08-12T21:36:11.747711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.199075Z","title":"G-tad: Sub-graph localization for tempo- ral action detection","venue":null,"work_id":"ab363d6e-5f20-4893-a3a0-06efec1d9e3d","year":2020},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.752928Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:85cd39472719b48bfea2fe29313dd394e72f43442883a9667f2505a1e5559fc5","observation_id":"8dbc99b1-c9b6-4c0a-8c9b-7afe697693fe","resolution":{"observed_at":"2026-08-12T21:36:12.204095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.182084Z","title":"Uncertainty guided collaborative training for weakly supervised temporal action detection","venue":null,"work_id":"0c55db10-d2d4-4a6c-90d7-89d85dde8322","year":2021},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.758271Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:36e47716e93a6164f5b524a3e35fe4cc143578133a1a7f2f536f540f32d71926","observation_id":"d95f7a06-1112-4c7b-91bb-d767273b5e8e","resolution":{"observed_at":"2026-08-12T21:36:12.187262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.164947Z","title":"Weakly-supervised temporal action localization by in- ferring salient snippet-feature","venue":null,"work_id":"8ef15240-7613-4d38-9b0b-73bb220b0a48","year":2023},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.763190Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:c49503a0f8f5b45bb98e79b322403a297a2710df9a62b2816a656620fe2d560b","observation_id":"c305d2a5-eeec-4385-9b24-2ee6712a2e21","resolution":{"observed_at":"2026-08-12T21:36:12.170720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.148581Z","title":"Graph con- volutional networks for temporal action localization","venue":null,"work_id":"7fd04e1e-df0a-4385-a9ac-bfad6c756903","year":2019},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.768607Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:5efc7181c2257a86dce1be4db11c9d1a3c8d1677089c372065015a5c3275861f","observation_id":"814cf87b-15ff-4084-9b97-a233af6b960e","resolution":{"observed_at":"2026-08-12T21:36:12.153636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.130309Z","title":"Two-stream consensus network for weakly-supervised temporal action localization","venue":null,"work_id":"ab85d806-f797-40e6-9804-a3c46ccfb35d","year":2020},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.773598Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:f88403a15b7df10d100375529dfab1da444f2386718386955f6c04e2e47ea4d0","observation_id":"a1ff3c2c-7018-45bb-a709-2818e5f398b3","resolution":{"observed_at":"2026-08-12T21:36:12.137071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.111432Z","title":"Cola: Weakly-supervised temporal action lo- calization with snippet contrastive learning","venue":null,"work_id":"24be790c-c4e7-4da5-bedb-97abb96c32da","year":2021},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.779695Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:24978ffb066ae7d95ded0cb86e71c4b386c6daa0b971b59fa33ef6ddf196619d","observation_id":"55af6a6f-961e-4397-af5d-5c24577db356","resolution":{"observed_at":"2026-08-12T21:36:12.117654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-12T21:36:11.784885Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.784885Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:0dc5425a3e574e6859bf9724c4c3f608c4e1a0752d6171caee07f3064a20661b","observation_id":"28b6fad0-024c-4177-be9a-da63dfcbf2f0","resolution":{"observed_at":"2026-08-12T21:36:11.784885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.093371Z","title":"Distilling semantic priors from sam to efficient image restoration models","venue":null,"work_id":"63c5d93c-986b-42e5-8d4c-ab1d89b6cf93","year":2024},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.790123Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:aba95db18af011740ed9c4376d8f1cd967aa985716015b3c5cde1cb880d9ad5d","observation_id":"dcc7179f-a301-4d6b-b156-3b52753db662","resolution":{"observed_at":"2026-08-12T21:36:12.098688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.075439Z","title":"IMDPrompter: Adapting SAM to image manipulation detection by cross-view automated prompt learning","venue":null,"work_id":"2484db57-f43d-4df9-8f59-26c792f5f4b2","year":2025},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.795002Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:d222ff34a8823b4761b19708f5f8d037f4963ff56e8b776dfb154fc8b7070c89","observation_id":"bf015b08-6896-48a0-a4d3-683d187819c0","resolution":{"observed_at":"2026-08-12T21:36:12.081702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11124","last_updated":"2025-04-30T03:42:25Z","snapshot_observed_at":"2026-08-16T03:48:45.127682Z","submitted_at":"2025-01-19T17:31:40Z","title":"Rethinking Pseudo-Label Guided Learning for Weakly Supervised Temporal Action Localization from the Perspective of Noise Correction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11124","snapshot_observed_at":"2026-08-12T21:36:11.800447Z","title":"Rethinking pseudo-label guided learning for weakly supervised temporal action localization from the perspective of noise correction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.800447Z"},"links":{"cited_paper":"/paper/2501.11124","citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:a19a0d0d1302b68f7e3422bf1676db71f56a71ac2ea54c7b1c7ed40b4f4b2725","observation_id":"c340076f-f02f-47af-8969-591674eb56e7","resolution":{"observed_at":"2026-08-12T21:36:11.800447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.057667Z","title":"Equivalent classification mapping for weakly supervised temporal action localization","venue":null,"work_id":"22def18a-1f28-49cc-a7b6-f83b7d1bf8c5","year":2022},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.807573Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:c48a137c09642deab3f526c591783879fe82626752303f992652d3e2d3743e16","observation_id":"240a1cd1-2724-49ab-bbb3-5ffb4d8bd26a","resolution":{"observed_at":"2026-08-12T21:36:12.063208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.040807Z","title":"Temporal action detection with structured segment networks","venue":null,"work_id":"af721401-6eba-4ee2-bb41-2c3cdf9e486b","year":2017},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.812636Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:92251fc27c2da3f2969edb6ab0cb48298f08ca2a9fae47ab155ccdbaaff72c24","observation_id":"a5af33e2-847c-46b9-b007-6d250328252d","resolution":{"observed_at":"2026-08-12T21:36:12.046226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:36:12.021211Z","title":"Improving weakly supervised temporal ac- tion localization by bridging train-test gap in pseudo labels","venue":null,"work_id":"e22a7ee3-61d3-4f36-8108-bd0c3692f4de","year":2023},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.817668Z"},"links":{"citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:80467b19f163572a356c4b3a0b0098617450ec60222165c32fd7c61a45bde0a5","observation_id":"81c3e45f-dca6-41b3-bff4-ac02220ac7c6","resolution":{"observed_at":"2026-08-12T21:36:12.028875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T21:36:11.822339Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T21:36:11.822339Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.08466"},"observation_digest":"sha256:516450ab209d9c64b778e135ec07a169db99a5a55f8fa99bd29a661b2b02bd8c","observation_id":"c12398e9-0c05-4d2b-ae6b-78b3c5635b34","resolution":{"observed_at":"2026-08-12T21:36:11.822339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T03:52:34.752597Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 6 inbound Pith citation observations for arXiv:2411.08466."}