{"as_of":"2026-08-14T16:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:31c5b9f5bdd2d03c4ee2a023b9406646e07e7be48561eb4de52a29b5a4c1ec90","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:55:04.858493Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.17442/citation-record","integrity":"/paper/2508.17442/integrity","json":"/paper/2508.17442/citation-record.json","paper":"/paper/2508.17442"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:09.373636Z","title":"Human action recognition and prediction: A survey,","venue":null,"work_id":"6d7eb78e-afd3-46a4-ac0b-76c8227dd28c","year":2018},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:02.710999Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:77b6b616a17ae44fafe866653fd581ac9a755550286ae62cf5ebb419ed7de05a","observation_id":"3f1d62b3-e4ff-44e3-88cc-74fe63ac909f","resolution":{"observed_at":"2026-08-05T16:55:09.377306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:09.362472Z","title":"How would autonomous vehicles behave in real-world crash scenarios?","venue":null,"work_id":"81991c67-4699-4cfb-b04a-d86ec9e49963","year":2024},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:02.768294Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:e5d8c33287da22a653fe7f21a290579500508a8e03cba83a0f9f91036764b900","observation_id":"ca917620-26f2-4f5a-a9ef-15b7c3fb264e","resolution":{"observed_at":"2026-08-05T16:55:09.365851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:09.308865Z","title":"Crash-based safety testing of autonomous vehicles: Insights from generating safety- critical scenarios based on in-depth crash data,","venue":null,"work_id":"d5b156a1-48c6-4dfa-8fb9-536fd00a7698","year":2025},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:02.849541Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:a5f95f888fe4c8883022104df25bfaa9a98ff9333fede82e06067f922390a420","observation_id":"f23be0e3-7c48-4726-b026-9ec4087861db","resolution":{"observed_at":"2026-08-05T16:55:09.355542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:09.011309Z","title":"Diffcrash: Leveraging denoising diffusion probabilistic models to expand high- risk testing scenarios using in-depth crash data,","venue":null,"work_id":"2e90b1fc-4d1b-4f20-b2d1-7979b4639b77","year":2025},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:02.930306Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:d6355a99599ead7087687656d585c51bfc6f993ebaf456ae7305eb2e47139fe6","observation_id":"3c4d22bc-9847-4c6b-be31-85d70a0292ae","resolution":{"observed_at":"2026-08-05T16:55:09.181785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:08.791347Z","title":"Search-to-crash: Generating safety-critical scenarios from in-depth crash data for testing autonomous vehicles,","venue":null,"work_id":"65a1df9d-9ddd-4c45-b1ac-e738963dca3c","year":2025},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.044456Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:1c2ae0c808cb1110965bca92e0ee9e3850cd038018bc3aa98b75eb0dd3dea56d","observation_id":"6bf11373-c719-4f82-8435-1b6698d8172d","resolution":{"observed_at":"2026-08-05T16:55:08.901226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:08.620859Z","title":"Visual features of interme- diate complexity and their use in classification,","venue":null,"work_id":"c0eed1b2-adbb-43d3-a312-e86e4b09c8a8","year":2002},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.140644Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:1f44d3ebd1aa024f20685edac6025e96ef527cd80b1e99f11703c72375352fec","observation_id":"b35bfb34-040c-4576-8ba5-94b3c409ed6b","resolution":{"observed_at":"2026-08-05T16:55:08.705485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:03.247944Z","title":"Visual in-context learning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.247944Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:ea1d2a8f992e5fa1ea554870e642c04e62feab255fedaaaebee5bee0b7c6b707","observation_id":"0bf434c0-2c9b-4dc3-bd96-29e13993419b","resolution":{"observed_at":"2026-08-05T16:55:03.247944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:08.453394Z","title":"Weak to strong generalization for large language models with multi-capabilities,","venue":null,"work_id":"a7f0b6de-7d27-4d11-a43e-ec8f8409f88f","year":2025},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.335362Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:652f9e60046655482ec20baa35e98347ef76c87e7ed326f443408ac23837fd60","observation_id":"9211e064-77c1-4010-bfdf-c90ba7e07438","resolution":{"observed_at":"2026-08-05T16:55:08.527606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:03.423729Z","title":"A survey on large language model (LLM) security and privacy: The good, the bad, and the ugly,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.423729Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:11de086988e923364dc37643dd749e32b86cf01e43869b773daf9a9a55592e79","observation_id":"224aaed7-67a0-4e16-a210-5ce0c1e3997f","resolution":{"observed_at":"2026-08-05T16:55:03.423729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:08.268112Z","title":"Cbr-net: Cascade boundary refinement network for action detection: Submission to activitynet challenge 2020 (task 1),","venue":null,"work_id":"6da7f559-f51f-4b79-aac0-96f7ff4489bb","year":2020},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.530428Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:8881d281eb8da9fbce8ad8f5595d9cf51db207afe9c0c7af2f6bbf8e32ee9163","observation_id":"d4a7da62-e621-486a-9fa3-16dc0b86d2cd","resolution":{"observed_at":"2026-08-05T16:55:08.342940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:08.034079Z","title":"Fineaction: A fine- grained video dataset for temporal action localization,","venue":null,"work_id":"0edfdfc4-a128-40d0-b2bc-6e3d69b8d6bb","year":2022},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.602521Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:e250dcccc4d6201d785a3f8a3f51b2e6886e102a099c5a472c0ccbbf8e4ffafa","observation_id":"03899956-4933-490a-a4c7-629d929cd2a9","resolution":{"observed_at":"2026-08-05T16:55:08.146218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:07.855964Z","title":"The THUMOS challenge on action recognition for videos","venue":null,"work_id":"0e3b5172-0c75-419a-89e6-1d562e390a8f","year":2017},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.718104Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:c8d603b5c1da85095486ba52f6f45cd848d046741ca6aaea083977bad078b7fc","observation_id":"ef41a983-1680-4f33-b553-8d6fb8d8fe5b","resolution":{"observed_at":"2026-08-05T16:55:07.940537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:07.640436Z","title":"A survey on temporal action localization,","venue":null,"work_id":"99cdbcb2-d801-43b9-897e-e005f3a9be4b","year":2020},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.778064Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:3fd715de5ec6c701c59db67f984a6176758b1b9447f6ca4d7734e90d2dc0a85a","observation_id":"a7b9a5fe-129e-4185-9f99-899b1726cfc1","resolution":{"observed_at":"2026-08-05T16:55:07.725629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:07.402505Z","title":"Tallformer: Temporal action localization with a long-memory transformer,","venue":null,"work_id":"28447789-c8ba-476f-9d0e-dcf5af39b0a7","year":2022},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.844680Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:f5ed463adcf4f941eccc920fbb4ac8b46f6fc9cefa19f4e6aa3c354f2e2cba66","observation_id":"9382a4f2-34cd-4395-8309-5206f9e61901","resolution":{"observed_at":"2026-08-05T16:55:07.524109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:07.242289Z","title":"Cross-fiber spatial-temporal co-enhanced networks for video action recognition,","venue":null,"work_id":"6766e264-a299-483b-a1e3-5626bddfc71f","year":2019},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.899195Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:3254036070fc7c3b9eee4bd1d41f24341ee6ae4bb5d07cc82813ff79979eb6ea","observation_id":"f3f02e0a-06f0-4cdf-b677-c39fa59aa05a","resolution":{"observed_at":"2026-08-05T16:55:07.294764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:07.140378Z","title":"Mutually reinforced spatio-temporal convolutional tube for human action recognition","venue":null,"work_id":"78524330-4a55-421f-b905-be18ab2ab011","year":2019},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:03.980769Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:0c69ee928338cf1c90dc1c41c4771c6e32d5238b5c895a39b36e6512716e28e7","observation_id":"ac0b2a75-226b-45d7-b09d-38dcca55f0db","resolution":{"observed_at":"2026-08-05T16:55:07.192111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:06.958786Z","title":"Multi-scale spatial- temporal integration convolutional tube for human action recognition,","venue":null,"work_id":"59d22860-6969-4d46-b31e-00f9bec2690b","year":2021},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.066995Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:400f4fefcbbb347246fe95b374c2f6cb52c7427b1cb88d3d179fffc438bef321","observation_id":"02d844f6-21ee-476a-8b3b-42c23c94aa4b","resolution":{"observed_at":"2026-08-05T16:55:07.050514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:06.850244Z","title":"Cross-video contextual knowledge exploration and exploitation for ambiguity reduction in weakly supervised temporal action localization,","venue":null,"work_id":"43f51ec4-a950-48b3-8621-9457326b119a","year":2024},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.094400Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:e3852f7bf3f06651cf359d5e8d6de23455e997504ee8fffc592ad739c217f96c","observation_id":"567dc6b1-2132-407c-9605-a08dc09a600b","resolution":{"observed_at":"2026-08-05T16:55:06.901413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:06.670389Z","title":"Trigger is not sufficient: Exploiting frame-aware knowledge for implicit event argument extraction,","venue":null,"work_id":"ca52b3ce-663e-4856-9edf-f65232b10c3f","year":2021},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.157516Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:8c8d29f3858e837e6cf733b20537e2c00029d1e7881bd649425ffdeeadeddb66","observation_id":"0f799125-56a3-4d42-bd85-2a1197b630a1","resolution":{"observed_at":"2026-08-05T16:55:06.793739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:06.544400Z","title":"Guide the many-to-one assignment: Open informa- tion extraction via iou-aware optimal transport,","venue":null,"work_id":"ddae3110-0535-498d-b410-b5fb1cdde826","year":2023},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.215955Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:15d0a43222ca3dd53e0f273cd8d870dc566ad6c132732660662bb94869c536cf","observation_id":"d4beb4ae-e0ac-4bd4-80e5-35d32144f7e8","resolution":{"observed_at":"2026-08-05T16:55:06.618967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:06.338004Z","title":"Video activity localisation with uncertainties in temporal boundary,","venue":null,"work_id":"4038fc4c-91e5-472f-9f30-a3c3fb49fc42","year":2022},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.236450Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:21cb58ea66c1e535995e220e4a1a014c894325ac25b0d173088930456b044c6a","observation_id":"53ef3b59-ce1f-4abe-b2b6-42c2904fb1cb","resolution":{"observed_at":"2026-08-05T16:55:06.438970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:06.241981Z","title":"Exploring the reasoning abilities of multimodal large language models (mllms): A comprehensive survey on emerging trends in multimodal reasoning,","venue":null,"work_id":"01b52335-81d7-4a13-8fa1-a9a84b07e92a","year":2024},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.290223Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:3ec97c2443d1a09c6a414851760ed286bd7d4c181e13646187a941aaf1de3d3a","observation_id":"ea17fdfa-a670-4471-85df-f46710cca323","resolution":{"observed_at":"2026-08-05T16:55:06.310617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:06.057133Z","title":"How vision-language tasks benefit from large pre-trained models: A survey,","venue":null,"work_id":"cc5b744b-b23d-4490-9ee9-b043dee28c21","year":2024},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.314652Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:1395c2b7f719de807346b03752d2469fd3a793b7bcf3477d1afdb7691910f1f2","observation_id":"551a893b-fd60-4b3e-a6f2-1f062e4f7392","resolution":{"observed_at":"2026-08-05T16:55:06.167646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:05.907221Z","title":"From linguistic giants to sensory maestros: A survey on cross-modal reasoning with large language models,","venue":null,"work_id":"6ccaebd4-e71f-439d-aef5-b6a1055eae0b","year":2024},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.373024Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:5842ab3b79c5c646f55d2100a871b526882fc1efa8ba2be5ba9bfa76f7f8f7bf","observation_id":"ad1ced01-72c5-4aaf-8cad-4b5b40f9fa1e","resolution":{"observed_at":"2026-08-05T16:55:05.993465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:05.762252Z","title":"A systematic survey of prompt engineering on vision-language foundation models,","venue":null,"work_id":"51f261cd-148b-4950-a2fe-4bfeec348a28","year":2023},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.457379Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:6ddd9bde3e73b8cb93f2939bfb46c393a0ad5dc787a2a1967c7330c52d5322d7","observation_id":"f94019dc-ab73-426b-a526-9fd2d4d125db","resolution":{"observed_at":"2026-08-05T16:55:05.845189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:05.589639Z","title":"Evaluating multimodal vision- language model prompting strategies for visual question answering in road scene understanding,","venue":null,"work_id":"0be8df0f-a966-438f-93b0-ca34ba7e2865","year":2025},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.548139Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:06553e79e7524b68693478131b8f84fc9fea3a491af9f41d890e9d21925c5982","observation_id":"950d90b7-9a6d-4b03-923f-f2ae9d0f4cc6","resolution":{"observed_at":"2026-08-05T16:55:05.669528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:05.420276Z","title":"Towards grounded visual spatial reasoning in multi-modal vision language models,","venue":null,"work_id":"22000da2-42cd-4061-89f3-eda6eecb318c","year":2023},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.608059Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:01d968d8a5c6d8d83a0c36c7b349bb2bfb7964519a999f5d609c80beba32c761","observation_id":"4b5364e7-7739-4df5-9ba8-15d560a207f0","resolution":{"observed_at":"2026-08-05T16:55:05.509382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:05.292903Z","title":"Enhancing advanced visual reasoning ability of large language models,","venue":null,"work_id":"b263b3dc-6f5d-4b15-9f22-241143d355b4","year":2024},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.641263Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:c9062efaaa1871c8a4fd6fbe2f9b4618f8c22af7598a1d430976f89767581e04","observation_id":"51bb8a7c-3808-432c-b3e3-95078126c0b1","resolution":{"observed_at":"2026-08-05T16:55:05.335787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01377","last_updated":"2025-06-02T09:56:36Z","snapshot_observed_at":"2026-08-12T05:43:46.926602Z","submitted_at":"2025-01-02T17:37:20Z","title":"Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01377","snapshot_observed_at":"2026-08-05T16:55:04.691360Z","title":"Improving medical large vision- language models with abnormal-aware feedback,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.691360Z"},"links":{"cited_paper":"/paper/2501.01377","citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:c0269ce513f52ba6608932dbce8a8a721de8256803bf87dc2f8209852acf579a","observation_id":"3357097d-1759-4009-8866-21e72b58ae99","resolution":{"observed_at":"2026-08-05T16:55:04.691360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:05.135683Z","title":"Chain-of-specificity: Enhancing task-specific constraint adherence in large language models,","venue":null,"work_id":"33e9dd1c-19e1-4143-a2cc-2ea96bc14833","year":2025},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.745657Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:fc554716bcd729e8b66d3f36eb1414b9267815c1ba2daaf584e6b43fb2bb41f4","observation_id":"ce6576ed-c6cb-49b3-8ca9-b10ef9db3a17","resolution":{"observed_at":"2026-08-05T16:55:05.221014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:55:05.009715Z","title":"Lvlm-ehub: A comprehensive evaluation bench- mark for large vision-language models,","venue":null,"work_id":"8d0db7b8-06e6-4e77-9831-30ff41fc5307","year":2025},"citing_paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:04.858493Z"},"links":{"citing_paper":"/paper/2508.17442"},"observation_digest":"sha256:31e7a9acc7087eeca49bf3fe64cf43100f6b4cc07a3d9c68277eb9f068c08b7a","observation_id":"f4f25b48-e5c4-4bb2-bae9-b8d309399ca6","resolution":{"observed_at":"2026-08-05T16:55:05.054392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.17442","last_updated":"2025-08-24T16:45:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T05:44:09.417051Z","submitted_at":"2025-08-24T16:45:21Z","title":"Multi-Level LVLM Guidance for Untrimmed Video Action Recognition"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2508.17442."}