{"as_of":"2026-08-14T12:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:010944a6fe6b73597e7bb181bab56ef3b085935ffc7eafd48e11edf5e2d01835","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T21:59:53.297803Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.13039/citation-record","integrity":"/paper/2511.13039/integrity","json":"/paper/2511.13039/citation-record.json","paper":"/paper/2511.13039"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:47.978054Z","title":"Pcpcad: proposal complementary action detector,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:47.978054Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:905d112e1d3118e20b2f441c30d03115186f8f864a31fd1201d431b1e044ac7e","observation_id":"3c78e8d3-1b94-47a3-9e8f-b42c2262190a","resolution":{"observed_at":"2026-08-03T21:59:47.978054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:48.064518Z","title":"Capsule boundary network with 3d convolutional dynamic routing for temporal action detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:48.064518Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:4302b2bceb53a0385770ed16e863c85c127b3612c46b46a4e56baa8d5991c4a1","observation_id":"8a63b159-0b2f-4b12-9f39-8c58d3b85663","resolution":{"observed_at":"2026-08-03T21:59:48.064518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:48.144832Z","title":"Actionformer: Localizing moments of actions with transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:48.144832Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:873443e35dfe7c7e3b51e713d4d512f8cf3b88ad83383e54de067a7738dde854","observation_id":"30fe738b-b9bc-475c-9b07-f5933ba5f906","resolution":{"observed_at":"2026-08-03T21:59:48.144832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:48.280783Z","title":"Tridet: Temporal action detection with relative boundary modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:48.280783Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:170e6e9ff458429f80cdd59e031906412bc8eb610805350d43318d8259ebb2c5","observation_id":"b7e987fa-6c1e-43e0-b774-3cd184fb452a","resolution":{"observed_at":"2026-08-03T21:59:48.280783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:48.388555Z","title":"Co- occurrence matters: Learning action relation for temporal action localiza- tion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:48.388555Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:50906c4fee41a7d5f406093f1a64a2fe012c81b9c0894fdfbdc87bab1e40feb2","observation_id":"0d0ea27f-4ee9-4169-a63a-d5ad77c01b25","resolution":{"observed_at":"2026-08-03T21:59:48.388555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:48.513309Z","title":"Lpr: learning point-level temporal action localization through re-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:48.513309Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:50af36bddac4b05dd7beb37130b6636b7f2c37adc1d7a39cb3458e8f9380f84c","observation_id":"293d38a6-ad40-40c2-bb19-98923a151df6","resolution":{"observed_at":"2026-08-03T21:59:48.513309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:48.622941Z","title":"Boundary discretization and reliable classification network for temporal action detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:48.622941Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:9378b84a32d045b0a52755d69bc2082f6988658add3a1583300f4b05ed35c35c","observation_id":"a1ac4114-5f8e-4732-a9cc-25629d424b6e","resolution":{"observed_at":"2026-08-03T21:59:48.622941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:48.726200Z","title":"Throughout procedural transformer for online action detection and anticipation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:48.726200Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:35bfd523ba05aec01df90a909c392e1648e82582abf23a8cc2cc23cfb0bbea3c","observation_id":"ba8f2fa9-5267-4bef-a0c6-d510ec164f8d","resolution":{"observed_at":"2026-08-03T21:59:48.726200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:48.864824Z","title":"Bfstal: Bidirectional feature splitting with cross-layer fusion for temporal action localization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:48.864824Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:c51f49d50b9cce7065a0844d837acef3a0fc51752aa952cf0aba75b19f6a56c0","observation_id":"1564586d-e020-43c3-9a79-3a75c8525717","resolution":{"observed_at":"2026-08-03T21:59:48.864824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:49.003268Z","title":"Constructing semantical structure by segmentation integrated video embedding for temporal action detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:49.003268Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:0448efeb6a1c343ee96872cd3449b6a38c870a666a5f8cd90ce547f8b35bf506","observation_id":"dcde52f0-5274-439c-b7c3-8a39b9a31608","resolution":{"observed_at":"2026-08-03T21:59:49.003268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:49.085242Z","title":"Opental: Towards open set temporal action localization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:49.085242Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:9940e970f219e6cac45506e3707414be991db77847930e5da0316f8d462f101d","observation_id":"afc8a6de-c326-430e-b900-d6584b76c3c3","resolution":{"observed_at":"2026-08-03T21:59:49.085242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:49.235194Z","title":"Ow-tal: learning unknown human activities for open-world temporal action localization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:49.235194Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:da3eae7f9cf3e730c59bd9ab0e9cb3c17bfe91b64632997917fb0abc15d13cf2","observation_id":"b6affcd7-eb08-4f82-819a-cea53dc4b9bc","resolution":{"observed_at":"2026-08-03T21:59:49.235194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:49.345399Z","title":"Prompting visual- language models for efficient video understanding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:49.345399Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:df01e10c6a0bf4152e4274db9315f00fe23d980cfc836b0378f43965336e4097","observation_id":"f31b1129-6893-4ee1-9d1b-d15afd9ab7f1","resolution":{"observed_at":"2026-08-03T21:59:49.345399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:49.492174Z","title":"Detal: Open- vocabulary temporal action localization with decoupled networks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:49.492174Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:d37954863e46a632ad1585c2ca0dfd28bcdb7950a7f1522af79a466161a5d0e3","observation_id":"e692983e-1464-4a50-a0dc-deef9edeaff1","resolution":{"observed_at":"2026-08-03T21:59:49.492174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:49.604511Z","title":"Zeetad: Adapting pretrained vision-language model for zero-shot end-to-end temporal action detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:49.604511Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:d4c97f350e3724d1b95496e94dd002742167401152a0ebedfaa4f04061599d06","observation_id":"ce1f72ad-aadd-4ba1-9157-63e545cb1339","resolution":{"observed_at":"2026-08-03T21:59:49.604511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:49.711517Z","title":"Exploring scala- bility of self-training for open-vocabulary temporal action localization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:49.711517Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:565bdd30104dc94b9858d3f3d59dc1b032fb1c42f05f5e3a42f7f88b38e58677","observation_id":"0de9fd84-85e3-40dd-b765-0dbd3686ab39","resolution":{"observed_at":"2026-08-03T21:59:49.711517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:49.857381Z","title":"Zero-shot temporal action detection via vision-language prompting,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:49.857381Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:5d17ad682f0c9c813004cd9c00bbff3a71bc5720e8e52abd99adf63f872151a7","observation_id":"855dc047-5274-45cf-9814-be46e8ead56b","resolution":{"observed_at":"2026-08-03T21:59:49.857381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:50.020303Z","title":"Unloc: A unified framework for video localization tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:50.020303Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:a67b24974674bcae6d7bbe257b6588a082c90bc45e091d2bc1bf6df1160fa826","observation_id":"d7cc556d-eb64-42d0-b7f2-378ba92fe292","resolution":{"observed_at":"2026-08-03T21:59:50.020303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:50.153675Z","title":"Zero-shot temporal action detection by learning multimodal prompts and text-enhanced actionness,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:50.153675Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:38db3fb05c0b0828d023398b806084c17b13311562f002ab6915c9f17c0d88bb","observation_id":"df260d1e-4dba-4c96-a820-bd6ab1078ddc","resolution":{"observed_at":"2026-08-03T21:59:50.153675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:50.405475Z","title":"Text-infused attention and foreground-aware modeling for zero-shot temporal action detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:50.405475Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:2f65a3e1815eb77041803429d2f8b9ce8005cc7332576538ac97475ec4d76c4c","observation_id":"8eb113c0-1a39-4913-a8a3-64bbae09abf1","resolution":{"observed_at":"2026-08-03T21:59:50.405475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15556","last_updated":"2024-06-21T18:00:05Z","snapshot_observed_at":"2026-08-12T23:37:18.322689Z","submitted_at":"2024-06-21T18:00:05Z","title":"Open-Vocabulary Temporal Action Localization using Multimodal Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15556","snapshot_observed_at":"2026-08-03T21:59:50.575214Z","title":"Open-vocabulary temporal action localization using multimodal guidance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:50.575214Z"},"links":{"cited_paper":"/paper/2406.15556","citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:efc9ea4cd05de25473fe8eb43519570edae911085b096e5517fa03612e0bd5e2","observation_id":"5811bc1f-1600-41d5-969c-81acba2e1af1","resolution":{"observed_at":"2026-08-03T21:59:50.575214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:50.662114Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:50.662114Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:e6d3ebd26d514e25539887996ed12a5516c020a0dfe346cfc4b9d5ed2a836baa","observation_id":"f3504dc1-509e-422e-93ab-2b97c63d32c9","resolution":{"observed_at":"2026-08-03T21:59:50.662114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:50.798416Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:50.798416Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:7730a9b7358a719dc850e154100c419af4b3dd35c436d878e1e6837f3dec083f","observation_id":"087e91ff-384b-4921-8ec8-a51846042246","resolution":{"observed_at":"2026-08-03T21:59:50.798416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:50.935228Z","title":"Vltint: Visual-linguistic transformer-in-transformer for coherent video para- graph captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:50.935228Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:10f89a6c3d8b56e5f6827e3a07999ed2b573cb49a0f35e333332c7d6ceac4ac2","observation_id":"3ba94f67-869b-4015-9bfa-5b15a0161d51","resolution":{"observed_at":"2026-08-03T21:59:50.935228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:51.099626Z","title":"Decoupling zero-shot semantic segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:51.099626Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:60e10630763209758b611232e9dc80deb9e77644cc76cdd238f82e0c6fdf7e74","observation_id":"6e7cafdb-f317-46b1-8356-45714c370f46","resolution":{"observed_at":"2026-08-03T21:59:51.099626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06323","last_updated":"2024-03-17T22:58:03Z","snapshot_observed_at":"2026-08-13T14:07:24.025851Z","submitted_at":"2022-10-12T15:42:40Z","title":"AISFormer: Amodal Instance Segmentation with Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06323","snapshot_observed_at":"2026-08-03T21:59:51.223957Z","title":"Aisformer: Amodal instance segmentation with transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:51.223957Z"},"links":{"cited_paper":"/paper/2210.06323","citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:1a637b83da64f1507bb6879888194e2180bdc8e6051c17c826b83aa37a3e7a98","observation_id":"8b31b868-84ae-4b2c-81de-87c13647518a","resolution":{"observed_at":"2026-08-03T21:59:51.223957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-03T21:59:51.373543Z","title":"The power of scale for parameter-efficient prompt tuning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:51.373543Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:4f3d40b37707cfa1cd5d0ac751eac0872d2286289564f9cf18ccad43cb365bf3","observation_id":"40970e52-ac13-4a2d-9105-75df4881c073","resolution":{"observed_at":"2026-08-03T21:59:51.373543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:51.471979Z","title":"R-c3d: Region convolutional 3d network for temporal activity detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:51.471979Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:60ad8ae8029e2579e252259e179c2e1f73ef65d632a0b6f1899a28208ef51697","observation_id":"07c5bf7d-56ec-447a-a0f9-f03b5883a5e5","resolution":{"observed_at":"2026-08-03T21:59:51.471979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:51.515421Z","title":"G-tad: Sub- graph localization for temporal action detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:51.515421Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:46c48306c8238cc3eb261468feef73df92225a6e0a54aafb82c7567c1b9011c9","observation_id":"aa3529ae-b920-4a83-a08d-3217c1ff555f","resolution":{"observed_at":"2026-08-03T21:59:51.515421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:51.618686Z","title":"Tallformer: Temporal action localization with a long-memory transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:51.618686Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:831822518a1a309cfb20a6e53dc94b319bf85e4c8ebe84fa74484d7b3dfa0937","observation_id":"346b8b8f-caa2-4a6c-99bd-6fd2dc02af6e","resolution":{"observed_at":"2026-08-03T21:59:51.618686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:51.732343Z","title":"End- to-end temporal action detection with transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:51.732343Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:6bea860cf300ea5099a03baa9575d02798650f7d67f5bc434eff75f4d3c587a6","observation_id":"fb2ebf84-4243-4b77-8f33-3c8d226dec02","resolution":{"observed_at":"2026-08-03T21:59:51.732343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:51.796210Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:51.796210Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:6c52f31ab3747565ad4306524edda98160162d79fb8fa87efa3da4c12941ad26","observation_id":"1e8de330-75fe-4eeb-b1e4-98d82993826e","resolution":{"observed_at":"2026-08-03T21:59:51.796210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:51.891244Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:51.891244Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:52b8fb9afcbb2ad553f2b1b3248d1e46cb40e1e1ce503c340d309d1a42a7652b","observation_id":"e7febb0c-2ea6-44cf-84d8-a3c21c3ac917","resolution":{"observed_at":"2026-08-03T21:59:51.891244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:51.949779Z","title":"Weakly supervised action localization by sparse temporal pooling network,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:51.949779Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:2c731fc5d0f65f8d23733a8234257f5c36d8cc28d325c7dfb54d8f74b4d0c7bb","observation_id":"6a7d8369-8e42-46fb-a882-35ad3a2fbc9a","resolution":{"observed_at":"2026-08-03T21:59:51.949779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:52.042296Z","title":"Pivotal: Prior-driven supervision for weakly-supervised temporal action localization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:52.042296Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:348c12fbe08d62ca63c0e9a28ebda80e27933d37585f7f9ebc6896908f8dbc53","observation_id":"e13b1938-eab7-41ab-a063-c386a86440ec","resolution":{"observed_at":"2026-08-03T21:59:52.042296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:52.110104Z","title":"Improving weakly supervised temporal action localization by bridging train-test gap in pseudo labels,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:52.110104Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:c66fd8a4e946c2a4dfa3160119474e25535d061878318d75fe6c264f5e444868","observation_id":"3938ad28-38fe-4041-a4c0-22fe23ba8c3f","resolution":{"observed_at":"2026-08-03T21:59:52.110104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:52.186580Z","title":"Learning action completeness from points for weakly-supervised temporal action localization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:52.186580Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:3d4790f6da1d81509b5495178e0ad267a5f3c407844ce93101192fe9119902ae","observation_id":"07edc35b-a63c-4c9e-90ef-a3f51c16a464","resolution":{"observed_at":"2026-08-03T21:59:52.186580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:52.268133Z","title":"Hr-pro: Point-supervised temporal action localization via hierarchical reliability propagation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:52.268133Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:1f62d0300674cae351b7a3c843bfce036939c3fea179b6fc51ad9e4772f558be","observation_id":"5ce5bcf1-6638-4c5b-b5de-60d4587b961d","resolution":{"observed_at":"2026-08-03T21:59:52.268133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:52.363583Z","title":"Stepwise multi-grained boundary detector for point-supervised tempo- ral action localization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:52.363583Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:b926bde832ed911e8fea60529fe97cb49db1bc2bdfb5b2657675ce6b804559fc","observation_id":"f0fa7ed0-7ab7-4a0f-b223-24bc3088d54b","resolution":{"observed_at":"2026-08-03T21:59:52.363583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:52.433638Z","title":"Distance-iou loss: Faster and better learning for bounding box regression,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:52.433638Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:a4d9e81089f1b5be65b9e389f69742d8cd937967f0871392c4713aa0ddd40eb5","observation_id":"25b4e5bf-d48d-4377-9ee0-ddb23f9a46b3","resolution":{"observed_at":"2026-08-03T21:59:52.433638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:52.497184Z","title":"Focal loss for dense object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:52.497184Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:5defcff26bbac06469946678102fab835a9125d9660710b78ead7d565badf3e4","observation_id":"0202f36b-e1bb-4fbd-b4e2-955a27b31a02","resolution":{"observed_at":"2026-08-03T21:59:52.497184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:52.600275Z","title":"Open-vocabulary object detection via vision and language knowledge distillation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:52.600275Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:fed51b76cdafd09f56edbaf6e5de63c9de9cb41fcc6c648b3800359864bc734d","observation_id":"4d051476-eed3-464c-a774-24c2b88e1c62","resolution":{"observed_at":"2026-08-03T21:59:52.600275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:52.709614Z","title":"Ov-dquo: Open-vocabulary detr with denoising text query training and open-world unknown objects supervision,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:52.709614Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:be97b20f41b03ae438945de58972d1bae3bb5c225e7eb806511f01527b6b68ff","observation_id":"7efedcd0-cfc5-489e-8d72-ff016fcfc87c","resolution":{"observed_at":"2026-08-03T21:59:52.709614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:52.816590Z","title":"The thumos challenge on action recognition for videos “in the wild","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:52.816590Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:104f3c9857d75c4eb6b1f55eef28f2d26c6d013eb13ad5bed05f6b3b71c0a734","observation_id":"d5bd4985-a310-4521-ad4b-196cb8350909","resolution":{"observed_at":"2026-08-03T21:59:52.816590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:52.891761Z","title":"Activitynet: A large-scale video benchmark for human activity under- standing,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:52.891761Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:9c517dc8b6e3f911164a37207ae7f9e713936fed360dd70748e7a0e18464569b","observation_id":"6c7a1405-1317-4421-af7e-6b490851e0e5","resolution":{"observed_at":"2026-08-03T21:59:52.891761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:52.997473Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:52.997473Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:c52ab3712e88ec786ea5f5a0b6936be37da27409f81a13c3455da9cdbef3b2a6","observation_id":"473fe919-17c5-4fad-81f2-d2ec7756aa88","resolution":{"observed_at":"2026-08-03T21:59:52.997473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:59:53.090803Z","title":"Tsp: Temporally-sensitive pretraining of video encoders for localization tasks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:53.090803Z"},"links":{"citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:134a9ff6d0d9169ec77465b8ac336584bafee89749babded2c72a6b58d869bfd","observation_id":"80c14f32-3d37-4b03-bfac-161fdb7085e6","resolution":{"observed_at":"2026-08-03T21:59:53.090803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-03T21:59:53.197772Z","title":"The kinetics human action video dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:53.197772Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:244123dd8efc759c2cc37e6594f6ff1f33ae34e13d906e37b13a2bcd9be13911","observation_id":"178cce43-8e1e-43d6-8c99-20ad7946f073","resolution":{"observed_at":"2026-08-03T21:59:53.197772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-03T21:59:53.297803Z","title":"Sgdr: Stochastic gradient descent with warm restarts,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:53.297803Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2511.13039"},"observation_digest":"sha256:893dc60f5a0d272c8d62e47d6471eaae9f35b76f93b352d546a98b4157843645","observation_id":"b21935f3-e19c-4ea4-8f35-12eb11702828","resolution":{"observed_at":"2026-08-03T21:59:53.297803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.13039","last_updated":"2026-07-03T08:20:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:32:47.917280Z","submitted_at":"2025-11-17T06:40:02Z","title":"MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2511.13039."}