{"as_of":"2026-08-12T10:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb65b9f89ee591a961666bcfa890ba65e25f47d73cdb56cc52389321c1a2968c","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:11:23.167054Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.06411/citation-record","integrity":"/paper/2507.06411/integrity","json":"/paper/2507.06411/citation-record.json","paper":"/paper/2507.06411"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.713876Z","title":"Vivit: A video vision transformer","venue":null,"work_id":"7c2dd7e1-16ce-482f-a464-e937e1c49ec1","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:20.882065Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:0ec8f4424184ffce78c34a277e79af839d6673cd8982ad4fb274e9599e5b2706","observation_id":"3bb0926f-8a10-4230-ad41-a85e8fd943c2","resolution":{"observed_at":"2026-08-06T19:11:23.716270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.706317Z","title":"Boundary content graph neural network for temporal action proposal generation","venue":null,"work_id":"9b262563-d4c4-4b3b-8365-7e2cc400dcc9","year":2020},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:20.974232Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:6a4e84770b9b52206472e2b58671281f3315ca3ebdf42cba3e9d260e6dea6a24","observation_id":"1a6680cb-8762-4391-81b7-ce41f8b5dd50","resolution":{"observed_at":"2026-08-06T19:11:23.708965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.698659Z","title":"Is space-time attention all you need for video understanding? In ICML, volume 2, pp.\\ 4, 2021","venue":null,"work_id":"5b709ca0-5181-49f2-b3fd-7299986ddee3","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:21.050339Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:9977f3573a35e6f97268d82f5c676da078903abfe383c9d9bbfd9b3026d381cd","observation_id":"cb8ad928-f109-4993-988f-da3c892ed12d","resolution":{"observed_at":"2026-08-06T19:11:23.701404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:21.058893Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:21.058893Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:b76d727254dc0cbe0620c8134213d3625ea5878af8bc27970c0707b91f0c4aa6","observation_id":"9782d516-15c3-407c-8a6e-4a0bd220198b","resolution":{"observed_at":"2026-08-06T19:11:21.058893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:21.198988Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:21.198988Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:78bb04812ed6370fad50fe7511ee25101079ee0babc7262272f1119b1d06545d","observation_id":"0c634ced-25c8-4600-9973-d200475574cd","resolution":{"observed_at":"2026-08-06T19:11:21.198988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.681190Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"9ef981da-9191-47dd-a550-4bf633e518f9","year":2017},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:21.379207Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:3ae82d349be8cbc157743f56b42d1d134fea15ef312c345508fdf0e9250f17f6","observation_id":"327cb808-0ffb-4d79-aa55-de7b86fc4cc0","resolution":{"observed_at":"2026-08-06T19:11:23.683764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.673773Z","title":"Augmented transformer with adaptive graph for temporal action proposal generation","venue":null,"work_id":"18fee6fb-d568-4c68-8b4f-14c34b583862","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:21.556748Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:33ae8902e06ed36175510a1f962254dddbdde335d77f95cb92b7878f11275a29","observation_id":"6863284a-d72a-4c8a-84fa-63c2c7ceb57a","resolution":{"observed_at":"2026-08-06T19:11:23.676383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.665827Z","title":"Rethinking the faster r-cnn architecture for temporal action localization","venue":null,"work_id":"aa1c8a01-020e-4b5f-b6b5-70719eb7295e","year":2018},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:21.763088Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:c247965593f316cef7d605647baa8081d59053941994405f29752c881dac8e11","observation_id":"30450159-c52c-4a87-beac-7eb5948a846a","resolution":{"observed_at":"2026-08-06T19:11:23.668516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.658253Z","title":"Dcan: improving temporal action detection via dual context aggregation","venue":null,"work_id":"ec3f9e83-9c06-4683-a3c6-b8cb42823663","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:21.874784Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:ec55db1c37207191266c1cf148f76f7c9ea664fc29a304711b56aee7d4b940b5","observation_id":"d4f852a2-815a-4477-b816-6ebe8d60bf88","resolution":{"observed_at":"2026-08-06T19:11:23.660802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.650256Z","title":"Tallformer: Temporal action localization with a long-memory transformer","venue":null,"work_id":"f36c9088-362f-48f9-bd1c-43629c6ce891","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.026525Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:a9a212f3421debba111e511cd0b6d20e880c633e7f5168a55d460306ed47ea5b","observation_id":"aaa63d1a-3dde-4081-8385-85de56afb3a8","resolution":{"observed_at":"2026-08-06T19:11:23.652883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:22.154217Z","title":"Openmmlab's next generation video understanding toolbox and benchmark","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.154217Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:3c9984c546410245fff1ca7999acd8b9758715a8ed04ad627069f20a9b7fb190","observation_id":"a8bf9b64-ab4f-4b31-86f5-5fb2db2f5d0b","resolution":{"observed_at":"2026-08-06T19:11:22.154217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.637942Z","title":"Ms-tct: multi-scale temporal convtransformer for action detection","venue":null,"work_id":"8eaa0a83-d7f3-496b-894d-15f51492c1ec","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.275358Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:5edc7b50565e5b0267924eb96ccc5be047ae4757065a71870e37f1e2d6faafd1","observation_id":"e765b488-c8e5-4a74-8f5b-c6eea73b8db1","resolution":{"observed_at":"2026-08-06T19:11:23.640570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T19:11:22.366775Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.366775Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:4ac31ab449c8b01213b4c94782695cffae7f1294d7ba4bab1b452a622790243d","observation_id":"41181fe8-18c4-42e2-b456-b7f798de1df3","resolution":{"observed_at":"2026-08-06T19:11:22.366775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.631021Z","title":"Multiscale vision transformers","venue":null,"work_id":"b203fdd2-16e3-4622-9b5c-41428c42fdcb","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.574892Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:f1c11f96c31d4ffa3eda01a07b34b8160416d8cf987c7e545470e7954330cd61","observation_id":"d6414fb9-bf20-4370-b0eb-407a5bb10e51","resolution":{"observed_at":"2026-08-06T19:11:23.633355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.623877Z","title":"Holistic interaction transformer network for action detection","venue":null,"work_id":"93109b18-8db8-4b5d-9108-e9d0399bdbde","year":2023},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.710028Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:e19dd0d8837cffc3815013ddb30858d26fa7d5721b684c48329b56ebdcd58ac8","observation_id":"c0af44ff-4227-437a-ac75-cf3b2abb29de","resolution":{"observed_at":"2026-08-06T19:11:23.626452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.616321Z","title":"Turn tap: Temporal unit regression network for temporal action proposals","venue":null,"work_id":"92a908cb-835f-4651-b199-b4d25bc8f11a","year":2017},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.790682Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:dc7c516210465db353b508a9699b76ac0bc21dc48108bc8b3d29e535cf6c6b95","observation_id":"04de8b7a-b8ab-4551-ab38-20b72a4a01e6","resolution":{"observed_at":"2026-08-06T19:11:23.618786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07493","last_updated":"2022-08-16T01:48:23Z","snapshot_observed_at":"2026-07-06T13:42:08.504017Z","submitted_at":"2022-08-16T01:48:23Z","title":"Temporal Action Localization with Multi-temporal Scales","version":1},"cited_work":{"arxiv_id":"2208.07493","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.07493","snapshot_observed_at":"2026-08-06T19:11:23.243190Z","title":"Temporal Action Localization with Multi-temporal Scales","venue":"cs.CV","work_id":"cbc35859-d9d0-438e-8361-24f5529e7926","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.811371Z"},"links":{"cited_paper":"/paper/2208.07493","citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:9bce4b229eef810831045f89f2c4379dcbbd4e949de6077e59cdc248f61bc360","observation_id":"240de063-86ec-4962-a022-71f3f39a3f55","resolution":{"observed_at":"2026-08-06T19:11:23.246231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.609478Z","title":"in the wild","venue":null,"work_id":"5c82a57a-143c-484c-8af9-84e2ebc4ca74","year":2017},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.845000Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:f44d1436d24c518fec09678206fbec6ec605d8821c6cbaa0cdc7362e2aa68def","observation_id":"6711909a-2893-4e8e-b1cd-699a3ee982eb","resolution":{"observed_at":"2026-08-06T19:11:23.611809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.602220Z","title":"Action-aware masking network with group-based attention for temporal action localization","venue":null,"work_id":"41a0df8b-bf08-48fc-8f46-d02ed87b10f8","year":2023},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.885940Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:74fb5b7e627f78adc73e520be983083271ddfd987dfcfcec6c7e1c8bd950772f","observation_id":"4dd352be-2111-4088-a5b9-6d6783af75d8","resolution":{"observed_at":"2026-08-06T19:11:23.604772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.594575Z","title":"Neighbor-guided pseudo-label generation and refinement for single-frame supervised temporal action localization","venue":null,"work_id":"d912aaf2-7fae-4f04-be65-5a1278d9c2d4","year":2024},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.927948Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:93175438a56ddc3b9cb112450cf04c5ddccecb8f64e66fcec32d9c34a7423a7f","observation_id":"4c19e4c0-3d27-4554-a5e3-699b31c7fa22","resolution":{"observed_at":"2026-08-06T19:11:23.597128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.587498Z","title":"Detal: open-vocabulary temporal action localization with decoupled networks","venue":null,"work_id":"047a3619-defc-4280-925e-8c5227f6c8c4","year":2024},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.985536Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:205536df225ae53eeb323518ae17aec2cef9e80a5cac7a6dae9578730e1f20ac","observation_id":"6fb3f299-0c4e-49a4-b48c-595d13dd8ab0","resolution":{"observed_at":"2026-08-06T19:11:23.590044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.579514Z","title":"Learning salient boundary feature for anchor-free temporal action localization","venue":null,"work_id":"b16ad834-d84d-41d5-8b3e-dee49a4dc193","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.995657Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:924ff51aeb40f046fa2d547d597a190dd63bcdb5e3200b20d82fcb549a67519f","observation_id":"859dc22b-f09f-4787-8780-e2357b58487b","resolution":{"observed_at":"2026-08-06T19:11:23.582813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.571916Z","title":"Single shot temporal action detection","venue":null,"work_id":"785f6853-cb1c-4878-8e92-029c3fe021a4","year":2017},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.002110Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:59c3e6832b7d5df9fae7fb06810aba030cb944fbc3819e2a2e24ebc27e5b0f23","observation_id":"ca82a19b-7fbf-434a-9187-3f2e604a1885","resolution":{"observed_at":"2026-08-06T19:11:23.574750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.564399Z","title":"Bsn: Boundary sensitive network for temporal action proposal generation","venue":null,"work_id":"bc01bd00-31a5-448a-8738-526aac056aa0","year":2018},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.008857Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:1db3275d33b2cabc1a4132e81f04ea0ff7237a5ac0a516e9b156b33045327052","observation_id":"95afcfe7-074f-4ccf-b11c-4765061e1b51","resolution":{"observed_at":"2026-08-06T19:11:23.567051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.556877Z","title":"Bmn: Boundary-matching network for temporal action proposal generation","venue":null,"work_id":"ca0e70bf-8379-4acf-b0f3-aa11669e3183","year":2019},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.016258Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:1abfe4fe96983e87ce2aa486b173270bf6e98aab892d7feff6a993d67b1838db","observation_id":"de3e779b-8009-4128-b12e-32670a8100bf","resolution":{"observed_at":"2026-08-06T19:11:23.559452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17792","last_updated":"2024-07-26T01:16:07Z","snapshot_observed_at":"2026-08-10T10:53:04.554453Z","submitted_at":"2024-07-25T06:03:02Z","title":"Harnessing Temporal Causality for Advanced Temporal Action Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17792","snapshot_observed_at":"2026-08-06T19:11:23.021340Z","title":"Harnessing temporal causality for advanced temporal action detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.021340Z"},"links":{"cited_paper":"/paper/2407.17792","citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:f2d3195a3fb660b440ddd8444a563abe27a71664bc556e13aaa38c341bfc7ab1","observation_id":"e6973668-f611-4570-be4e-a22b16f01c0a","resolution":{"observed_at":"2026-08-06T19:11:23.021340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.548793Z","title":"End-to-end temporal action detection with 1b parameters across 1000 frames","venue":null,"work_id":"dd7815aa-f311-44cf-b9ef-b2ed02d4a340","year":2024},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.027800Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:44c008ee8c4d8746bfe4cea9b778655151cb2f7fa61dd399f7b4461239308b6f","observation_id":"0c8b3da9-f5bb-4c1b-8fca-af46187bce2e","resolution":{"observed_at":"2026-08-06T19:11:23.551339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.541393Z","title":"End-to-end temporal action detection with transformer","venue":null,"work_id":"796f3541-9826-4e0f-84cb-ec2ae00fe9a6","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.031999Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:79d55ba75b32e5de7021fdf724819199b14370207da67519440d732d6e3c25c9","observation_id":"7a8f4e84-fc8e-45bc-b238-3e666bbf8ae2","resolution":{"observed_at":"2026-08-06T19:11:23.543891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.534338Z","title":"Video swin transformer","venue":null,"work_id":"29bd75dd-3f79-4b90-a3eb-b3b1dff9e33b","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.034463Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:3963b54e77c2a9786e95c81557cbb764e76c5f8a387d432d1fd8a292327b18cb","observation_id":"3284d5ba-1d59-45d3-9d8a-132cc6c0109a","resolution":{"observed_at":"2026-08-06T19:11:23.536661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.527076Z","title":"Gaussian temporal awareness networks for action localization","venue":null,"work_id":"b1f5bf6f-ab66-4638-abde-3c008c6c3286","year":2019},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.039044Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:2ec91bfde3004776bc1fd9808cf7c2ebb79877eb7d59fae2ac0646dcc37853b8","observation_id":"5c719a37-5f5f-42e4-8ce3-9025928bdd05","resolution":{"observed_at":"2026-08-06T19:11:23.529622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.519502Z","title":"Enhancing temporal action localization in an end-to-end network through estimation error incorporation","venue":null,"work_id":"3ea0e310-409e-40b8-92e0-e1123610d0e1","year":2024},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.046980Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:b7804ae4da8e691c49826fc21a35411376a8e01fec987053a046a2b2ab9474c5","observation_id":"0d463549-f33c-4d39-96bc-ae19eda9a1a0","resolution":{"observed_at":"2026-08-06T19:11:23.522149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.511372Z","title":"Srfnet: selective receptive field network for human pose estimation","venue":null,"work_id":"35f7b629-f953-474f-a1fa-075bdb25936a","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.049789Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:7809a8335a3de28f3f35a23ff058eefac8033650d7cfd828149f17a3cda9826e","observation_id":"bbef79e8-014e-4218-80f5-5a7984048065","resolution":{"observed_at":"2026-08-06T19:11:23.514061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.503724Z","title":"Temporal context aggregation network for temporal action proposal refinement","venue":null,"work_id":"75ef2cfe-7b17-44c4-82c3-a7b258dfa9b3","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.053564Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:63cd1b7222f32d5fc5882c86676ac61dfb2be0156e3e5cfa155d6c2753e68117","observation_id":"efcbffab-40ec-49ce-a1ae-d3970240d499","resolution":{"observed_at":"2026-08-06T19:11:23.506362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.496457Z","title":"Action sensitivity learning for temporal action localization","venue":null,"work_id":"fed6fe25-1865-44f2-8a2a-9f92152ba2e5","year":2023},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.056671Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:7f58006823c19d5cc3e217b083af9edba6196db5a7ec84d37e277f8a3e682ef0","observation_id":"22bce5a9-0c6e-4c58-9dd8-580b5927aefe","resolution":{"observed_at":"2026-08-06T19:11:23.498985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.488747Z","title":"Tridet: Temporal action detection with relative boundary modeling","venue":null,"work_id":"857f71ec-6885-4319-ba70-a4bd5ffb1a50","year":2023},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.059972Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:d07112a9789a37ba56fb2b5c79e05d51cf32bf7ddd744b35dc52632e23da3769","observation_id":"5c0dfac6-2d64-4d58-934c-3357115886fb","resolution":{"observed_at":"2026-08-06T19:11:23.491370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.480579Z","title":"Temporal action localization in untrimmed videos via multi-stage cnns","venue":null,"work_id":"1d0dcdf9-1df2-450d-82aa-0ad990b502eb","year":2016},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.062643Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:7e19a77ebbdd794251e7bb238efda6bf84312f56c7c0358abaf5fb666e99b00c","observation_id":"78417488-ee44-4a23-81ee-d9b17cab55b5","resolution":{"observed_at":"2026-08-06T19:11:23.483508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.472204Z","title":"Cdc: Convolutional-de-convolutional networks for precise temporal action localization in untrimmed videos","venue":null,"work_id":"3bb0fd72-f915-4e3d-abc6-9b960350dc15","year":2017},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.065493Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:9d1a17b1c305ae255f0830d61da14ba07d5097e865c2c823e1897447e5e6e89a","observation_id":"e9e7f9d9-ff23-44d9-a000-b20761680ec0","resolution":{"observed_at":"2026-08-06T19:11:23.474864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.463962Z","title":"Bsn++: Complementary boundary regressor with scale-balanced relation modeling for temporal action proposal generation","venue":null,"work_id":"57fc40f1-8bea-4ab2-ab59-11b1774d255f","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.069889Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:ee366d232a499b8e9f1e7e0b85fc60280a18008bbaee24d644148cd8bc72fc91","observation_id":"2b82db44-5300-4a38-8c26-e0b5024e6417","resolution":{"observed_at":"2026-08-06T19:11:23.466724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.456293Z","title":"Pcg-tal: Progressive cross-granularity cooperation for temporal action localization","venue":null,"work_id":"76478406-5504-401f-96b0-866b8c4b9a8c","year":2020},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.076577Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:429ff64c2032a30ea4a6f5f631bd6fdac17c00566515050f380e8841b899210f","observation_id":"d016328b-9815-42a7-8e47-6f86ce01b886","resolution":{"observed_at":"2026-08-06T19:11:23.458945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.448676Z","title":"Relaxed transformer decoders for direct action proposal generation","venue":null,"work_id":"e3c8ad73-600f-4490-9179-fea0de9851d7","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.079312Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:b2d23d4b7e0a201f26f8754a46410513d775c044b9ba0e89c0553869d98971c4","observation_id":"7f8b5e62-c450-4f27-99da-de03b14fe008","resolution":{"observed_at":"2026-08-06T19:11:23.451250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.440905Z","title":"Learnable feature augmentation framework for temporal action localization","venue":null,"work_id":"8f95d90c-e542-478d-af84-8916ef72e6b2","year":2024},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.082217Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:57fb7b596a86abf828a539b7657394aef318c9b3f8be97776156301900ddbe89","observation_id":"7bdc6940-f170-476e-bb43-3beb2f367d2c","resolution":{"observed_at":"2026-08-06T19:11:23.443523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.084608Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.084608Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:5736d194a9f8af63585b234a196c6140549069e12a20f63f806b4b3257605236","observation_id":"858549a1-5c71-4a3d-9a5b-9b4345373b48","resolution":{"observed_at":"2026-08-06T19:11:23.084608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.427983Z","title":"A closer look at spatiotemporal convolutions for action recognition","venue":null,"work_id":"0c3ea613-1da7-4110-925f-884b7c40e674","year":2018},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.087383Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:a461dfc670a1b6ada3c4f7445ee6fa23dfcae1869b4611a573ca607bf063b693","observation_id":"9acc4167-d534-4981-91de-1a539a0ca6c8","resolution":{"observed_at":"2026-08-06T19:11:23.430511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.089697Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.089697Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:9905e9ca90a1edb9d690a21937b69b42937039551d19df36dccdeb1672ef678c","observation_id":"16d6cb2b-4559-4e9e-9014-407f9cf09e9c","resolution":{"observed_at":"2026-08-06T19:11:23.089697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.415409Z","title":"Exploring sub-action granularity for weakly supervised temporal action localization","venue":null,"work_id":"4238135a-1714-44a9-ad81-fdba8bd13779","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.092878Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:8c41ecfa0019a781f7072d8fa1bca4b2e8617f63a3013416e5874ce11c297b3a","observation_id":"50ff45a8-d77b-4c7e-9734-6a861669c79f","resolution":{"observed_at":"2026-08-06T19:11:23.418380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.408147Z","title":"Temporal segment networks: Towards good practices for deep action recognition","venue":null,"work_id":"cbaef1b4-af12-4d71-bbe6-a2a986824147","year":2016},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.095593Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:54d86610f57c2afc7de29022e9166a8fd5319e9639123f07cf5f9465cf95c241","observation_id":"027be6b3-5c5c-43c8-95c5-69f70c04405b","resolution":{"observed_at":"2026-08-06T19:11:23.410584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.12043","last_updated":"2021-05-25T16:22:12Z","snapshot_observed_at":"2026-07-06T11:12:38.080301Z","submitted_at":"2021-05-25T16:22:12Z","title":"Temporal Action Proposal Generation with Transformers","version":1},"cited_work":{"arxiv_id":"2105.12043","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.12043","snapshot_observed_at":"2026-08-06T19:11:23.223111Z","title":"Temporal Action Proposal Generation with Transformers","venue":"cs.CV","work_id":"f389d30c-9ee6-4fee-88a2-7a1e6e7e9eba","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.098006Z"},"links":{"cited_paper":"/paper/2105.12043","citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:5af2ed90388c0ab1c09c222b859fdf9debfe3c2fcdc2ff10548903f65bc36377","observation_id":"cfa96287-2dcb-43c1-9667-79baaefe5edc","resolution":{"observed_at":"2026-08-06T19:11:23.225903Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.399936Z","title":"Rcl: Recurrent continuous localization for temporal action detection","venue":null,"work_id":"b2fbcb43-b42f-4ebb-8d99-d21269316c43","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.101415Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:0d22efc4ffff22efa7b0ec8d52f6541fcc03cd31e7550a9879d73d021ab39762","observation_id":"3806fb40-c5fd-4884-b8af-6ef89d5d4514","resolution":{"observed_at":"2026-08-06T19:11:23.402853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.392226Z","title":"Ensemble prototype network for weakly supervised temporal action localization","venue":null,"work_id":"1b33bdce-f2a4-4345-ad5e-8d5243c01934","year":2024},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.103962Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:5e85b617f38bccd96c782a41d471a56fb402ed56cc984e12541c1f500af9b1d2","observation_id":"1bea4208-f818-4f0c-a66c-f510fc042df8","resolution":{"observed_at":"2026-08-06T19:11:23.395056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.02716","last_updated":"2017-03-08T05:52:52Z","snapshot_observed_at":"2026-08-04T04:43:42.241842Z","submitted_at":"2017-03-08T05:52:52Z","title":"A Pursuit of Temporal Accuracy in General Activity Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.02716","snapshot_observed_at":"2026-08-06T19:11:23.106652Z","title":"A pursuit of temporal accuracy in general activity detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.106652Z"},"links":{"cited_paper":"/paper/1703.02716","citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:47ffda692e14878976f71f131d455b964d35beeec217bb5dd8076ac4db5cd600","observation_id":"d4e5b11e-cf3b-40fa-8ff8-b8ffd0863552","resolution":{"observed_at":"2026-08-06T19:11:23.106652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.384982Z","title":"R-c3d: Region convolutional 3d network for temporal activity detection","venue":null,"work_id":"665fab3c-05a8-4ac7-a4c9-886583fce8c5","year":2017},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.111408Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:ae503ef68b1318fab821b66c2f649f8cacb7fa7927fe03393d78c200ad47b70d","observation_id":"14a0ab13-3763-454b-9cbe-24ff7a5acbd9","resolution":{"observed_at":"2026-08-06T19:11:23.387447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.377151Z","title":"G-tad: Sub-graph localization for temporal action detection","venue":null,"work_id":"6563f955-361b-4f83-8f54-128b9ccc77f6","year":2020},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.114526Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:5e179c419ffd14c63a301343b7174d0dc045c0ef110561410040743f13fdcf2d","observation_id":"a266ec98-4d92-4972-90a1-d411ced56ead","resolution":{"observed_at":"2026-08-06T19:11:23.379845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.369930Z","title":"Revisiting anchor mechanisms for temporal action localization","venue":null,"work_id":"ad82b2a1-0d2c-4e36-b1fa-da71d44cd475","year":2020},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.117244Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:44401acb6574f45e21e9c012add155ae0469ade2e94fb32edd43ecc46a4a91d3","observation_id":"5363e2b6-dce5-4db8-98f1-1a2e0c3b66bf","resolution":{"observed_at":"2026-08-06T19:11:23.372488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01897","last_updated":"2024-04-15T07:15:43Z","snapshot_observed_at":"2026-08-10T14:42:06.214483Z","submitted_at":"2023-12-04T13:51:16Z","title":"Adapting Short-Term Transformers for Action Detection in Untrimmed Videos","version":2},"cited_work":{"arxiv_id":"2312.01897","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.01897","snapshot_observed_at":"2026-08-06T19:11:23.203715Z","title":"Adapting Short-Term Transformers for Action Detection in Untrimmed Videos","venue":"cs.CV","work_id":"e62a687a-d736-40bf-a322-492af26bcd81","year":2023},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.119629Z"},"links":{"cited_paper":"/paper/2312.01897","citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:20a9194f097d4e73ebbef939a589f0f262b7d3e23f1b591a9e52dccfc9f49369","observation_id":"7a454aa4-3a9d-4527-bacb-79dd626db746","resolution":{"observed_at":"2026-08-06T19:11:23.206926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.362310Z","title":"Weakly-supervised temporal action localization by inferring salient snippet-feature","venue":null,"work_id":"c5230cb8-17ea-4525-b773-56ff729be95d","year":2024},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.123013Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:cb9d797bc4bab496e28974e14c9b3a5d097973fe1345cf8b32ec32dd503e1cc3","observation_id":"9adfb4af-1fc8-4048-b214-646f7359f40d","resolution":{"observed_at":"2026-08-06T19:11:23.365071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.354565Z","title":"Graph convolutional networks for temporal action localization","venue":null,"work_id":"ef40c73d-d5ad-4357-be06-efe7f7b2ceec","year":2019},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.126263Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:7901792eb980bf4e4d21f4edc2891035ca6ef946338ac0779555554f492907d1","observation_id":"30aaaa02-290a-4c04-a542-4bc60a826111","resolution":{"observed_at":"2026-08-06T19:11:23.357105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.346955Z","title":"Actionformer: Localizing moments of actions with transformers","venue":null,"work_id":"76d735e6-38b7-42dd-b3c5-0bdea1835424","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.128663Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:ae9331677cb4a7e20f149b8aabc9bb1025e9054983e11a82aa4fab6349b87528","observation_id":"ccabff4a-7999-4737-a2d0-c1ff4ebdb7a9","resolution":{"observed_at":"2026-08-06T19:11:23.349484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.339044Z","title":"Towards efficient use of multi-scale features in transformer-based object detectors","venue":null,"work_id":"a5a51c16-7ab5-41b7-96ce-f5c2a6bd872b","year":2023},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.131608Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:9cc5b44e7ac7103ac7648475609da173f0610e29b4bf09802e702fd714a73a5e","observation_id":"99b19b59-cbea-4e72-8454-9a038769bd6c","resolution":{"observed_at":"2026-08-06T19:11:23.341654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.03612","last_updated":"2019-12-08T04:16:28Z","snapshot_observed_at":"2026-08-04T20:48:36.044736Z","submitted_at":"2019-12-08T04:16:28Z","title":"Learning Sparse 2D Temporal Adjacent Networks for Temporal Action Localization","version":1},"cited_work":{"arxiv_id":"1912.03612","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.03612","snapshot_observed_at":"2026-08-06T19:11:23.189985Z","title":"Learning Sparse 2D Temporal Adjacent Networks for Temporal Action Localization","venue":"cs.CV","work_id":"7b00aaca-45db-4193-a106-966cb2da9f41","year":2019},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.134539Z"},"links":{"cited_paper":"/paper/1912.03612","citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:cbd8fdda761bb2d6940d4a0bece41ec50e7802989f9be28116c9029251856236","observation_id":"d5ceeb7a-0860-47e1-9a4d-4d2f0834d476","resolution":{"observed_at":"2026-08-06T19:11:23.194866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.331369Z","title":"Video self-stitching graph network for temporal action localization","venue":null,"work_id":"0d211fc5-25de-4349-b7bd-dea7d2166c1d","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.137556Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:5f5e702f7e9d1887862a191a35b44d429ff7918439b76e9ea548cfbde037ddb4","observation_id":"76637a1c-2178-43d0-b678-7ff9f19b03df","resolution":{"observed_at":"2026-08-06T19:11:23.334089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.323201Z","title":"Re2tal: Rewiring pretrained video backbones for reversible temporal action localization","venue":null,"work_id":"b940afd5-c9f5-467c-b494-db6d2f5b9238","year":2023},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.140925Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:11b59dda71de9fe17515404bf42e0706a138a3862d1f88c6a17420e358c0a727","observation_id":"b71aaf3b-cb14-4eb0-a3c5-d33492c011b2","resolution":{"observed_at":"2026-08-06T19:11:23.326010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.314109Z","title":"Hacs: Human action clips and segments dataset for recognition and temporal localization","venue":null,"work_id":"82810e76-4097-4de1-86bf-ae76f799ca2a","year":2019},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.144070Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:21e45ce83630357bab9bbb161bf284e6fda3aeeec42263aa242497fb472b8c90","observation_id":"b5f89cef-246a-45fe-85fb-1314210c6e63","resolution":{"observed_at":"2026-08-06T19:11:23.316905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.305256Z","title":"Tuber: Tubelet transformer for video action detection","venue":null,"work_id":"a60c0480-6fb1-465e-a424-07368d7ea682","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.147046Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:1796f9c4622534617cfa3f17858c6cceb5689ab39644fa472967a37ac00db48b","observation_id":"5d3cc7f5-e12c-4d98-9e31-30b8e2f498f8","resolution":{"observed_at":"2026-08-06T19:11:23.307891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.296698Z","title":"Bottom-up temporal action localization with mutual regularization","venue":null,"work_id":"d956f1ab-0596-4a39-86fd-ee7f7bcd3077","year":2020},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.149702Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:012d60391220a4f643b579d3aa9d85e05538fc98aa34da21339e51377eed22f5","observation_id":"d498284c-9bc4-42ef-b8e2-11d565bbbf2c","resolution":{"observed_at":"2026-08-06T19:11:23.299813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.287553Z","title":"Temporal action detection with structured segment networks","venue":null,"work_id":"c436dfa2-b692-4873-880d-1d9888c6b5f5","year":2017},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.152873Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:a48550d7211459be465eb5b624bc8dca83012baaf8fa1df07dff1d29ff8eded1","observation_id":"8ae7598e-f88e-453f-810a-8bd5706f0d77","resolution":{"observed_at":"2026-08-06T19:11:23.290518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.279374Z","title":"Enriching local and global contexts for temporal action localization","venue":null,"work_id":"428cb79a-4524-434f-884d-857adc527531","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.155707Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:54857bfeeeb465482e8f9dd830c56ec5d5631e837a0e97de4766571deb22c6f2","observation_id":"2a3147cc-1ef8-4eae-bc18-228112313a21","resolution":{"observed_at":"2026-08-06T19:11:23.282056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.158293Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.158293Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:a18bf6ae1e72c267ed0d1d5c681049a03f1e895daefdcd70c1d6bc326cdaf0b1","observation_id":"414911b9-f501-48a4-aec9-83ce202b5cb1","resolution":{"observed_at":"2026-08-06T19:11:23.158293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.161431Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.161431Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:9b63e742dd5971b43ffe5cbafedb0a85bcf0f38b8615501fb9ab86972d1949d0","observation_id":"b3701c90-62ec-4afa-8f36-21f7e85dcb25","resolution":{"observed_at":"2026-08-06T19:11:23.161431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.164460Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.164460Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:b0fd30f1048657276bd24b37f4039496092c902ec5c57df27bc211ce666c2695","observation_id":"688d7bf8-5255-4615-8228-bac1635c51c1","resolution":{"observed_at":"2026-08-06T19:11:23.164460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.167054Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.167054Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:525c9012af72f225a09f0555a3a608b5f4854cdb0ba0543cbdddacd38e7e3b4d","observation_id":"b4dc0094-f7f7-4bb3-bcdc-b1d3866aead0","resolution":{"observed_at":"2026-08-06T19:11:23.167054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":4,"verified_fuzzy":54},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2507.06411."}