{"as_of":"2026-08-19T21:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0a3061a9240735958c255edf24657f91f5b20b032dc5882edccc929b6d6df110","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:55:40.639778Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.13708/citation-record","integrity":"/paper/2412.13708/integrity","json":"/paper/2412.13708/citation-record.json","paper":"/paper/2412.13708"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.428503Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.428503Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:241b4f6825ef95524ad25444f820c7e98e76b0f7656618712dbb02c0be56a6fc","observation_id":"a55fa959-480a-4e4d-8505-88252dfbde7d","resolution":{"observed_at":"2026-08-11T12:55:40.428503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.433370Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.433370Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:d7c76483a1519ba3a3cb91eee8610100f1f1c6e87b8550e5e9f3824281eeafd7","observation_id":"24f2cfe8-ad86-48b6-949d-6efa8ba4e8a1","resolution":{"observed_at":"2026-08-11T12:55:40.433370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.438612Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.438612Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:192a99681ed2070c87ce066e57261231b5de483adb1804922e65332b1d06cb2b","observation_id":"c1b73cb2-b166-4487-bc7f-3f17c10765cd","resolution":{"observed_at":"2026-08-11T12:55:40.438612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.442800Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.442800Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:ac67163befa894f2e57a7831ea83aefc9cad32adc9bafea0f6932e2779e57a52","observation_id":"75a1cf3c-b12b-4a93-bdb1-e80dbc623dfa","resolution":{"observed_at":"2026-08-11T12:55:40.442800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-08-14T16:05:50.720818Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-11T12:55:40.446779Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.446779Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:698c9e183d18ce46956ebfbfa8672ad3e10307046b45383bde132d7aedaebf1c","observation_id":"2475eacc-e50e-420f-9479-7bdd271a6214","resolution":{"observed_at":"2026-08-11T12:55:40.446779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.447659Z","title":null,"venue":null,"work_id":"99c0b9d4-244e-4050-ac99-60215d017b79","year":2021},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.451247Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:109755f4b72a68bbb50aba7ec490ca349070cb011cdb3e9677b3d8be72689c3b","observation_id":"ac60db86-b09a-46d5-a22f-6d4b7a99f7f1","resolution":{"observed_at":"2026-08-11T12:55:41.454325Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.427946Z","title":null,"venue":null,"work_id":"4df60a66-c32b-4a92-8b47-fe19c57847c3","year":2023},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.455258Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:e56d04cf7e5e0fbb7173033fdfa414ee5c4f76a8c1c155ba240e4fccdb770a9a","observation_id":"3a805d6b-195b-4e1a-9fca-4443e143c61b","resolution":{"observed_at":"2026-08-11T12:55:41.434419Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.410435Z","title":null,"venue":null,"work_id":"048eca1b-2d8a-41f8-b4ba-16629aa0f83d","year":2021},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.459611Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:13b0c034902d9f1280cc3f32c8b2f229ac7e6f573cfc2e2d8855ad1c4a1d2774","observation_id":"64f6b389-54c3-45a6-bce6-fbbbd244a872","resolution":{"observed_at":"2026-08-11T12:55:41.415302Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.392609Z","title":null,"venue":null,"work_id":"a7501b7a-9336-439d-a240-08cf25e164a3","year":2019},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.463881Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:91b21dfe46dcf5d2b51778c3211a1cfb8ffe906016cc2f47e7c110db398c3d4e","observation_id":"7944b528-d905-44e9-9697-f183ce768dcc","resolution":{"observed_at":"2026-08-11T12:55:41.399617Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T12:55:40.467477Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.467477Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:6e57baa5a2627c4f48785ee781451e2fc84e8cec4a296415700849de9673e6a2","observation_id":"5c17b6b8-1f88-409f-8de0-029a5fb0f594","resolution":{"observed_at":"2026-08-11T12:55:40.467477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.378782Z","title":"J.; Chen, M.-H.; and Lai, S.-H","venue":null,"work_id":"7f120ab3-cd2e-4ef6-9068-3ee1f4229ef5","year":2023},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.471327Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:1011e680e5fd2bf4dc65308efab58d7039a5436522b96063f0b4fdc2954338ea","observation_id":"977346c9-edac-4f7a-8cad-fadbb732a77e","resolution":{"observed_at":"2026-08-11T12:55:41.383051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.475016Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.475016Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:e40a5fdd6ca05bed99cfd70554fa7470b95a3a011410e572aaa357bef5a032c9","observation_id":"ea33e2c0-dbad-440e-a249-e521c1fb30dc","resolution":{"observed_at":"2026-08-11T12:55:40.475016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.350476Z","title":null,"venue":null,"work_id":"264defec-0eb8-4ecc-836b-560f183013ec","year":2020},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.478714Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:512917ccf4bd9211e11ba22d2c5edf7d6c96654ba4155593ca0cb0f8bab3772f","observation_id":"24b63ce3-f5a7-4951-b89d-39210e98627e","resolution":{"observed_at":"2026-08-11T12:55:41.358092Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.333915Z","title":"T.; Lucic, M.; Schmid, C.; and Arnab, A","venue":null,"work_id":"4804a417-a38a-4ddc-a6fe-070a41c87e14","year":2023},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.482436Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:c2c080eb5865caf3a70f8b0331fb5767bb3ec1ae4ad539d6eb028860354f1d30","observation_id":"d503d68a-8b5d-40a9-aa5d-a59bb8841a1a","resolution":{"observed_at":"2026-08-11T12:55:41.339494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.314126Z","title":null,"venue":null,"work_id":"178376f8-8ffd-46cd-b3b6-0287d28ac8c9","year":2019},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.486265Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:74153c5fa5a44a288373108f43e1de50f1db2ab80e25c37a2e6c308d3d0b76a7","observation_id":"c02d590a-3ba9-4349-ab70-5f6a354f4b4e","resolution":{"observed_at":"2026-08-11T12:55:41.319899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.293209Z","title":null,"venue":null,"work_id":"45b4d09c-5e85-4f34-8e80-2fce75bc2158","year":2015},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.489968Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:d370ef3a469bd8360d8f64217cccab365d65e809a1c1370cbe067a9a65c23672","observation_id":"bdda318a-d27f-4813-ae81-0483b2b6c185","resolution":{"observed_at":"2026-08-11T12:55:41.298649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-17T23:50:11.173365Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-11T12:55:40.493993Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.493993Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:5255866d448f3e6e1c05b6f471c6c90c73c3d83b12aabf45050bbea5f7598e8c","observation_id":"60d2415f-45f7-4951-8eb2-4215c87f07df","resolution":{"observed_at":"2026-08-11T12:55:40.493993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07839","last_updated":"2023-04-11T22:47:19Z","snapshot_observed_at":"2026-08-18T11:14:43.411768Z","submitted_at":"2022-10-02T07:29:57Z","title":"Contrastive Audio-Visual Masked Autoencoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07839","snapshot_observed_at":"2026-08-11T12:55:40.498345Z","title":"H.; Harwath, D.; Karlinsky, L.; Kuehne, H.; and Glass, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.498345Z"},"links":{"cited_paper":"/paper/2210.07839","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:903e2aa2017146cc6d0e1575afd591adb187cd77303d6947ed16d471a7c6f756","observation_id":"a89a43ff-8a4f-459a-8418-c6a3b65d07b2","resolution":{"observed_at":"2026-08-11T12:55:40.498345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.275301Z","title":"A.; Vondrick, C.; Pantofaru, C.; Li, Y.; Vijayanarasimhan, S.; Toderici, G.; Ricco, S.; Sukthankar, R.; et al","venue":null,"work_id":"17a0f1de-2ac3-4d13-a403-3531227996b7","year":2018},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.502880Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:b30f0ea2fe95a6c5b85f25683ae3cf31a8067345c96d3d3bf214191680ef9ca7","observation_id":"305759ce-104a-4164-a25c-fa523f5d9cae","resolution":{"observed_at":"2026-08-11T12:55:41.281077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.507997Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.507997Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:919af6e18daaafa315eca57f8c2ac9d3ce0ddb96e62160d00ebceffbc1d81a49","observation_id":"dff77b8d-d5a3-4b7d-856e-17b843b699bb","resolution":{"observed_at":"2026-08-11T12:55:40.507997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.251016Z","title":null,"venue":null,"work_id":"f704b177-39c1-48e5-aea4-7ba69d5d1564","year":2024},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.511930Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:905a702d70df9f6eb50cee64a36afdde821791a2c3fc469a275071562a9194d8","observation_id":"3147dfb7-787e-48d2-9f3e-82e9426593ee","resolution":{"observed_at":"2026-08-11T12:55:41.256140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.233149Z","title":null,"venue":null,"work_id":"ea3e1296-2bd5-497f-aa5d-b70f8024e174","year":2013},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.515670Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:2116da92141c306fa5a2b440bd68c435e701e4217a67768445301d5e5ad5f1e0","observation_id":"356d6ac5-ac91-494c-9601-9b9a04be8174","resolution":{"observed_at":"2026-08-11T12:55:41.238666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-15T11:35:18.832923Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-11T12:55:40.519804Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.519804Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:174c8cb827f125cf4e0efe685d2adc9ea9bf41bdf5a9558a60b3df439adb9571","observation_id":"dffa1ae0-5344-414f-aa9e-422b17c87bfa","resolution":{"observed_at":"2026-08-11T12:55:40.519804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.218747Z","title":null,"venue":null,"work_id":"9637f03a-4331-4c16-aabf-f5dccc025fb3","year":2019},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.523971Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:bc5ef0697f9468b971dd87be1d52ffcf83921734d272a940faa099fa7c68144a","observation_id":"087b909d-170b-46a6-91c9-d0a82962d309","resolution":{"observed_at":"2026-08-11T12:55:41.222855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.203511Z","title":null,"venue":null,"work_id":"d4f73c41-017b-41f2-95a2-9aa4bcb358df","year":2018},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.528176Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:fa3cd54132583b4bc13e42336d46d3ce1fccdc6003dca835cc6dd0b84b55f925","observation_id":"7cde3c3b-1888-47fa-87b2-3b18e41938a7","resolution":{"observed_at":"2026-08-11T12:55:41.208481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.06644","last_updated":"2021-10-18T12:53:47Z","snapshot_observed_at":"2026-08-16T18:26:44.584458Z","submitted_at":"2019-11-15T14:09:47Z","title":"You Only Watch Once: A Unified CNN Architecture for Real-Time Spatiotemporal Action Localization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.06644","snapshot_observed_at":"2026-08-11T12:55:40.531944Z","title":"o p \\\"u kl \\","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.531944Z"},"links":{"cited_paper":"/paper/1911.06644","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:79242a789c9c6e68aed4d8a5f248d94242b10d653aa6274d005af848aea0e92b","observation_id":"b1617dc8-b33e-4195-878b-a8bd6d4a1038","resolution":{"observed_at":"2026-08-11T12:55:40.531944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.535979Z","title":"A.; et al","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.535979Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:bbcb9d909791eda8ede99310d5f2360b2139fa0e5c3d822f68af7b67e4e98148","observation_id":"a54e25f5-827e-43a9-983b-0500ae422b4f","resolution":{"observed_at":"2026-08-11T12:55:40.535979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.171909Z","title":"H.; Son, T.; Seo, S","venue":null,"work_id":"4f6bd648-7a3d-4b89-b7f3-081f2bcc07b6","year":2024},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.539546Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:7296519944b07d6f5f92e7e901b64f4e5df638ca8c259b0b2ec8d2e7a9a26f8b","observation_id":"814f85c3-7ccc-4ab6-ab62-965f3165c038","resolution":{"observed_at":"2026-08-11T12:55:41.176602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.543150Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.543150Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:b7a3c11e8c94ff1e5a03a4ddd7f614c7354b14287db2f18edb8fe3c4cfe66698","observation_id":"19d65c45-80e5-408d-9083-836790fb8898","resolution":{"observed_at":"2026-08-11T12:55:40.543150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.146811Z","title":null,"venue":null,"work_id":"ae4a9197-fe70-4f0b-8fd5-e581f9c44819","year":2022},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.546696Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:27afc4987503394b507585a3ee8d0a88ae8bb8bbda33ed8f73894f4d4095520c","observation_id":"13c92f4a-d438-4a27-aa27-5ec250402eb6","resolution":{"observed_at":"2026-08-11T12:55:41.152030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.126094Z","title":null,"venue":null,"work_id":"8c85a11e-1505-4ad5-8c84-fb73f156310c","year":2017},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.550328Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:fb3a35342bc9d5947716efab3e157a4e1629349d7eb8660e7e4469dc6eac61ce","observation_id":"a04b8739-23d1-41bd-b03f-3081636385b6","resolution":{"observed_at":"2026-08-11T12:55:41.131433Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.554245Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.554245Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:9ef753eaa0a5a873898c93b45824ca0ca74b9fca8ebdc491bd7fff1055c09409","observation_id":"363c498b-5c6f-44f9-bd90-612a033b90c3","resolution":{"observed_at":"2026-08-11T12:55:40.554245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.558155Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.558155Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:756d2272ba20d6a26d72ba709aeff36696cfcc8d609967f2b776bdde41ce48b1","observation_id":"45e5a747-c4e6-46da-918b-54d145e61f44","resolution":{"observed_at":"2026-08-11T12:55:40.558155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.091055Z","title":null,"venue":null,"work_id":"370c53f4-7c49-4efe-bf27-bae233761631","year":2022},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.562111Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:6e32f6ba69aaf03c9e718d4ffb89d030434d6bf9a7f58541d949f8d5908d4b86","observation_id":"41a91923-510d-4889-98d5-7ef499bf0466","resolution":{"observed_at":"2026-08-11T12:55:41.096668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.565970Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.565970Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:4437eaedf4c1386cf519f2133f2064c355c5ddd4e48de19f5c85a2bc99860e73","observation_id":"15d505bb-ccd8-42cd-b073-21c906efc6f8","resolution":{"observed_at":"2026-08-11T12:55:40.565970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.067528Z","title":"Z.; Liu, Y.; Shao, J.; and Li, H","venue":null,"work_id":"9d60e7cb-3d08-42f4-a30e-492973193a7e","year":2021},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.569806Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:51e93af242e88472860b95ccab430451ca5516242c439cce0b911f2a1baf7ca9","observation_id":"3b65daa9-2bff-4aa0-8c22-b2a2651573ab","resolution":{"observed_at":"2026-08-11T12:55:41.072911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08779","last_updated":"2019-12-03T18:19:07Z","snapshot_observed_at":"2026-08-15T18:44:59.455586Z","submitted_at":"2019-04-18T17:53:38Z","title":"SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08779","snapshot_observed_at":"2026-08-11T12:55:40.573731Z","title":"S.; Chan, W.; Zhang, Y.; Chiu, C.-C.; Zoph, B.; Cubuk, E","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.573731Z"},"links":{"cited_paper":"/paper/1904.08779","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:50b00744205738bae4c88906966c95d84d2f9044e20c13c6d35a273a02fb4b9a","observation_id":"2413dcaa-af59-4b29-83df-05f6b82ac1e6","resolution":{"observed_at":"2026-08-11T12:55:40.573731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.053547Z","title":null,"venue":null,"work_id":"e0068fbd-d986-41e6-b9a7-40d8af95cb3c","year":2015},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.577480Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:137db7cbf7e078a5a659310e37c3c7149d187dd2df91de400a14c4d0673ce6ca","observation_id":"7f93223e-3e96-4a6d-a783-2fb0b38d3043","resolution":{"observed_at":"2026-08-11T12:55:41.058900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.581176Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.581176Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:1610d6ad684ec6b6dfc663b41f1eff1230be2e8744b5e60b6dc042ecb36ba613","observation_id":"47c79d50-4652-4ce6-abac-6bc9169e90c5","resolution":{"observed_at":"2026-08-11T12:55:40.581176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.01529","last_updated":"2016-08-04T13:38:38Z","snapshot_observed_at":"2026-08-14T21:45:26.637561Z","submitted_at":"2016-08-04T13:38:38Z","title":"Deep Learning for Detecting Multiple Space-Time Action Tubes in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.01529","snapshot_observed_at":"2026-08-11T12:55:40.585130Z","title":"H.; and Cuzzolin, F","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.585130Z"},"links":{"cited_paper":"/paper/1608.01529","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:185593cf1929d4c3b5ff9dbde28c083c78429a4ad1bd2db8d1ede04c383df533","observation_id":"4e949dc3-f017-414c-bc10-7179bf1f63f9","resolution":{"observed_at":"2026-08-11T12:55:40.585130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-11T12:55:40.589224Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.589224Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:3f104fba09f08ce631246156146a74fe9bae3b929eea57bf9310ad382693c7d0","observation_id":"cfe454bf-ca58-4c93-abb6-8c74605dfb83","resolution":{"observed_at":"2026-08-11T12:55:40.589224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.031973Z","title":null,"venue":null,"work_id":"c20b63b5-0517-4240-850b-3e503b1172bc","year":2022},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.593204Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:f74660c8ab2c1880baccae4be9361c34cdc37fb82c233cd87c9287936d97557b","observation_id":"29494328-6bab-402a-b9b6-28944f9bbbf5","resolution":{"observed_at":"2026-08-11T12:55:41.036220Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-11T12:55:40.597484Z","title":"R.; and Shah, M","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.597484Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:f3d5b5dfd6b7405129a3fbabedb13f6d3ca1a497715c7a5afe977b162356e756","observation_id":"b9d6aeec-8ca0-4299-a838-74618007741f","resolution":{"observed_at":"2026-08-11T12:55:40.597484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:41.015724Z","title":null,"venue":null,"work_id":"0d967f48-1e32-4b48-a3c3-29aaff69b15a","year":2020},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.601932Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:751a5550fb6300b1ff72fea3ee1b0abfcb2d5e747df6332659c67886d96db9ed","observation_id":"d4ae5fa7-1622-464f-a933-ba696d41ee7d","resolution":{"observed_at":"2026-08-11T12:55:41.020622Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.605409Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.605409Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:2dafd4bbc6a4c5a26e1ecf9873233fda08f6bd2d5f90b64828c6747cb53aa05d","observation_id":"1d0d9565-77a7-40a4-b853-469219c6ee9a","resolution":{"observed_at":"2026-08-11T12:55:40.605409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.609163Z","title":"N.; Kaiser, .; and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.609163Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:9878e91db0a5d77521a32f616fcf92ff65d4535af3e121058c40f797e1b7b4d9","observation_id":"ed842472-5038-4a52-a5b0-7fca2aee138a","resolution":{"observed_at":"2026-08-11T12:55:40.609163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.979152Z","title":null,"venue":null,"work_id":"938fa7bd-0a4e-460d-a143-2ee1a3c2d8eb","year":2023},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.613438Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:dd513713c1d3d14e048a2947fe96279cff4def15de06fcd5979679f25eecfcac","observation_id":"c9fb8d32-4b4a-49d1-ab00-02a1d0800b20","resolution":{"observed_at":"2026-08-11T12:55:40.984876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.962036Z","title":null,"venue":null,"work_id":"816b1fd5-c3d7-4d6a-8cfd-b9b5dfc173d0","year":2023},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.617275Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:fec0e6c3a25cd60656312b1f3d6cc9e5c244baed6cb033e3fadc8fd787db5d10","observation_id":"c2dc8310-4ff1-445a-ad40-1033ddcb3200","resolution":{"observed_at":"2026-08-11T12:55:40.967462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.946437Z","title":null,"venue":null,"work_id":"17ca4f13-ff31-4405-adac-a1b87b71fa30","year":2022},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.620818Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:c4fa7fd0bf5495d2b2d8f2a46b57140a8ea635e5e54846724fae08fe77c70e8b","observation_id":"3abcb923-6297-4b33-adcc-4c35bfdb5237","resolution":{"observed_at":"2026-08-11T12:55:40.950862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.927390Z","title":null,"venue":null,"work_id":"7cbee06a-4f89-4619-966d-4a509717ba13","year":2023},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.624525Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:c2f2038d4c23caf415f72e46a272a7e110983ebb748e9d38a3f735be24be74df","observation_id":"7eac1c72-cc63-433d-a3bf-fefd9f54dfee","resolution":{"observed_at":"2026-08-11T12:55:40.931771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08740","last_updated":"2020-03-09T00:50:19Z","snapshot_observed_at":"2026-08-19T09:34:11.538910Z","submitted_at":"2020-01-23T18:59:46Z","title":"Audiovisual SlowFast Networks for Video Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08740","snapshot_observed_at":"2026-08-11T12:55:40.628431Z","title":"J.; Grauman, K.; Malik, J.; and Feichtenhofer, C","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.628431Z"},"links":{"cited_paper":"/paper/2001.08740","citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:082802e5c82a80a296340a887caa6870ae01a85df67bf6c761cbfa71f447d7fd","observation_id":"cb902e94-8343-49c6-bb5f-be16609e9d7e","resolution":{"observed_at":"2026-08-11T12:55:40.628431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.910769Z","title":null,"venue":null,"work_id":"83e74689-58b2-4297-bfb3-d0dfc39ad55d","year":2017},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.632386Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:41064d343f7958ccea3f446608c37d380d71a1ed6864f7311dbeff61f4d8cf94","observation_id":"8364e2e3-d165-48cf-8af7-145c7def52ca","resolution":{"observed_at":"2026-08-11T12:55:40.917455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.892008Z","title":null,"venue":null,"work_id":"70fdc851-701e-48af-9fbf-cd25f0c0a0ee","year":2019},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.636153Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:f8067bddc9c39cde857eb524125710aeeb5dc3cbcb0300e8467fbbdafc4f4303","observation_id":"7eef2d61-41be-4611-adda-515b6238e79c","resolution":{"observed_at":"2026-08-11T12:55:40.900699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:55:40.876812Z","title":null,"venue":null,"work_id":"b1e6f26d-68b1-46bb-a459-80a8fd6375af","year":2022},"citing_paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T12:55:40.639778Z"},"links":{"citing_paper":"/paper/2412.13708"},"observation_digest":"sha256:575806167002224d1113f736290f3c7abbb4831132d6ac191732eff44c1afb6d","observation_id":"d3535ca3-48d9-4c7c-9b4a-29ec74df0c21","resolution":{"observed_at":"2026-08-11T12:55:40.881941Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.13708","last_updated":"2025-02-03T12:27:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T12:52:20.615522Z","submitted_at":"2024-12-18T10:51:31Z","title":"JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2412.13708."}