{"as_of":"2026-08-19T05:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d379009e40ad1da0f010593fba79c99443ba8da39d8c4be0086a071dc318e687","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:13:01.716269Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:46:09.187257Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T13:56:18.465821Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11248","snapshot_observed_at":"2026-08-12T18:46:09.187257Z","title":"Multimodal class-aware semantic enhance- ment network for audio-visual video parsing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-18T17:36:03.220911Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.187257Z"},"links":{"cited_paper":"/paper/2412.11248","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:89cd362f1cb966df1bbd2b766b695ecff92a854e2cc077b2771935c37a28e23f","observation_id":"5bfb899d-dbe4-41ae-b09e-6ccaccffd004","resolution":{"observed_at":"2026-08-12T18:46:09.187257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"cited_work":{"arxiv_id":"2412.11248","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.11248","snapshot_observed_at":"2026-08-11T13:56:18.465821Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","venue":"cs.CV","work_id":"fe00f9d2-e092-4365-861d-1ffbf6bbc59c","year":2024},"citing_paper":{"arxiv_id":"2412.12628","last_updated":"2024-12-18T09:58:32Z","snapshot_observed_at":"2026-08-19T02:46:40.256468Z","submitted_at":"2024-12-17T07:43:36Z","title":"Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T13:56:18.373538Z"},"links":{"cited_paper":"/paper/2412.11248","citing_paper":"/paper/2412.12628"},"observation_digest":"sha256:7861e784dc3863becec9f0973d1b5fc755990665b98f053a060893edc31e8d77","observation_id":"b3a2f034-4c50-428a-8de4-c76bfb94b117","resolution":{"observed_at":"2026-08-11T13:56:18.469675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.11248/citation-record","integrity":"/paper/2412.11248/integrity","json":"/paper/2412.11248/citation-record.json","paper":"/paper/2412.11248"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.352228Z","title":null,"venue":null,"work_id":"92b7a30f-9adf-4b60-951e-266468c70ed5","year":2022},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.503232Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:4449d504c9291db7dd43a3eb357cc1bed2bfb13e9f5351033c0cddbff53f501e","observation_id":"152bc8e2-6f13-4888-9caf-0ef6577f5b79","resolution":{"observed_at":"2026-08-11T15:13:02.357232Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.338944Z","title":null,"venue":null,"work_id":"9410bbd3-d8ad-4554-b663-1705b834e024","year":2020},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.507978Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:e1678806c7cae9b169399a55896f3dab8f3c9900a3743acabcb03711704b5d59","observation_id":"8a8ca093-f307-4a25-8bc9-af5db5325c02","resolution":{"observed_at":"2026-08-11T15:13:02.344000Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.328005Z","title":null,"venue":null,"work_id":"ce6aded1-8333-4a8a-b8f6-33a1eb4ea3c8","year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.511958Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:c3a3c570832d28fa42757823d325171ebb13ebc95bf28f50d6a83d916f449621","observation_id":"e46f345d-56f2-4ada-bd80-75674c9db2e9","resolution":{"observed_at":"2026-08-11T15:13:02.331773Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.317016Z","title":null,"venue":null,"work_id":"386c8f0e-9fc0-4227-902e-d292a30e9fdc","year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.515898Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:28d3b67cb1573b78f55de283aeeac26709fcd482c2ebc88f4d7474890b275ce7","observation_id":"de3c04df-b900-45d0-a819-bc2d3b5a390b","resolution":{"observed_at":"2026-08-11T15:13:02.320177Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.306176Z","title":"F.; Ellis, D","venue":null,"work_id":"335b2bf4-2984-41b7-97c5-4c83a6745113","year":2017},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.520388Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:fd97e36d1e4ab4f7375ef2762a2e28c038193613d4cf64d57ca95ff58937d9bb","observation_id":"96b8a80f-c045-404f-99e2-12ba2276b82d","resolution":{"observed_at":"2026-08-11T15:13:02.310257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.525271Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.525271Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:6283608f31d0d0126b24d4baa09488cdabc69299789294270f07614510f2e0c3","observation_id":"bac78026-f41b-48c9-b671-062ca42a91f0","resolution":{"observed_at":"2026-08-11T15:13:01.525271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18709","last_updated":"2025-03-02T15:37:39Z","snapshot_observed_at":"2026-08-17T18:11:01.191449Z","submitted_at":"2023-10-28T13:37:52Z","title":"Audio-Visual Instance Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18709","snapshot_observed_at":"2026-08-11T15:13:01.530544Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.530544Z"},"links":{"cited_paper":"/paper/2310.18709","citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:12b27468062a8325b00eea534a2b6f68b5f440bf60fa5c2c2629a028d43181b4","observation_id":"9f8b9332-6d8a-4bf3-964b-7e7c04d4fff3","resolution":{"observed_at":"2026-08-11T15:13:01.530544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.534796Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.534796Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:74939a4ecb6bbfe8677b2e1904e1b1a874ad5ff878f7462e6eae787372c52f8c","observation_id":"a05edc5c-1cb7-46ac-b3f2-5e6671f1580e","resolution":{"observed_at":"2026-08-11T15:13:01.534796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.286090Z","title":"P.; Gemmeke, J","venue":null,"work_id":"891bbd65-b3c9-4720-8a45-3f798d497e58","year":2017},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.539244Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:e90647be4b6aad03ae694b937dcdb258f1486b90a292ebc167758a8ee4eba4c3","observation_id":"46e2a1c5-9a05-482b-8179-df7efdd7c833","resolution":{"observed_at":"2026-08-11T15:13:02.290661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.272681Z","title":null,"venue":null,"work_id":"a67e0729-e100-4a4a-9be7-48ce4ef8efc0","year":2024},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.543947Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:a45c497a85d939c4d8b50bfaed520ff64804189262b0045e26d0d4d96d5ea010","observation_id":"a1369f5f-1c43-4bc5-a4cc-1190dd49db7a","resolution":{"observed_at":"2026-08-11T15:13:02.277598Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.261350Z","title":null,"venue":null,"work_id":"9a02264f-bcea-4966-b2dd-004615bd32a6","year":2022},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.547767Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:05df1c0d8422a1a5381cb875d8aceec4cb6ec841f19b65cf9df943b2fc06868f","observation_id":"42d8ebf1-0b54-4646-a411-b5667af67a97","resolution":{"observed_at":"2026-08-11T15:13:02.265427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.247335Z","title":null,"venue":null,"work_id":"b9a73031-818e-4b56-ac71-5ca4954aab55","year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.552516Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:d074dc4007cd1e6cbfdb93bfd1fef4a3111cfcbbf43bb5f978617d0a009f95b8","observation_id":"1c244fac-dbb7-4c0f-9fd9-4a6c79480b9e","resolution":{"observed_at":"2026-08-11T15:13:02.252960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.230659Z","title":null,"venue":null,"work_id":"68eb0971-4944-4d58-b22d-78aca063f029","year":2024},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.556987Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:5fa6cfea1f6b088e3068102cea5d43dd73be658c2f34d08b2403de85092981f4","observation_id":"8947d35f-4634-4b91-943e-1ffdf78d0b5c","resolution":{"observed_at":"2026-08-11T15:13:02.237881Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.206444Z","title":null,"venue":null,"work_id":"ce0744ae-6481-4d8d-be52-4c11669a2bea","year":2021},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.560638Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:aa29f95c34a92ee20980e712eb0e4b3b0baa7009ae97c6a60150497c9240ede5","observation_id":"36aaa316-8977-4622-92a1-75a227528847","resolution":{"observed_at":"2026-08-11T15:13:02.215252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.187736Z","title":null,"venue":null,"work_id":"d7c151fc-9bb8-4fae-a996-0a4b0ac0fdab","year":2024},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.564174Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:c9c0e76846414f957fcf387ff2fbecb8728ed5a52d3c454c01232529cd0fdf89","observation_id":"13525f6b-e307-44c1-b63b-d246b0397b3b","resolution":{"observed_at":"2026-08-11T15:13:02.191234Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.177197Z","title":null,"venue":null,"work_id":"d827916d-f508-4426-bd36-c5698f465cc3","year":2022},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.568853Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:c14029e5f1b264351e7b88bff71d796e1b7180df4ecb433dd16566322b929a6c","observation_id":"839b9835-4224-44b8-bda9-0591367cece2","resolution":{"observed_at":"2026-08-11T15:13:02.180373Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.166819Z","title":null,"venue":null,"work_id":"d3f09b48-1dee-40b3-89c2-85b98d1ac5ea","year":2020},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.575523Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:554db8734e96010f531ca7c1423dbd2b204372cbaf61887a31534c7f7261831f","observation_id":"2c960343-0c7c-4e4e-8d65-d3178a14fbf1","resolution":{"observed_at":"2026-08-11T15:13:02.170183Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.154887Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; et al","venue":null,"work_id":"897c4e29-b8e8-44ec-a3ab-60bc48b4a72d","year":2021},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.579559Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:785eec2edf6e4ac9364ab353346107bada1802fe443cba9785cf9ffc6da3cfcc","observation_id":"de5b8cf5-49c5-4fe4-88c7-a999b27b955d","resolution":{"observed_at":"2026-08-11T15:13:02.159959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.136923Z","title":null,"venue":null,"work_id":"32345541-a917-4db7-b9d6-82464521a2ae","year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.583425Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:f6e68c6aa12d586827f020adb88f95ad8c3a4d46da3ebd7fee4c6befd72ea6e8","observation_id":"5e9b2698-649e-4dd8-9b60-cfc33fe15b51","resolution":{"observed_at":"2026-08-11T15:13:02.142356Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.122022Z","title":null,"venue":null,"work_id":"6c289313-4fa5-4666-8943-3206ed743355","year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.587774Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:7e2a3960e709a22273d81fc8589a14595b627930037c379a9be6496f9eea67b6","observation_id":"499b408c-e05d-413b-adc8-2bc71fc96023","resolution":{"observed_at":"2026-08-11T15:13:02.127223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.105972Z","title":null,"venue":null,"work_id":"4f5c8f7d-4a59-467e-bf56-1b4ba4fa82c0","year":2020},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.591201Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:2d405646fc56804ba335fbe47f2940c9d150b0c81198d2063ed116325b9c7982","observation_id":"016322f5-764b-4511-bbcb-6f1a27bce399","resolution":{"observed_at":"2026-08-11T15:13:02.110992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.093819Z","title":null,"venue":null,"work_id":"7f0aa4ee-9cac-4b79-9860-5663e69abe8a","year":2018},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.596421Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:d6bbf8f32e62e7bfc688fe5e7bb63fabeaa460a31c2a69e636eb86f2efb786b7","observation_id":"f53c176c-a24b-481f-9c0e-b0978f71300b","resolution":{"observed_at":"2026-08-11T15:13:02.098185Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.079942Z","title":null,"venue":null,"work_id":"0b2e1375-23f6-45b3-82e0-5f1eec1f211d","year":2018},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.602269Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:41f9ce73377754923d06c37ffc491f38ccb85173be2f3da88348a05699699876","observation_id":"073d1454-1ce4-4a84-a759-f054066f7a83","resolution":{"observed_at":"2026-08-11T15:13:02.084854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.607127Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.607127Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:4b55cbb99a66f42ce4930189e6158858e64d8027b97fb2a84778bb98baa4404d","observation_id":"6fce31ed-c484-4572-b37c-eae0c58a7026","resolution":{"observed_at":"2026-08-11T15:13:01.607127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.057543Z","title":"N.; Kaiser, .; and Polosukhin, I","venue":null,"work_id":"584c213c-ac57-40af-a7d6-50648feff11f","year":2017},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.618028Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:48d145fb7bc5d715ba8b180ec470a2cd28fd9debac23db85e7d2437b9e51bd09","observation_id":"ae410929-8a5c-4740-a4eb-20ff16e71d7a","resolution":{"observed_at":"2026-08-11T15:13:02.061349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.044759Z","title":null,"venue":null,"work_id":"07c13150-3afc-4e18-828a-592043d15a7c","year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.625361Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:de90112a17a9822df598c7d3c3d84f6630ac27ac498ebb3f4350d29d8627aa75","observation_id":"5744a7ba-dab8-4d57-aa56-97e1a8653492","resolution":{"observed_at":"2026-08-11T15:13:02.048833Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.026664Z","title":null,"venue":null,"work_id":"f53569c0-82ef-4c25-ac97-cf8d73e030ec","year":2021},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.632171Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:f40508a78e3b15e70a29125bc5663e6f6122d62e399fa41f7f7cb353dfbfd335","observation_id":"40717953-16bc-4610-87fc-78b738aa165a","resolution":{"observed_at":"2026-08-11T15:13:02.036042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:02.012608Z","title":null,"venue":null,"work_id":"cac810d2-534c-4d09-987b-16b35a35f297","year":2022},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.638233Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:4b85f04b4f6067e89bc3bbc6252d0e7d9a498e36da787763f23e22649bdefb04","observation_id":"7a0785a9-699c-4fa1-870a-35b3e64cfb3d","resolution":{"observed_at":"2026-08-11T15:13:02.017257Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.999299Z","title":null,"venue":null,"work_id":"298505a9-6915-4af1-b920-175768d92a5b","year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.643471Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:894b5d91b81eafbfb8a7ad9ecbe0d5196a713caf0ca035bdcf422e43b5577223","observation_id":"d34537c7-6574-4a5d-b6f6-931a7005d3da","resolution":{"observed_at":"2026-08-11T15:13:02.003427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.985653Z","title":null,"venue":null,"work_id":"280c9773-76cf-4b72-aea1-b3c782486e37","year":2018},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.647104Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:053a01f43b85e0048cd07bcbb8c2eda3615958e305532b628b196dd2c82e3e43","observation_id":"b3c12c5d-d5de-43b4-b413-f57dcde977d0","resolution":{"observed_at":"2026-08-11T15:13:01.989549Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-18T17:36:03.220911Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11278","snapshot_observed_at":"2026-08-11T15:13:01.650537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.650537Z"},"links":{"cited_paper":"/paper/2411.11278","citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:5fb8e573991660ef20a004275b2841cd79577c885105650589ef9f932a8b131d","observation_id":"48fc6d8a-1ce9-49e8-858d-5fa97ed8ff73","resolution":{"observed_at":"2026-08-11T15:13:01.650537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.971622Z","title":null,"venue":null,"work_id":"c8bd67ce-6e8d-451e-aebe-a23e89b37263","year":2024},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.655647Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:4d9955000723fe574e8dd13701cc9b52b6582edebd0e85a718113d85373ea0f2","observation_id":"6fbe334b-da2a-4eef-95c7-83a8a7709da8","resolution":{"observed_at":"2026-08-11T15:13:01.976795Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.958433Z","title":null,"venue":null,"work_id":"827575b1-73d6-4c39-97ac-d811ad76e65a","year":2025},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.659388Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:d3cf99ffb2b1bb8f325a7a70e1a53e50ada600dfbef8eead467572ff587f405a","observation_id":"9a1164dd-821f-4d28-9048-73339a9e5ac3","resolution":{"observed_at":"2026-08-11T15:13:01.963252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.946099Z","title":null,"venue":null,"work_id":"fa5221b0-5c88-40fc-913b-7c24d5d82b13","year":2022},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.663322Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:f4230025c0468d8a03b56f19e69163cf1290c0b7047cac304df189f9060c2991","observation_id":"ab830127-220f-4ef8-b25c-a206d3868923","resolution":{"observed_at":"2026-08-11T15:13:01.950389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02344","last_updated":"2023-03-04T07:21:37Z","snapshot_observed_at":"2026-08-16T15:50:51.505984Z","submitted_at":"2023-03-04T07:21:37Z","title":"Improving Audio-Visual Video Parsing with Pseudo Visual Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02344","snapshot_observed_at":"2026-08-11T15:13:01.678056Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.678056Z"},"links":{"cited_paper":"/paper/2303.02344","citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:423bbd30e91c8f129efbbd9a8c818f2338600d728b128bafd180e16cc55a6a61","observation_id":"721ed835-fb5d-4b6b-bf17-ccceec3759de","resolution":{"observed_at":"2026-08-11T15:13:01.678056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.934167Z","title":null,"venue":null,"work_id":"e058913e-7e67-4aaa-b174-1d37478dd641","year":2024},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.687877Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:24d8197199d9db45766b14e5f2b69878219531aeda4834ac72591c022ca24886","observation_id":"ab8b3c04-9637-494d-947d-b4e10f3630bd","resolution":{"observed_at":"2026-08-11T15:13:01.937829Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.918982Z","title":null,"venue":null,"work_id":"0122e524-af3a-4829-8267-873b3f621792","year":2024},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.692972Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:37258430005291c93f43a59c7781ecfd3e4a987180b7f8d2e0d8c8d19c60ae9a","observation_id":"752b6c02-d5fa-4668-8eb9-33f52d4532ec","resolution":{"observed_at":"2026-08-11T15:13:01.923772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.895420Z","title":null,"venue":null,"work_id":"ff1c3f92-3dce-45b2-96f5-ac72d85916f2","year":2022},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.699314Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:8c816f833ac03cefe4ed9b6c6005488ff3861fe083f38143d8cea84db0db1673","observation_id":"0a2cddf0-f471-432b-b64b-8172fd3b6a78","resolution":{"observed_at":"2026-08-11T15:13:01.900502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.877880Z","title":null,"venue":null,"work_id":"3f702f91-6d88-4624-94fb-11d0c9159c52","year":2021},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.704379Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:a08c3532471e10571c375ec29526bdd48f8c623aa1692259065634eef5e2dabc","observation_id":"6f2e5818-9d05-4da6-bf83-838f13abeb5c","resolution":{"observed_at":"2026-08-11T15:13:01.883597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.709680Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.709680Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:5240f349306509301933d2ddfd0f6eaedf4b74fc4ab112f5651f242fd9e2c208","observation_id":"4c799edf-192b-4a94-8b09-6a28a428b66c","resolution":{"observed_at":"2026-08-11T15:13:01.709680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:13:01.716269Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.716269Z"},"links":{"citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:0655f088435d4a1d96c1e05dcad757cb94d2ef7c2b98bcc2258d6a9abe19b786","observation_id":"5d1c6ee0-6e20-4648-9f21-da311c408f88","resolution":{"observed_at":"2026-08-11T15:13:01.716269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 2 inbound Pith citation observations for arXiv:2412.11248."}