{"as_of":"2026-08-18T10:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9e25ea9f9de61791a5eaa047be895f37448ab3b7f09608594ce87cd9a0709360","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:46:09.224346Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:42:22.538919Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T13:56:18.448461Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11278","snapshot_observed_at":"2026-08-11T15:42:22.538919Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10749","last_updated":"2024-12-14T08:34:44Z","snapshot_observed_at":"2026-08-11T18:52:59.825080Z","submitted_at":"2024-12-14T08:34:44Z","title":"Patch-level Sounding Object Tracking for Audio-Visual Question Answering","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T15:42:22.538919Z"},"links":{"cited_paper":"/paper/2411.11278","citing_paper":"/paper/2412.10749"},"observation_digest":"sha256:82bb91388f56e5ccdb8a40ee68d4dba2370bb40bd817cbb703bfbec406d9ae60","observation_id":"c92d3f27-fe3c-45ba-ae38-67084b2e76f7","resolution":{"observed_at":"2026-08-11T15:42:22.538919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11278","snapshot_observed_at":"2026-08-11T15:13:01.650537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.650537Z"},"links":{"cited_paper":"/paper/2411.11278","citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:fb86ccd3c34336a00f8d5797a3fe72b16eb9ab9571da89eca9c9f3b0c8e03e4d","observation_id":"48fc6d8a-1ce9-49e8-858d-5fa97ed8ff73","resolution":{"observed_at":"2026-08-11T15:13:01.650537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"cited_work":{"arxiv_id":"2411.11278","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.11278","snapshot_observed_at":"2026-08-11T13:56:18.448461Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","venue":"cs.CV","work_id":"326422a8-7cf0-47ac-895f-8c8fe6ada264","year":2024},"citing_paper":{"arxiv_id":"2412.12628","last_updated":"2024-12-18T09:58:32Z","snapshot_observed_at":"2026-08-15T22:50:25.356078Z","submitted_at":"2024-12-17T07:43:36Z","title":"Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T13:56:18.376640Z"},"links":{"cited_paper":"/paper/2411.11278","citing_paper":"/paper/2412.12628"},"observation_digest":"sha256:23e1a04dd44519ef1ef2a393efbd089b20fac672e437d2e35548b0c2977106b0","observation_id":"713eb6f8-0602-456b-9bf5-3a8246146c5a","resolution":{"observed_at":"2026-08-11T13:56:18.454468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.11278/citation-record","integrity":"/paper/2411.11278/integrity","json":"/paper/2411.11278/citation-record.json","paper":"/paper/2411.11278"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:10.042561Z","title":"Look, listen and learn","venue":null,"work_id":"4d88c419-04cc-4fc4-84f6-a9d0e586acb9","year":2017},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:08.980979Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:9a2fe7a685565bf2fa1756893aee98720a963b64a8c1ad9fae326c4c5cbc784e","observation_id":"15ae7e47-9079-4e17-aff9-8493e5226573","resolution":{"observed_at":"2026-08-12T18:46:10.047568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:10.029163Z","title":"Objects that sound","venue":null,"work_id":"78f2c442-1487-4509-b414-26d820536f30","year":2018},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:08.985768Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:5b0eebda2b2d1e76740ae578e4350e91bb27678827d31a387220bc0e7241f34d","observation_id":"b654f469-11c6-46ed-bd46-4020b5b52226","resolution":{"observed_at":"2026-08-12T18:46:10.033663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:10.015181Z","title":"Cross-modal label contrastive learning for unsupervised audio-visual event localization","venue":null,"work_id":"79b756fd-e8f8-42f5-b6d9-579e73dadb73","year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:08.990953Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:429c2f04e2b906918617f6b312f191f88905d24e5315130eed966cd0a11d0f0f","observation_id":"3d8a9846-c091-4486-ad9b-cde801a175a6","resolution":{"observed_at":"2026-08-12T18:46:10.019915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:10.000721Z","title":"VGGSound: A large-scale audio-visual dataset","venue":null,"work_id":"eef739b5-80b0-4cde-a3dc-64ce6dea1bdb","year":2020},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:08.995675Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:244b8555d0a7eff197b7e44ed960df1d9fb213fd065ac2d4b38dec765d45baba","observation_id":"54e70ea2-a5b7-46d3-b39d-807029624e50","resolution":{"observed_at":"2026-08-12T18:46:10.005165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.985028Z","title":"Localizing visual sounds the hard way","venue":null,"work_id":"bd8e15b0-929b-4867-8f8b-dbfd188ed6b4","year":null},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:08.999948Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:141361894026afc60de65fe1da2cd3826f98809ba1edc193c4348c71c782bd6d","observation_id":"2d36fa57-ac3a-4b43-9698-acdf7ee7dc05","resolution":{"observed_at":"2026-08-12T18:46:09.990268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.972068Z","title":"Cm-pie: Cross-modal per- ception for interactive-enhanced audio-visual video parsing","venue":null,"work_id":"d5bdf125-8a7c-4185-ada4-12b01593c66a","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.004285Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:084f76dd8e80b4fb5e8d75746873eaaf156e3ceddca05aa4d8668aae3ebfac83","observation_id":"6232c27f-83f8-49f8-92db-e107fafa0fb8","resolution":{"observed_at":"2026-08-12T18:46:09.976520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-12T18:46:09.008696Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.008696Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:5b73f4e469fb29778726df9bfa9967acb9bc28c9b2c95dd7bb50a68705a55ff9","observation_id":"8a14af03-16fa-4481-b53b-4a3d0046855c","resolution":{"observed_at":"2026-08-12T18:46:09.008696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.958270Z","title":"Audio-visual event localization via re- cursive fusion by joint co-attention","venue":null,"work_id":"8e979d4b-90c4-4ddc-ab9f-344179bee5e3","year":2021},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.014532Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:c3fae1dd23df6e2a58538aeaea279fb59b84224d6b48d8a2da137c34297b7606","observation_id":"e941a208-8151-4e4c-a3ef-d426edcd63ae","resolution":{"observed_at":"2026-08-12T18:46:09.962817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.944979Z","title":"Col- lecting cross-modal presence-absence evidence for weakly- supervised audio-visual event perception","venue":null,"work_id":"8f94e7c2-1b6e-4c81-8c69-7582dfa846b3","year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.018653Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:900138b54c25dade6250a41113afe0dd7a1b569380ecfa844e31c7ad4fcef230","observation_id":"08ec1f37-eb68-4f14-a17f-6688462cd2ce","resolution":{"observed_at":"2026-08-12T18:46:09.949431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.931934Z","title":"Learning event-specific localization preferences for audio-visual event localization","venue":null,"work_id":"48992634-357f-4c48-9794-21391839b2a2","year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.022625Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:d0ade79217a10f9eb8e5286b8bcef22c4a9c195c7d0982babcae03bd0d886ea1","observation_id":"03af3082-c28c-4052-b44d-472b72a03977","resolution":{"observed_at":"2026-08-12T18:46:09.936627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.919330Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"91ba7277-8a2d-4626-acb4-fe484c656d04","year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.026858Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:a92f25c55ed92cefab2c8d0df26307321f198cfa72b73c36b4800bab12e2df90","observation_id":"d84a4fff-4d56-4430-b5cb-eddc723d8748","resolution":{"observed_at":"2026-08-12T18:46:09.923665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18709","last_updated":"2025-03-02T15:37:39Z","snapshot_observed_at":"2026-08-17T18:11:01.191449Z","submitted_at":"2023-10-28T13:37:52Z","title":"Audio-Visual Instance Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18709","snapshot_observed_at":"2026-08-12T18:46:09.031350Z","title":"Audio-visual instance segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.031350Z"},"links":{"cited_paper":"/paper/2310.18709","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:deeb346c6a15b13d27b3627ed7f80695585d93172c6167a2fd08b2dc6cac5c36","observation_id":"957f44bc-9f62-468c-b23e-716e6fea6864","resolution":{"observed_at":"2026-08-12T18:46:09.031350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.906864Z","title":"Instance-level panoramic audio-visual saliency detection and ranking","venue":null,"work_id":"6b95b067-eaae-4775-aaca-ed868cca093e","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.035837Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:a55585d2db44bdb8ba766d35689413bb6055c48ee12dc4a54cc172b90d8e0710","observation_id":"a96ab497-95ca-4e75-9cff-26a6729e0e55","resolution":{"observed_at":"2026-08-12T18:46:09.910930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.893557Z","title":"Open- vocabulary audio-visual semantic segmentation","venue":null,"work_id":"694bb09f-8f14-4b10-a913-369f83ce9504","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.039915Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:615bdf546282e0ca5e48e634bd384b6c7bd659cc06dc16149e25b9fac9a977cc","observation_id":"5246e0ec-f4c8-4027-a389-f584c7f24db5","resolution":{"observed_at":"2026-08-12T18:46:09.897879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.879878Z","title":"Unitr: A unified transformer-based framework for co-object and multi-modal saliency detection","venue":null,"work_id":"b3baaba5-6cb5-4ee0-9bba-227d66b328ea","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.044185Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:4c0989300fbe072a9fa952820fbb645809f5bfa85859d3c6e6dd9e437df613b4","observation_id":"5f1eb038-f382-4a6a-be20-a9785bfcb55b","resolution":{"observed_at":"2026-08-12T18:46:09.884566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.866217Z","title":"Improving audio-visual segmentation with bidirectional generation","venue":null,"work_id":"483fa902-e2e4-4961-9a5e-3fcf28e552aa","year":null},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.048212Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:f40a132bd6e97d74d5ffc8c62996222074ec031ed3c2d0e3ab5351b6e9d7ae5c","observation_id":"a346d44a-fc6d-4e6e-81f3-b145e9878fee","resolution":{"observed_at":"2026-08-12T18:46:09.870776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01952","last_updated":"2024-08-04T07:48:12Z","snapshot_observed_at":"2026-08-16T13:28:41.875134Z","submitted_at":"2024-08-04T07:48:12Z","title":"CACE-Net: Co-guidance Attention and Contrastive Enhancement for Effective Audio-Visual Event Localization","version":1},"cited_work":{"arxiv_id":"2408.01952","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01952","snapshot_observed_at":"2026-08-12T18:46:09.384698Z","title":"CACE-Net: Co-guidance Attention and Contrastive Enhancement for Effective Audio-Visual Event Localization","venue":"cs.CV","work_id":"e0dec3e5-8000-4a8f-8df7-1704c214ad96","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.052170Z"},"links":{"cited_paper":"/paper/2408.01952","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:7a7b9fbaa576de55e13d9d2934e734febb4e998e75c30178c60941b2cda349bc","observation_id":"874d31ba-32d2-4cfa-8b29-edc990c1a07f","resolution":{"observed_at":"2026-08-12T18:46:09.390007Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20378","last_updated":"2024-12-29T06:46:24Z","snapshot_observed_at":"2026-08-17T17:55:33.588218Z","submitted_at":"2024-12-29T06:46:24Z","title":"Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20378","snapshot_observed_at":"2026-08-12T18:46:09.056514Z","title":"Tri-ergon: Fine-grained video-to-audio generation with multi-modal conditions and lufs control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.056514Z"},"links":{"cited_paper":"/paper/2412.20378","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:859d9de4ce30782e96707e4e7fe68b9a5cd785b739b5efce007fb6f023878a37","observation_id":"d306687a-1075-4646-866d-1cfdbeeb8a15","resolution":{"observed_at":"2026-08-12T18:46:09.056514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.852145Z","title":"Learning to answer questions in dynamic audio-visual scenarios","venue":null,"work_id":"99521b23-b520-4da6-9126-5781b5f8d090","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.060887Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:6b8ca5241b8d3f68531fea750352f29aacbcad2a7a9781966d27622db7ab97f7","observation_id":"91dfb26e-d9f5-4f0f-89a2-30f94572cd51","resolution":{"observed_at":"2026-08-12T18:46:09.856923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.839179Z","title":"Progressive spatio- temporal perception for audio-visual question answering","venue":null,"work_id":"86ed9b01-0050-4980-b6cb-17013bd48d40","year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.064881Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:7d9ec70f31b9329e16e799bf4182dfa91a84917bb69abc6b52101d06108d4dc0","observation_id":"22acee5f-a790-4170-88bb-9f2f8279567e","resolution":{"observed_at":"2026-08-12T18:46:09.843528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.826090Z","title":"Object-aware adaptive-positivity learning for audio- visual question answering","venue":null,"work_id":"b19bd83d-2769-4dac-82ae-cad847cd4edd","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.068921Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:c83e3a92c3a02e28bd549a60424042698be1004af64657577c1f27060555d1af","observation_id":"0a9f6f5f-dd27-4a60-b15c-cca3ed389c4c","resolution":{"observed_at":"2026-08-12T18:46:09.830691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10749","last_updated":"2024-12-14T08:34:44Z","snapshot_observed_at":"2026-08-11T18:52:59.825080Z","submitted_at":"2024-12-14T08:34:44Z","title":"Patch-level Sounding Object Tracking for Audio-Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10749","snapshot_observed_at":"2026-08-12T18:46:09.072989Z","title":"Patch-level sounding object track- ing for audio-visual question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.072989Z"},"links":{"cited_paper":"/paper/2412.10749","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:184699efdf983243bb6b6e91ebf85822e5a1160080a690f827a2dc10c876b441","observation_id":"8e31d5b9-e864-45e8-aff4-c19f3f8681a7","resolution":{"observed_at":"2026-08-12T18:46:09.072989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.813520Z","title":"Dual- modality seq2seq network for audio-visual event localiza- tion","venue":null,"work_id":"0e1b55d5-839d-4118-a249-0d8bdc03338d","year":2002},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.077495Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:8483f65e3b93c8548eb107624bcc5d6f6346f3178f882486e0d48a172f6ccddc","observation_id":"589c317f-813f-4a64-a4f7-0b500e8e0b48","resolution":{"observed_at":"2026-08-12T18:46:09.817876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.800463Z","title":"Ave-clip: Audioclip-based multi-window temporal transformer for au- dio visual event localization","venue":null,"work_id":"19d3d299-3808-441d-a378-0825a7831e2e","year":null},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.081450Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:934c5171b9b035be4684dfd0e2101dfed573280903a64d86451df6c9f05fbb4a","observation_id":"948e84e3-e531-4587-b11d-f3b592fa2aaf","resolution":{"observed_at":"2026-08-12T18:46:09.805042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.787370Z","title":"T-vsl: Text-guided visual sound source localization in mixtures","venue":null,"work_id":"72a2f83d-1dba-4d17-906a-0ad5f43b243c","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.085692Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:6e17b4444fe8ef2a6501329cfe97b648345038edc3b358da38bf3140390efceb","observation_id":"7b1c059b-1e82-405e-846a-55817dcaaf67","resolution":{"observed_at":"2026-08-12T18:46:09.791568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16579","last_updated":"2025-07-01T05:44:57Z","snapshot_observed_at":"2026-08-16T15:12:00.870091Z","submitted_at":"2023-07-31T11:29:50Z","title":"Contrastive Conditional Latent Diffusion for Audio-visual Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16579","snapshot_observed_at":"2026-08-12T18:46:09.089546Z","title":"Contrastive conditional la- tent diffusion for audio-visual segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.089546Z"},"links":{"cited_paper":"/paper/2307.16579","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:d2e1251ef396faf1592865637f771345a15450c606070a89a33bf19544bd0365","observation_id":"9bb406f7-6335-40dd-b73d-58ac7d1a56f7","resolution":{"observed_at":"2026-08-12T18:46:09.089546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.774346Z","title":"Multimodal variational auto-encoder based audio-visual segmentation","venue":null,"work_id":"44d3b158-94a8-4494-a3f4-eabdab4ea20d","year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.093768Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:6247980bf1dd6196b69b48e4df418b5fa1fcaa70bdb4048d88577bd72f0f7082","observation_id":"5e220090-092e-4cf7-a549-d71aec5aefb0","resolution":{"observed_at":"2026-08-12T18:46:09.778579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.761019Z","title":"Tavg- bench: Benchmarking text to audible-video generation","venue":null,"work_id":"3a38c4f4-7868-4dd9-b902-d41b2f0a36e3","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.098002Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:9851cec4bb50a47d672fbb3dfd63d06d8c3e9d82f72a72065bfad11a19ec2178","observation_id":"69ced0a5-5a5b-4617-bd3c-2074af874c0e","resolution":{"observed_at":"2026-08-12T18:46:09.765637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.747347Z","title":"Avgzslnet: Audio-visual gen- eralized zero-shot learning by reconstructing label features from multi-modal embeddings","venue":null,"work_id":"169a94f1-d059-467b-9af3-624eaace8dd1","year":null},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.101963Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:97ac8c7ecd6f8d0f3e669763cf217634e45083e3b7100265c2d992d28789ac6d","observation_id":"c3a994b7-43ff-4711-a239-bb9de0336e58","resolution":{"observed_at":"2026-08-12T18:46:09.752061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.734430Z","title":"Temporal and cross-modal at- tention for audio-visual zero-shot learning","venue":null,"work_id":"175463c2-866b-457d-bc96-d263de61eeb5","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.106230Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:211520388bc28590404623c17eb437ce62ba4dd10a805c5a72ba6e4e191d8624","observation_id":"d974016a-dbb9-4d62-a7da-f52c4ecae096","resolution":{"observed_at":"2026-08-12T18:46:09.738739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.720201Z","title":"Audio-visual generalised zero-shot learning with cross-modal attention and language","venue":null,"work_id":"6c868103-497e-4be2-8046-8bfcfbee0d40","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.110153Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:638a66e5a2d451892586274a01e952ec9456a9ee082fe94147a46b9eceee0812","observation_id":"0d2011d4-2b03-463c-80cb-468d84ce853a","resolution":{"observed_at":"2026-08-12T18:46:09.725021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.706876Z","title":"Localizing visual sounds the easy way","venue":null,"work_id":"c8fafe9b-6b1b-4e7d-9fde-a79309370e93","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.114184Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:c26c7bc0f95db5d95c1c124f12b1e1f0bb2aadb3970fbe2d6b3d4acbeac3c93a","observation_id":"c273f183-ba0f-4b3d-b47b-84f3c7c1f979","resolution":{"observed_at":"2026-08-12T18:46:09.711381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13095","last_updated":"2024-07-18T01:57:16Z","snapshot_observed_at":"2026-08-16T13:33:14.712391Z","submitted_at":"2024-07-18T01:57:16Z","title":"Audio-visual Generalized Zero-shot Learning the Easy Way","version":1},"cited_work":{"arxiv_id":"2407.13095","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.13095","snapshot_observed_at":"2026-08-12T18:46:09.324837Z","title":"Audio-visual Generalized Zero-shot Learning the Easy Way","venue":"cs.CV","work_id":"192f24a6-0b2f-4d03-9d21-d853d4eef38e","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.118070Z"},"links":{"cited_paper":"/paper/2407.13095","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:5f73c5573ad03c05db339ce2070ba9b4bbaae30667bb7e85aa750a57bc842758","observation_id":"532280ed-dce2-424b-8d00-1fbf9c3fb8eb","resolution":{"observed_at":"2026-08-12T18:46:09.331158Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13435","last_updated":"2023-12-13T17:24:10Z","snapshot_observed_at":"2026-08-17T15:43:08.581326Z","submitted_at":"2023-11-22T14:48:30Z","title":"PG-Video-LLaVA: Pixel Grounding Large Video-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13435","snapshot_observed_at":"2026-08-12T18:46:09.122320Z","title":"Pg-video-llava: Pixel grounding large video- language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.122320Z"},"links":{"cited_paper":"/paper/2311.13435","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:8527f0f26a752190294040a2299bc000dc15dce1f63b4aaac2a933f864fc6d51","observation_id":"e1baf286-9313-4b41-8078-83b2e386eef0","resolution":{"observed_at":"2026-08-12T18:46:09.122320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.693533Z","title":"Coordinated joint multimodal embeddings for gen- eralized audio-visual zero-shot classification and retrieval of videos","venue":null,"work_id":"91a9852a-f4ab-4d54-a106-adb233cafc30","year":2020},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.126554Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:594fb825eca4d0c93a788d500083b986405819a5c0b60019ff75ac733cbb1b7e","observation_id":"2b3d1c9b-ae43-4380-b520-da37344b8188","resolution":{"observed_at":"2026-08-12T18:46:09.697966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.680861Z","title":"Multiple sound sources localization from coarse to fine","venue":null,"work_id":"9db1a431-0ee5-4f31-9ad0-6aeca4132417","year":2020},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.130581Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:0176f3aaa25c8085e94d17f27c12b5f0403493fa17e4a5196eef4cf5acd1003a","observation_id":"96feb531-bea0-4026-91b0-970b7faa4a88","resolution":{"observed_at":"2026-08-12T18:46:09.685165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.668416Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"4ce85b63-7e4d-42dd-a9a1-9cde717cf1e9","year":2021},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.134348Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:69cd38eeee414a5f287ed6aa33669dc71a5b3ef015d4a061c8be05ce57cac30b","observation_id":"b994d640-c782-4562-8410-0d4860a4332f","resolution":{"observed_at":"2026-08-12T18:46:09.672549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.655803Z","title":"Fine-grained audible video description","venue":null,"work_id":"b94be99e-a215-4879-b4ce-2be8bfe02725","year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.138191Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:fdea1324f11e027ed1b8fdf8e79de3facf460741a73b0190217d96d63b6ef2b4","observation_id":"35c39a77-6b3a-465e-ba69-8414e423aa8f","resolution":{"observed_at":"2026-08-12T18:46:09.660094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.643322Z","title":"Audio-visual event localization in unconstrained videos","venue":null,"work_id":"5ee4efc7-b69f-4b63-b101-d474ef99314a","year":2018},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.142176Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:710567c49ce0f86a716095160843989220447e4058114000af90e527157c78b0","observation_id":"1c508258-4c6d-426e-bdbb-c3f94c062d87","resolution":{"observed_at":"2026-08-12T18:46:09.647523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.630484Z","title":"Unified mul- tisensory perception: Weakly-supervised audio-visual video parsing","venue":null,"work_id":"f2c70dc9-2e47-4ad7-a223-74fd8d54b4aa","year":2020},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.146224Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:5d85b188645358d1b00d0b26ff704e8f569cf6f036c2961fa440a7c39bd3425c","observation_id":"7d863dad-2e44-40a8-aab0-12e60cb51587","resolution":{"observed_at":"2026-08-12T18:46:09.635048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.616697Z","title":"Attention is all you need","venue":null,"work_id":"e22a790e-e524-436b-b7b0-de7dfd2c243f","year":2017},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.150182Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:52dbfe0ccaef2cca39ff2736be60b3caf35a05f0f04352e67c0c0023456135c0","observation_id":"5c33d0ff-547b-4703-b12e-4454b95a9959","resolution":{"observed_at":"2026-08-12T18:46:09.621497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.603944Z","title":"Dual attention matching for audio-visual event localization","venue":null,"work_id":"b75be790-2c1d-400f-8abd-064737699e92","year":2019},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.154304Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:2c3d14ee82c78be0316c1e1b478f2877ea3924d548838f3341b7ad10d02d0e50","observation_id":"ac6509aa-b06f-4c3c-a7fa-3e181c1cbf3c","resolution":{"observed_at":"2026-08-12T18:46:09.608346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.590868Z","title":"Span-based audio-visual localization","venue":null,"work_id":"6f514399-5871-4b18-aeb7-4e6634f21b70","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.158467Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:d226c20ef3ce58387199404b61b0f4eea0f1d484f36c0935437a6e8652138274","observation_id":"4f50f783-1427-4760-8706-ac9a7d3f2cea","resolution":{"observed_at":"2026-08-12T18:46:09.595451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.577324Z","title":"Large-scale con- trastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"14dc4559-fd56-4d2d-a9a0-e8b8891530ed","year":null},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.162578Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:e9a868b7bac88f21988ec54fbeccec2366121522744565c5378ca80a9ce2f31a","observation_id":"df237228-da4d-46ce-acf6-e08773a08056","resolution":{"observed_at":"2026-08-12T18:46:09.581830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.564056Z","title":"Cross-modal background suppres- sion for audio-visual event localization","venue":null,"work_id":"0774b7c6-07f2-4209-8ca2-85b7da4fcd8e","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.167077Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:cbab2d7b3e915a208d8fd50e5cfd05b2b04f6f42849dd0caf803426deaf7bdb8","observation_id":"9bbcc665-b21d-40be-b3de-975a8b0bbe90","resolution":{"observed_at":"2026-08-12T18:46:09.568696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.550778Z","title":"Cross-modal relation-aware networks for audio-visual event localization","venue":null,"work_id":"51bc3ede-6b39-4895-b9cb-e103de64628e","year":2020},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.171117Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:3bb3168eab6bb50c62fa1205c189a8ed124d7e26896477ae32348f12e717e795","observation_id":"37030a44-de52-4b64-913e-cc1ee7b9df23","resolution":{"observed_at":"2026-08-12T18:46:09.554943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.537807Z","title":"Avqa: A dataset for audio- visual question answering on videos","venue":null,"work_id":"a9f795bb-69fa-4bf0-81ca-7b589fddf267","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.175171Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:a04eb1c719b4607f1f64771eb5a9a75c3cc22453b4b008c211e718983cd976f1","observation_id":"e8d08bf5-7c82-43b6-beed-f170b905e4a7","resolution":{"observed_at":"2026-08-12T18:46:09.541968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.524649Z","title":"MM-Pyramid: Multimodal pyramid attentional network for audio-visual event localization and video pars- ing","venue":null,"work_id":"e123b864-69ef-4f19-9e23-91a0203a56ed","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.179231Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:e5135716f15dfa6b2ab702cb75684d7b164f5c14f8ea0dc3c369d6f928f18695","observation_id":"595072d6-bec8-41d5-911a-50e0a92a590a","resolution":{"observed_at":"2026-08-12T18:46:09.529073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.511003Z","title":"Ope- nA VE: Moving towards open set audio-visual event localiza- tion","venue":null,"work_id":"7f19d686-043e-479c-bf8e-c18d675b0cd8","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.183240Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:4afd38e85468de94d889b01a65d950273b95471950f5881397936cc9363cb44d","observation_id":"1f5ecc0c-7de5-4b10-8d1d-c3084f9907a6","resolution":{"observed_at":"2026-08-12T18:46:09.515990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-17T23:24:38.973608Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11248","snapshot_observed_at":"2026-08-12T18:46:09.187257Z","title":"Multimodal class-aware semantic enhance- ment network for audio-visual video parsing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.187257Z"},"links":{"cited_paper":"/paper/2412.11248","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:5d8dea6f2e99441e1486d76d35c0ec7e383dc643102883efd3defa74d504bb4e","observation_id":"5bfb899d-dbe4-41ae-b09e-6ccaccffd004","resolution":{"observed_at":"2026-08-12T18:46:09.187257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.497155Z","title":"Positive sample propagation along the audio- visual event line","venue":null,"work_id":"af9f9025-7f1f-411d-8f52-d9c02077ef20","year":2021},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.191431Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:da9c1dac649fd25d0a07dfbb42577b03a64ca20e3052ca0dcecbd1ce880d6aec","observation_id":"852432ce-a2c2-4942-8fed-79a9d7ebf983","resolution":{"observed_at":"2026-08-12T18:46:09.501606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.482749Z","title":"Contrastive pos- itive sample propagation along the audio-visual event line","venue":null,"work_id":"b1b15eb5-dc15-43ac-ac35-08dc334f6110","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.195775Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:7e0f2c4b7256dbb02149ed9e9c3de73c44be934ab176e246137a5ca24462cf24","observation_id":"9da1f39c-47e7-491a-80d6-66f8272c44ae","resolution":{"observed_at":"2026-08-12T18:46:09.487226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.468827Z","title":"Audio–visual segmentation","venue":null,"work_id":"ecda54c6-5bf5-49cb-95bd-bf7ff0aceed4","year":2022},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.199812Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:f0832cfe80da75b04a42a0589fcab82eeea274b9a4c1b0134be7ec631026be2d","observation_id":"2c50363e-0199-41f4-b865-1a4ca2b65e4d","resolution":{"observed_at":"2026-08-12T18:46:09.473057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02344","last_updated":"2023-03-04T07:21:37Z","snapshot_observed_at":"2026-08-16T15:50:51.505984Z","submitted_at":"2023-03-04T07:21:37Z","title":"Improving Audio-Visual Video Parsing with Pseudo Visual Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02344","snapshot_observed_at":"2026-08-12T18:46:09.203800Z","title":"Im- proving audio-visual video parsing with pseudo visual labels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.203800Z"},"links":{"cited_paper":"/paper/2303.02344","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:d5e7c30fd011f23ba8a19c69b2754239c06c55b888e3bc3c635423d5f099d787","observation_id":"fdd1c146-5842-494b-8172-761b85846dd7","resolution":{"observed_at":"2026-08-12T18:46:09.203800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13190","last_updated":"2023-01-30T18:53:32Z","snapshot_observed_at":"2026-08-16T15:59:03.490415Z","submitted_at":"2023-01-30T18:53:32Z","title":"Audio-Visual Segmentation with Semantics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13190","snapshot_observed_at":"2026-08-12T18:46:09.208097Z","title":"Audio-visual segmentation with semantics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.208097Z"},"links":{"cited_paper":"/paper/2301.13190","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:0f6b1cf85eae7929a3a3012c09d1359ed14a05825a6ae87781e9cbc796f087df","observation_id":"628c6665-f9bf-4f0b-8fe9-9feeb3d577ba","resolution":{"observed_at":"2026-08-12T18:46:09.208097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.455566Z","title":"Label-anticipated event disentan- glement for audio-visual video parsing","venue":null,"work_id":"3ecd8f93-4d40-4feb-95ca-f3ae3c081799","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.212176Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:beed1ddfd109c6620f73da8af53d2c91732df1cadda5533f64ba3e22d9295d7f","observation_id":"6175d65a-f33b-4108-a611-6608d1b1ccd6","resolution":{"observed_at":"2026-08-12T18:46:09.459970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.441374Z","title":"Ad- vancing weakly-supervised audio-visual video parsing via segment-wise pseudo labeling","venue":null,"work_id":"852ac768-cc70-44d4-8539-1a3b45fb00a6","year":2024},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.216131Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:cb52ed174cda4b900734798ae19b108d1eb1edb6b6264ec2ec850a8e0ec5c46a","observation_id":"afc1a1ef-2e6f-4c20-9714-4ecb58d0ea83","resolution":{"observed_at":"2026-08-12T18:46:09.446303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12628","last_updated":"2024-12-18T09:58:32Z","snapshot_observed_at":"2026-08-15T22:50:25.356078Z","submitted_at":"2024-12-17T07:43:36Z","title":"Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12628","snapshot_observed_at":"2026-08-12T18:46:09.220172Z","title":"Dense audio-visual event lo- calization under cross-modal consistency and multi-temporal granularity collaboration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.220172Z"},"links":{"cited_paper":"/paper/2412.12628","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:fec52c890c4ceecf8cc9bfbeebdaec2f58aa3e6eacc381f03d704613ed25afe2","observation_id":"2304d58c-8bc4-4702-93b2-f8a419010663","resolution":{"observed_at":"2026-08-12T18:46:09.220172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:46:09.427419Z","title":"Instruction: For the given 10-second video, divide it into 10 one-second segments. For each segment, if its audio and visual streams describe the same event, assign the label “x","venue":null,"work_id":"e4200b68-d186-40a5-a9ce-f31f2039dbb4","year":null},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.224346Z"},"links":{"citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:7f7857f9f3cf34818ba69d0ffaaa4d5baedabbdc4e88bda17527b004e02d78a4","observation_id":"9f6023f4-5c01-4c81-926d-3ef258f96086","resolution":{"observed_at":"2026-08-12T18:46:09.432304Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T22:54:27.820293Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":46},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 3 inbound Pith citation observations for arXiv:2411.11278."}