{"as_of":"2026-08-21T21:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7024a36037771d0bfb82bf921ac5357ce0bc5acb274ddadfcbc18cd5e8b89367","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T10:39:37.920953Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.11602/citation-record","integrity":"/paper/2606.11602/integrity","json":"/paper/2606.11602/citation-record.json","paper":"/paper/2606.11602"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Look, listen, and attend: Co-attention network for self-supervised audio-visual representa- tion learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:53e3177483c9a8772e4ff5b4212f5aece697eedaa8fe32b2c08b02116339d2fb","observation_id":"407f5517-65c5-49dc-9f2c-0ecbacd8af5f","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Self- supervised object detection from audio-visual correspondence,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:557067fb00ffb8495118c8667ff4ff220d37e7a68fb6d1bffbabcb5b9ca069f2","observation_id":"427b5d01-357a-46bc-9155-2cea6392bb8c","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Detection of audio-video synchronization errors via event detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:0f07142596bac7e799eef994a427d49fc3fe74c3859e10c0522c8339fbf4c2e6","observation_id":"7705b846-6f68-461e-8303-2d18d069dbd6","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08740","last_updated":"2020-03-09T00:50:19Z","snapshot_observed_at":"2026-08-19T09:34:11.538910Z","submitted_at":"2020-01-23T18:59:46Z","title":"Audiovisual SlowFast Networks for Video Recognition","version":2},"cited_work":{"arxiv_id":"2001.08740","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2001.08740","snapshot_observed_at":"2026-07-03T08:57:47.660611Z","title":"Audiovisual slowfast networks for video recognition.arXiv preprint arXiv:2001.08740","venue":null,"work_id":"3617874f-d8ea-40ca-9b94-f4150287b9f4","year":2001},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"cited_paper":"/paper/2001.08740","citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:7887e2886bf620ed27d1e5577c9b02ae6b6da6f75fd71ee3fa70bb574ca5ed2a","observation_id":"8a8885ba-b003-423e-a10c-cc72a3821ff8","resolution":{"observed_at":"2026-07-03T08:57:47.661964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Text-to-feature diffusion for audio-visual few-shot learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:cae42a93642760baafbb2233976b04cdd594c03aae03f6f392f9053ce6754694","observation_id":"d06aa5fc-5c46-4c6a-818b-64f8fad912a4","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Advancing weakly- supervised audio-visual video parsing via segment-wise pseudo label- ing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:defe4b49219136d3d863dd7088f6b68f792e60da7e594dd62087c52a081b851b","observation_id":"54404212-e78c-4650-b4f9-5933a0f61669","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Aloha: Adapting local spatio-temporal context to enhance the audio-visual semantic segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:0174fe8e6ba0ea111cd4568420f56c6175e3c50e88b5caea23392f30ccd62199","observation_id":"5153b275-6677-40c3-a6cb-48ccbd299d6a","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Audio-visual event localization with cross co-attention and dynamic audio-object semantic alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:b50630b6f7a6fa3631fba2a1de8017d36e6231074a2555e3dfabef5ca53523b8","observation_id":"7d3c7e45-ce3d-4c2c-938d-a7f0aed9b531","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"X-sta: Cross-modal spatial-temporal alignment network for unified audio-visual segmenta- tion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:d8481ff9646f88ede2575d6c8c516a7572be58870b90e54bd97d00b1d9e6ffdf","observation_id":"2959b878-b23b-4c2f-8b06-ca6442f5a6cf","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Coordinated joint multimodal embeddings for generalized audio-visual zero-shot classifi- cation and retrieval of videos,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:4e6a7b5c25b8c40f340ea97d19fd06079dd5b420c6262347edf64b0bdbf7d016","observation_id":"fe56af1e-d90c-4690-b982-ded29839d47e","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Avgzslnet: Audio-visual generalized zero-shot learning by reconstructing label fea- tures from multi-modal embeddings,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:7401a8dae4cdbec27b92870c40a249aac1b2c356f9eb11fcbdee14545d5953d5","observation_id":"8b59b25f-814a-4d8c-8653-d6283f5eacd5","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Audio-visual generalised zero-shot learning with cross-modal attention and language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:a4d35b2ff54859f05c55ab14bdabebc7042bbae233e6571840a8669d9c83e3fc","observation_id":"16a33141-9b62-4e3b-92f1-47baa334d382","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Temporal and cross-modal attention for audio-visual zero-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:15350eeda0856d8c29cace237f7063a2f00534018c20708df7cb7ef9188c9ba3","observation_id":"5a0dd993-46ba-4cd9-9439-0e3d68b41b26","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Hyperbolic audio-visual zero-shot learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:875a840affb6cf5191f78cb15e2a90e645d35cc31057746f38084bdf8c4c7e7b","observation_id":"1d9a12c0-d7d0-48e7-8569-fd45e1995514","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Motion- decoupled spiking transformer for audio-visual zero-shot learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:a033fbf46cde215cca5ce3c175091bf0683df655418406380edf2a5502b8a878","observation_id":"0fd3846c-9034-4dba-b5f0-500a7bb01383","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"A generative approach to audio- visual generalized zero-shot learning: Combining contrastive and dis- criminative techniques,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:5e25b02c5e7a8d79a752382cc7fbc7fa8d58289f17ab3d8bbd73b03ffaddb162","observation_id":"3da2b60a-7be1-4598-bb26-53eee3b2f6c1","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Spiking tucker fusion trans- former for audio-visual zero-shot learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:a874dfbcfa938da38e071631dab911f846cc7170c788db84856acb21e20100cc","observation_id":"70b2dc0a-9254-43b3-89da-0204dc39aa1d","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Audio- visual generalized zero-shot learning using pre-trained large multi-modal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:358039f57ad0031986df882f139e06602e488cdc9867b9129bdd763948cab17a","observation_id":"f343b011-37cc-45a4-b789-b76f70a541bc","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Audio-visual generalized zero-shot learning the easy way,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:6bee3be4d6fc7bba46f13dd2ff0b1de71d3d8197858ac6ea73c6b622dd9d5f92","observation_id":"3b6ef146-2b3f-4e39-8d5c-9265421c2bb5","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Discrepancy-aware attention network for enhanced audio-visual generalized zero-shot learn- ing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:2e7d5c59690c4050ccd74dd40e9b086f9579d8dd618a738b8e260011669e7d68","observation_id":"58a3d039-e239-4f10-8228-e408eb613dc7","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Fusion-regularized alignment modality-adaptive audio-visual network for audio-visual zero- shot learning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:5d0bf3b6de558592b00c26776b4dee9a4dbfe7fa03b5bf636509e94fa8376e0b","observation_id":"b1f66517-45b1-4e3a-b415-0024d349a36d","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Z-score normalization, hubness, and few-shot learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:a2af7f200f3a76dcdc359137cff3c5e19bf8e820242c51781b3df95ea748dffd","observation_id":"f50ba71e-18b2-47c4-8a6b-5c24760609e0","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:8ca2b2a2432385b20d26600a86abf94be8ea8e85362e0f030c94c2428d91fce0","observation_id":"b1d40317-1968-4647-b5f6-d577c1b754b8","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Wavcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:73a29ba752d4d7eb7bef7d600637f05cb586b8aca3527933c3b86fd854fc60fa","observation_id":"05d828a6-f434-4c1c-8347-61637631926e","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Tackling uncertain correspondences for multi-modal entity alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:25ff0e48877eee457505b3202713044d8e9f894de3a2540ddcdec303c4e10e6a","observation_id":"4d8135ae-73c5-4da3-84e0-ad35475fea95","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Unialign: Scaling multimodal alignment within one unified model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:d27e268c744abafd81d5729a7cc42951b293f9e14fe0c133e4b30614224b934a","observation_id":"22b77b5c-c76d-4c97-85a9-c2d1d97125c5","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:39:37.920953Z","title":"Relational knowledge distilla- tion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:d79435d6d31ef52270a161a51030417a3cc6f4c05aa6904563b3b4bd009742d7","observation_id":"a6312b14-7efb-4631-9251-229ff764654a","resolution":{"observed_at":"2026-06-27T10:39:37.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11017","last_updated":"2024-12-17T16:27:21Z","snapshot_observed_at":"2026-08-16T13:16:41.303410Z","submitted_at":"2024-12-15T02:10:18Z","title":"On Distilling the Displacement Knowledge for Few-Shot Class-Incremental Learning","version":2},"cited_work":{"arxiv_id":"2412.11017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11017","snapshot_observed_at":"2026-07-03T08:57:47.662538Z","title":"On distilling the displacement knowledge for few-shot class-incremental learning,","venue":null,"work_id":"fa607e4d-ac95-4563-988a-fb52fe0e3dec","year":2024},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"cited_paper":"/paper/2412.11017","citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:bb390d5a552646acd84737017d75369ddd5892b4abf7d18ee65ce2a9bed05b7f","observation_id":"f54605b0-cedf-401e-ba73-e45c41f2ca84","resolution":{"observed_at":"2026-07-03T08:57:47.664025Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22197","last_updated":"2025-03-28T07:28:56Z","snapshot_observed_at":"2026-08-18T08:51:54.854798Z","submitted_at":"2025-03-28T07:28:56Z","title":"Extremely Simple Out-of-distribution Detection for Audio-visual Generalized Zero-shot Learning","version":1},"cited_work":{"arxiv_id":"2503.22197","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.22197","snapshot_observed_at":"2026-07-03T08:57:47.659947Z","title":"Extremely simple out-of- distribution detection for audio-visual generalized zero-shot learning,","venue":null,"work_id":"77ad0038-3d0e-436c-8f3a-a85acddc4f9c","year":2025},"citing_paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T10:39:37.920953Z"},"links":{"cited_paper":"/paper/2503.22197","citing_paper":"/paper/2606.11602"},"observation_digest":"sha256:2fc6f2b3efb3d85f34f12153361976c86a0d0cb5b48fd7c64cb5dab2495cc9e1","observation_id":"8ad004f7-4a2a-40d2-beff-f16e962c6e0c","resolution":{"observed_at":"2026-07-03T08:57:47.661468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.11602","last_updated":"2026-06-10T02:59:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T09:34:28.951925Z","submitted_at":"2026-06-10T02:59:13Z","title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2606.11602."}