{"as_of":"2026-08-08T22:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bbdb11a3334a7bf5618c6be88fd911c05aa4ca5bf7dbaa0fdff737e241a5c671","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:09:57.929534Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T18:40:02.620646Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-07T15:09:57.929534Z","title":"Effi- cient training of audio transformers with patchout,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.929534Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:f53a4902538b84b0cb619ed366d0a8589943fa7bb32bd86289a7a70ec65fcbab","observation_id":"a066d024-477c-4e68-9145-818d1990d3b7","resolution":{"observed_at":"2026-08-07T15:09:57.929534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-07T01:05:44.433337Z","title":"Efficient training of audio Transformers with patchout","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12222","last_updated":"2025-06-13T20:48:46Z","snapshot_observed_at":"2026-08-07T05:03:50.906639Z","submitted_at":"2025-06-13T20:48:46Z","title":"SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T01:05:44.433337Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2506.12222"},"observation_digest":"sha256:e1ad36c84e079f2fe45a71be8db7348862dcfc72494b979e2a805e914a1ba83d","observation_id":"c4f98f10-dac5-48fe-9f54-7f3e2be380a6","resolution":{"observed_at":"2026-08-07T01:05:44.433337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-07T00:49:47.983763Z","title":"Efficient training of audio transformers with patchout,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-08T11:30:56.714691Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:47.983763Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:29d8b217605d76b3d773a727bd7841345ecac166ef7c9ba03000cdab830c9bc5","observation_id":"cc2e518c-34dc-4078-9479-835127505348","resolution":{"observed_at":"2026-08-07T00:49:47.983763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-06T23:19:50.930609Z","title":"Efficient training of audio transformers with patchout","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18729","last_updated":"2025-06-24T15:53:56Z","snapshot_observed_at":"2026-08-06T23:13:26.078242Z","submitted_at":"2025-06-23T15:08:03Z","title":"MuseControlLite: Multifunctional Music Generation with Lightweight Conditioners","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:19:50.930609Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2506.18729"},"observation_digest":"sha256:dac0fc1ee0de855bd01cb8fcd2bd69ae289dd38aca7829f2bdf47549864c8499","observation_id":"923016d2-68d7-4c8a-9f34-35fdbbf9f1cf","resolution":{"observed_at":"2026-08-06T23:19:50.930609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-06T17:57:10.542254Z","title":"Efficient Training of Audio Transformers with Patchout,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09570","last_updated":"2025-07-13T10:38:24Z","snapshot_observed_at":"2026-08-08T11:46:13.244802Z","submitted_at":"2025-07-13T10:38:24Z","title":"Enhancing Stereo Sound Event Detection with BiMamba and Pretrained PSELDnet","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:57:10.542254Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2507.09570"},"observation_digest":"sha256:090300a5b9815ae6aa742a01fae5cca6ab7159649a97b706e409b25a28ff5c4a","observation_id":"1e94711d-41dc-4b9b-b442-dfcc01a66665","resolution":{"observed_at":"2026-08-06T17:57:10.542254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-06T14:31:09.324196Z","title":"Efficient training of audio trans- formers with patchout,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19557","last_updated":"2025-07-25T07:23:41Z","snapshot_observed_at":"2026-08-06T14:31:09.110860Z","submitted_at":"2025-07-25T07:23:41Z","title":"Joint Feature and Output Distillation for Low-complexity Acoustic Scene Classification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:31:09.324196Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2507.19557"},"observation_digest":"sha256:7fc7ab8546e41c92bb74e22cd2a996391c87a2599af6d3cfea2ad5dcf6a1867a","observation_id":"4b28f4b3-37a9-4733-96e7-1918e80fea20","resolution":{"observed_at":"2026-08-06T14:31:09.324196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-06T06:04:29.895970Z","title":"Efficient training of audio transformers with patchout","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-06T20:34:36.422314Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.895970Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:a29a953e5c2d20fd8872b0dde9d6f9d0a3073794526b8691f4a8d2d052ef0262","observation_id":"a8231362-d76c-4f73-a1dc-76c8d930a7af","resolution":{"observed_at":"2026-08-06T06:04:29.895970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-05T22:54:55.028080Z","title":"Efficient training of audio transformers with patchout","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.028080Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:3dc75b9fc575e410cb6c673cd3bb6704b06a803b950680381f6635b9458afb0f","observation_id":"cc184448-28f0-4ecf-8a6c-d0a68be61084","resolution":{"observed_at":"2026-08-05T22:54:55.028080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-05T00:05:47.857768Z","title":"Efficient training of audio transformers with patchout.arXiv preprint arXiv:2110.05069, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-05T00:05:44.790684Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T00:05:47.857768Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2509.06155"},"observation_digest":"sha256:ca6591d2371701ce081b51d327bad0bf2f67b266685634c4e7c6c2c6c938ba93","observation_id":"607c1373-cf4d-4ae3-9802-db6a3ac4bef6","resolution":{"observed_at":"2026-08-05T00:05:47.857768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-04T19:27:42.788432Z","title":"Efficient training of audio transformers with patchout,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09262","last_updated":"2025-09-11T08:48:48Z","snapshot_observed_at":"2026-08-04T19:27:42.484988Z","submitted_at":"2025-09-11T08:48:48Z","title":"Adaptive Knowledge Distillation using a Device-Aware Teacher for Low-Complexity Acoustic Scene Classification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T19:27:42.788432Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2509.09262"},"observation_digest":"sha256:927b620d32a7c923460bda900b773c35d5b56696ff32093ca812adcf8aa14a54","observation_id":"547da7d8-38ba-4613-8b33-23dff43c8410","resolution":{"observed_at":"2026-08-04T19:27:42.788432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":"2110.05069","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-07-04T18:40:02.620646Z","title":"Efficient training of audio transformers with patchout.arXiv preprint arXiv:2110.05069","venue":null,"work_id":"367b8f03-931c-4dec-9dbe-45f8836037bf","year":2021},"citing_paper":{"arxiv_id":"2510.09065","last_updated":"2026-04-17T15:00:46Z","snapshot_observed_at":"2026-07-06T22:32:17.816175Z","submitted_at":"2025-10-10T07:13:06Z","title":"MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T08:20:02.986562Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2510.09065"},"observation_digest":"sha256:1485ea4eff01aa6cbdfde208fef9444af42500538310aee6abc7045dcadaca48","observation_id":"d4f56042-7847-425a-9a6b-5a373a4f283a","resolution":{"observed_at":"2026-05-18T08:21:06.847274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-03T16:25:56.830276Z","title":"Efficient training of audio transformers with patchout","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-08T08:34:03.360784Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:56.830276Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:faef69d7e3fa1aa8cdea7a143cd7c3db540ea3175774866ef66e7e62db1c3017","observation_id":"d88f42e7-2290-47d5-b122-5dc5d3a2c19f","resolution":{"observed_at":"2026-08-03T16:25:56.830276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":"2110.05069","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-07-04T18:40:02.620646Z","title":"Efficient training of audio transformers with patchout.arXiv preprint arXiv:2110.05069","venue":null,"work_id":"367b8f03-931c-4dec-9dbe-45f8836037bf","year":2021},"citing_paper":{"arxiv_id":"2601.02731","last_updated":"2026-04-29T02:44:11Z","snapshot_observed_at":"2026-07-06T22:40:46.465095Z","submitted_at":"2026-01-06T05:49:41Z","title":"Omni2Sound: Towards Unified Video-Text-to-Audio Generation","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T17:25:38.591071Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2601.02731"},"observation_digest":"sha256:4eea41d713647a3555dada1b9358cf39cec1494d47dcf8cb9cf3b2bf831a0b12","observation_id":"43296ace-ee09-4fb4-b75e-52caf66cff98","resolution":{"observed_at":"2026-05-16T17:28:10.082250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-03T04:55:13.142515Z","title":"Efficient training of audio transformers with patchout.arXiv preprint arXiv:2110.05069, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.03762","last_updated":"2026-06-24T20:18:09Z","snapshot_observed_at":"2026-08-07T11:59:20.719516Z","submitted_at":"2026-02-03T17:24:47Z","title":"Conditional Flow Matching for Visually-Guided Acoustic Highlighting","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:13.142515Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2602.03762"},"observation_digest":"sha256:26621685ced0b077a0e09f09f9394f0e2052f5fee03f44edd99c021f1b6acde4","observation_id":"4bb54ab7-7168-4529-8112-4002e8e33a81","resolution":{"observed_at":"2026-08-03T04:55:13.142515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":"2110.05069","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-07-04T18:40:02.620646Z","title":"Efficient training of audio transformers with patchout.arXiv preprint arXiv:2110.05069","venue":null,"work_id":"367b8f03-931c-4dec-9dbe-45f8836037bf","year":2021},"citing_paper":{"arxiv_id":"2602.20981","last_updated":"2026-04-15T06:35:46Z","snapshot_observed_at":"2026-07-06T22:46:53.725781Z","submitted_at":"2026-02-24T15:01:39Z","title":"Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T19:53:18.200223Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2602.20981"},"observation_digest":"sha256:0042c8e598a9d3af3009a598b2ec2e1a40cb6bd6dffdf1132c9016b2a7543d64","observation_id":"decb39f0-df24-489b-8a5c-d4fa99bd6956","resolution":{"observed_at":"2026-05-15T19:56:33.493830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":"2110.05069","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-07-04T18:40:02.620646Z","title":"Efficient training of audio transformers with patchout.arXiv preprint arXiv:2110.05069","venue":null,"work_id":"367b8f03-931c-4dec-9dbe-45f8836037bf","year":2021},"citing_paper":{"arxiv_id":"2604.15086","last_updated":"2026-04-16T14:47:24Z","snapshot_observed_at":"2026-07-30T19:59:53.380806Z","submitted_at":"2026-04-16T14:47:24Z","title":"ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T09:22:10.483263Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2604.15086"},"observation_digest":"sha256:df5b3ec572b10d719b06d6da84123419bb7bd73f1115db7d9bfacae276d085eb","observation_id":"c1577142-cf88-47c2-b439-badde0b4144e","resolution":{"observed_at":"2026-05-10T09:23:37.047377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":"2110.05069","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-07-04T18:40:02.620646Z","title":"Efficient training of audio transformers with patchout.arXiv preprint arXiv:2110.05069","venue":null,"work_id":"367b8f03-931c-4dec-9dbe-45f8836037bf","year":2021},"citing_paper":{"arxiv_id":"2605.07903","last_updated":"2026-05-08T15:42:42Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:42:42Z","title":"BeeVe: Unsupervised Acoustic State Discovery in Honey Bee Buzzing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T03:27:33.149625Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2605.07903"},"observation_digest":"sha256:c2791fbf781ca0dd56afd1e7489e76b842dce88b1698ff5a1640694739177e0d","observation_id":"d52a8f66-5a48-4a3e-b5c7-9c16034491a3","resolution":{"observed_at":"2026-05-11T03:30:55.879342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":"2110.05069","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-07-04T18:40:02.620646Z","title":"Efficient training of audio transformers with patchout.arXiv preprint arXiv:2110.05069","venue":null,"work_id":"367b8f03-931c-4dec-9dbe-45f8836037bf","year":2021},"citing_paper":{"arxiv_id":"2605.13672","last_updated":"2026-05-13T15:32:57Z","snapshot_observed_at":"2026-08-02T22:33:46.962628Z","submitted_at":"2026-05-13T15:32:57Z","title":"SpurAudio: A Benchmark for Studying Shortcut Learning in Few-Shot Audio Classification","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T20:31:49.239866Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2605.13672"},"observation_digest":"sha256:f8aa27cffe1b8ef867c6da48a7d7eebdf81623bd91839d6b2cf4913b084467c5","observation_id":"8d311385-866b-4523-b396-c7e46adc7ea9","resolution":{"observed_at":"2026-05-14T20:32:57.043063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":"2110.05069","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-07-04T18:40:02.620646Z","title":"Efficient training of audio transformers with patchout.arXiv preprint arXiv:2110.05069","venue":null,"work_id":"367b8f03-931c-4dec-9dbe-45f8836037bf","year":2021},"citing_paper":{"arxiv_id":"2605.22717","last_updated":"2026-05-21T16:54:07Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:54:07Z","title":"Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T03:24:50.604019Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2605.22717"},"observation_digest":"sha256:df470d7254f0eba026277e86db22e71d9ab28759529a732113ac601a85bf82af","observation_id":"bd50c096-80ff-447d-bcf8-12c7bf936eb8","resolution":{"observed_at":"2026-05-22T03:25:59.043307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":"2110.05069","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-07-04T18:40:02.620646Z","title":"Efficient training of audio transformers with patchout.arXiv preprint arXiv:2110.05069","venue":null,"work_id":"367b8f03-931c-4dec-9dbe-45f8836037bf","year":2021},"citing_paper":{"arxiv_id":"2606.23064","last_updated":"2026-06-22T09:13:57Z","snapshot_observed_at":"2026-08-06T08:41:01.968593Z","submitted_at":"2026-06-22T09:13:57Z","title":"STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T07:26:28.527338Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2606.23064"},"observation_digest":"sha256:e07ad670ab3a5eb50e6c0b5179f84431bc7b4dc0cff0c409ec4e9cbb08290de0","observation_id":"bcdb4ba8-a655-45f7-9fb2-02b094bf5848","resolution":{"observed_at":"2026-07-04T11:59:50.459909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":"2110.05069","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-07-04T18:40:02.620646Z","title":"Efficient training of audio transformers with patchout.arXiv preprint arXiv:2110.05069","venue":null,"work_id":"367b8f03-931c-4dec-9dbe-45f8836037bf","year":2021},"citing_paper":{"arxiv_id":"2606.24307","last_updated":"2026-06-23T08:37:15Z","snapshot_observed_at":"2026-08-07T12:00:12.881089Z","submitted_at":"2026-06-23T08:37:15Z","title":"Real-Time Interactive Music Generation via Data-Free Streaming Consistency Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-25T22:42:57.448084Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2606.24307"},"observation_digest":"sha256:375f836b9193e71c57d5367f8b938d399ee038f6f3d4072c900e3d5111005fea","observation_id":"842dbdcd-230f-4d5f-adec-9ccdaf3e1684","resolution":{"observed_at":"2026-07-04T18:40:02.622264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Effi- cient training of audio transformers with patchout,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:b1d60cc60782b8887aa05508e30f6da88e266f78ed952af66e6f407ce065f4d4","observation_id":"3f25018d-04b1-4c8d-957b-3f56b043c333","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2110.05069/citation-record","integrity":"/paper/2110.05069/integrity","json":"/paper/2110.05069/citation-record.json","paper":"/paper/2110.05069"},"outbound":[],"paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2110.05069."}