{"as_of":"2026-08-14T14:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ab5820fe23cfb3721b034010859f7e4868db9d16663fd83878ee2b8c46ebc07","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-25T19:56:19.179019Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-25T19:56:19.179019Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T20:40:07.714022Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"cited_work":{"arxiv_id":"2606.25980","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.25980","snapshot_observed_at":"2026-07-04T20:40:07.714022Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","venue":"cs.SD","work_id":"c56c3871-81e5-4e74-99f6-16b152f54ba4","year":2026},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"cited_paper":"/paper/2606.25980","citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:96c6629f31605353ca152c38614fad65a37b2caf3a3bdc69ff5a92d3cb4fcc97","observation_id":"0d62dd12-109e-4091-832d-75333098c74e","resolution":{"observed_at":"2026-07-04T20:40:07.715322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.25980/citation-record","integrity":"/paper/2606.25980/integrity","json":"/paper/2606.25980/citation-record.json","paper":"/paper/2606.25980"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/2073587","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:40:07.719165Z","title":"Examples include footsteps, cloth movement, and object interactions such as doors opening or coins jingling","venue":null,"work_id":"71d34f71-3601-4e18-a912-113f83f68194","year":2026},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:de5f001ae4be82981d22d1e3f038d8dab126f6d31d0f40c8e4ee209e15994655","observation_id":"2199b33d-dc08-48a3-8017-0f4c534b4ab7","resolution":{"observed_at":"2026-07-04T20:40:07.720700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"cited_work":{"arxiv_id":"2606.25980","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.25980","snapshot_observed_at":"2026-07-04T20:40:07.714022Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","venue":"cs.SD","work_id":"c56c3871-81e5-4e74-99f6-16b152f54ba4","year":2026},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"cited_paper":"/paper/2606.25980","citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:96c6629f31605353ca152c38614fad65a37b2caf3a3bdc69ff5a92d3cb4fcc97","observation_id":"0d62dd12-109e-4091-832d-75333098c74e","resolution":{"observed_at":"2026-07-04T20:40:07.715322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Existing audio taxonomies therefore show overlaps and inconsistencies in how Foley and other sound categories are labeled","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:6543634dfd8284375106d2af8b659c3f855f59e4db948cd539bbc926d5d5c6b0","observation_id":"dc54000a-cba6-4fe5-b222-d89998eed155","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"All category and subcategory labels were assigned by a single annotator following the predefined taxonomy and annotation criteria","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:f630509b1898e98913543265ab0960177dd88110c81e8df7f81bf1fb14275ee2","observation_id":"40b400a8-857c-4ae1-bd5c-333b1ae1dd04","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"length 5 s) totaling approximately 9.5 hours of audio","venue":null,"work_id":null,"year":1949},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:6bd2fe76bf933156d27ba2d2b64928e2b744f434363cd0355fb797be36f9f96d","observation_id":"84c2e140-323b-43e7-ad0f-60e15ed25082","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"For both tasks, we use PaSST (Patchout Spectrogram Transformer)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:7e6dca874ba94e59e13eea422c714e722b5c4494da827f71932aa73ec529f163","observation_id":"b46b2fa8-6de1-4ab3-872d-b6eb61ecea73","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:04000208a442f34f5486f8f337b9f39cb5aecb607cb4789e7bc25b83da416ad1","observation_id":"980dbc20-6813-4745-abc7-d08c8a58064d","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"The work has two main contributions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:640d88ee37f8d1fbdec4b4034e5065d45fadf576c8058336f9c5aa4ef3430c6e","observation_id":"d6cf0262-25fd-40b8-bdd7-38d2dbc7c8fc","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"A deep learning approach to sound classification for film audio post-production,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:f75810c5a9c432e8971d06564c74df567f4ba94a307b570f927a1643a492b918","observation_id":"228ba085-0c8e-424c-ab50-96013e43c013","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Unsupervised taxon- omy of sound effects,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:495bd741004bb4c9b5638ea4d467835235d75e4adddc83d2672b0278b34e7d5b","observation_id":"3396f872-ef7c-45ef-8f75-3f521d8653f1","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Representation learning for the automatic indexing of sound effects libraries,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:f9e368e2976245dfc08697f9aa581447474286f39d7f3ab0cad38839c45fa3db","observation_id":"0977dcdc-de19-4dfc-8b67-ef6963e25443","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Soundify: Matching sound effects to video,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:409e238bc4a2d546c32b7f3437392223a09efbf71d61e8af79d5f21957a0b313","observation_id":"5eaa5805-bccf-444c-972a-f440456dc173","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Foley sound synthesis at the dcase 2023 challenge,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:49981f9beee44b7bcf854a4a4f96386c83f565e55e8bcfa0f75346f51749ab81","observation_id":"afe2763d-eafe-4cf0-9a26-f41af6cfda57","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"T-FOLEY: A controllable waveform-domain diffusion model for temporal-event-guided foley sound synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:aa4b498468694ae0cd439e4db7763d5c941c33f6dce8d542675ccb1d0a300af7","observation_id":"db3de1b2-b8a0-4ad9-ac8a-97b537f7b598","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"MambaFoley: Foley sound generation using selec- tive state-space models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:1a821fd577e13428334cbfec86d1b7675743ea3ecd72ad1135d4a529105cbb0e","observation_id":"360df4a7-91cb-4997-95b4-9b3db0b7b6fc","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Autofoley: Artificial synthesis of synchronized sound tracks for silent videos with deep learn- ing,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:1e0b3c8f4d140d6a4db0279129bd18080d942068f193ab0d0f577254b0fd1fae","observation_id":"78ae68c2-8731-4e6a-95e1-f37a48921999","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Diff-Foley: Synchro- nized video-to-audio synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:9ffa0bb32373d3fccd09b99c65058ea821111d1b1e0490a50a014988c4faa9de","observation_id":"1539d5f4-ef49-477b-9be3-92b73a0af765","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"FSD50K: An open dataset of human-labeled sound events,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:0dd334a6450ba31694dd0fdbe8b48370ac650a0cc625c76d93f51e560b7619b4","observation_id":"07e75bc1-e162-4af0-973f-2ae1973c8383","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Freesound","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:c9eb92b50b69ba5d931815762e736349275b769cb758f57158bf8a9e80119ecc","observation_id":"57cf2f15-c52c-492d-937d-b60a02ab5831","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"A dataset and taxon- omy for urban sound research,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:e19b66ba18c9e3e46293330953d3aed0ba185569c8354ab1f76c18881a9c2265","observation_id":"a2d597fc-f374-4d7a-a34c-b22d1db516ca","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"BBC Sound Effects","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:efa6f1b689ec8aef52eb6811deb458b72c0a9315027d7e3de99556d7d06609a0","observation_id":"2b690fa1-37c3-4aab-a75b-6c3d3e91ab21","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Foleybench: A benchmark for video-to-audio models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:2e1cdca3fa6038b6bab9e560a143a959192871de6caf86b76c63773969cbe9de","observation_id":"84cc4933-3aa7-41e8-8892-4a6dc5277ea9","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10591","last_updated":"2024-06-15T10:47:36Z","snapshot_observed_at":"2026-08-14T07:32:13.944621Z","submitted_at":"2024-06-15T10:47:36Z","title":"MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation","version":1},"cited_work":{"arxiv_id":"2406.10591","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10591","snapshot_observed_at":"2026-07-04T20:40:07.723696Z","title":"Mint: a multi-modal image and narrative text dub- bing dataset for foley audio content planning and generation,","venue":null,"work_id":"1bf77ec1-45a0-4eac-a6a5-a805f3c5622d","year":2024},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"cited_paper":"/paper/2406.10591","citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:bb340c5eb6d9db0eeb57a9aa8fbc435b9368738e8fc3de4b4326a7adf373f07a","observation_id":"71d4dcc1-d396-4d6c-a85f-0a59c8cd1fe5","resolution":{"observed_at":"2026-07-04T20:40:07.725321Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17198","last_updated":"2025-01-27T20:22:54Z","snapshot_observed_at":"2026-08-11T01:14:31.319001Z","submitted_at":"2025-01-27T20:22:54Z","title":"6KSFx Synth Dataset","version":1},"cited_work":{"arxiv_id":"2501.17198","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17198","snapshot_observed_at":"2026-07-04T20:40:07.716197Z","title":"6ksfx synth dataset,","venue":null,"work_id":"7ae37dac-0b20-4900-ad9b-c270b24d2f0f","year":2025},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"cited_paper":"/paper/2501.17198","citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:1ad056e30890c648d614ec91755c63cb1d6588e87f84edeade84e7bd5f6d3379","observation_id":"61e23a87-ecd2-4e6a-96ca-06e2697233e7","resolution":{"observed_at":"2026-07-04T20:40:07.717907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Au- dio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:9603f2550ef9d50cadb83d914c4e05fab1e83ee2d047c9181bbba9e1160c101a","observation_id":"5647d68f-d4f1-4361-bae4-c9a9a382912e","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3373.28063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.439749Z","title":"ESC: Dataset for Environmental Sound Classification","venue":null,"work_id":"f0670cd6-59a8-48d2-94ce-45595e02c599","year":2015},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:8832417a8caa446975e9490cd2d4f8194a4ad9b040f826324d7fc7576b34c2dc","observation_id":"b2f482f3-2ffd-4c2b-b5a4-db9835328e35","resolution":{"observed_at":"2026-07-04T20:40:07.723616Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Universal Category System (UCS) category list,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:3a09569ddeda09a33d904c2057bea09386e310ba7f93c013631d2b65e162ff40","observation_id":"fc1ee47c-6a79-4173-adfb-e1e2a7006e16","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Ventriloquial acts: Critical reflections on the art of foley,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:a68f6aaff7e956f41eb6b21af3501f5e000d321b71bb3311dc55026d3aee3077","observation_id":"6f32cc51-1cd2-4b81-9e86-35915ffb374b","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Foley sounds vs. real sounds,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:b1f19cbe38fc093bdf7bdbd2673992ae2c93bc486b3ce8c44e7f4a5ad4412361","observation_id":"2ef0aba2-6ac7-4f43-af50-e0d239e4dc5c","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"The work of an invisible body: The contri- bution of foley artists to on-screen effort,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:29a38f5fbcd7fd0626f3ee96fe0a14749bcf00e9526bceb599529993264bb8cd","observation_id":"7e388e28-a068-4997-8077-43534e57b923","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Hollywood foley fx,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:34c5fae6d40efa1de2332b803a1f4924ffacf9da69a0338bde788948d834e5c6","observation_id":"8030b7d1-b3b4-434d-8553-566a4f5190a8","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Foley sound effects,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:271c72db676bfb76a97172a875177da362a44321e44d6ddbacd150b7d45c704d","observation_id":"7cc97bb8-39ee-42c7-828d-7be6bd66c12e","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Art of foley sound effects library,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:cbbeca727297e9b9c58eb82146c95c508f97e2455c65643fea56ccd39fc35004","observation_id":"e42e20b9-12d4-4677-8aef-2cf6651a0172","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Hd – foley sound effects,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:a37f6f2435ec8ed4e11eccd0108d607a97a7e3b63fa85a7e3139a1b2a5ffbba5","observation_id":"e906800a-1440-4301-9bbe-c39197d2d56f","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Ultimate foley sound effects collection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:7a4c5809c96505819d666b1d6c0d737cb1bca4d4efc7f13ba59a54b69438cfb1","observation_id":"84eaabed-9462-49c6-a115-173b1290b804","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Fight foley sound effects,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:e8280649da2e2be41f69a4039e188a5e027ffab3aeb6de401b295c8761892c17","observation_id":"fb5ade1d-b0c4-4f85-8ebe-e095057757d6","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Foley footsteps sound effects library,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:dbe919c0f30e0b962fddab52fd5b54b6f5452bc19be63d5696af4b8d8803523a","observation_id":"5aa82711-d415-485b-b210-a890574dfb2d","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"EBU R 128: Loudness nor- malisation and permitted maximum level of audio signals,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:92b97a7f46de7abf60f85c39bb15393025b4d7b16ab4b1dda7ff0bdfcd251a99","observation_id":"38663dea-9a72-4aa5-8594-702ad243175e","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"Efficient training of audio transformers with patchout,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:2712c0a31452629718e587689b4e261ef1e06e8fbc91b166dc07c9c00754e1c6","observation_id":"2b0ced02-9ad8-44be-813f-d807ac36b4ac","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":"hear21passt: PaSST pre-trained models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:d8e7cf34b0804977e22cdc5f0abaf1d7b01390de8ccc4a1b6b7e696f3a4a912d","observation_id":"765a2880-3570-4f8f-94f8-0b25d150a547","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T19:56:19.179019Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-25T19:56:19.179019Z"},"links":{"citing_paper":"/paper/2606.25980"},"observation_digest":"sha256:d7fd7f499dbdd3729bc1a43a1651cf3573fb849ab7a5a8a56575f120cbf603b3","observation_id":"05490ac4-b4e7-45a7-8fdd-85f1d5f2e092","resolution":{"observed_at":"2026-06-25T19:56:19.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.25980","last_updated":"2026-06-24T15:51:06Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T04:16:01.773911Z","submitted_at":"2026-06-24T15:51:06Z","title":"FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":36,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2606.25980."}