{"as_of":"2026-08-19T08:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:880538ea7d983ffb38080b395baa92b30dfd815c2d5e02b8c227bca5df4ea76a","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:21:43.256404Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:41:34.359873Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T15:41:34.547908Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"cited_work":{"arxiv_id":"2508.12918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.12918","snapshot_observed_at":"2026-08-11T15:41:34.547908Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","venue":"cs.SD","work_id":"7520e9f4-1c5c-4daf-9e06-f7e3f1da1f27","year":2025},"citing_paper":{"arxiv_id":"2608.09529","last_updated":"2026-08-10T12:31:16Z","snapshot_observed_at":"2026-08-19T06:46:05.273713Z","submitted_at":"2026-08-10T12:31:16Z","title":"Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:34.359873Z"},"links":{"cited_paper":"/paper/2508.12918","citing_paper":"/paper/2608.09529"},"observation_digest":"sha256:55867a6a9394f34b913a79d6c2c95a5ee460718b6b48b6b0c8d1b5fda2f9b98e","observation_id":"6173af98-3b2e-4a96-9062-41097d0cc30c","resolution":{"observed_at":"2026-08-11T15:41:34.554124Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.12918/citation-record","integrity":"/paper/2508.12918/integrity","json":"/paper/2508.12918/citation-record.json","paper":"/paper/2508.12918"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:44.194121Z","title":"Visual to sound: Generating natural sound for videos in the wild,","venue":null,"work_id":"eeeebdd6-7227-479c-ab48-4fac7d11704a","year":2018},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.027493Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:8c0bd0108d3a8f301b0941368b26a6997830e3d134270bfefb5f0a18404d4dba","observation_id":"634fd715-de61-4ec3-9222-fc0b42e08cb8","resolution":{"observed_at":"2026-08-15T17:21:44.200768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:44.178834Z","title":"Generating visually aligned sound from videos,","venue":null,"work_id":"3674b005-029f-4e9e-adbd-4e948e5076fa","year":2020},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.034677Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:59a1f661fe56c5085572ce694281e1cd770b4cbf8240bf1b10afc520eb081aae","observation_id":"1c25f619-bcc7-4fe7-9d59-63485da9ea69","resolution":{"observed_at":"2026-08-15T17:21:44.183376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08791","last_updated":"2021-10-17T11:14:00Z","snapshot_observed_at":"2026-08-16T17:48:41.711685Z","submitted_at":"2021-10-17T11:14:00Z","title":"Taming Visually Guided Sound Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08791","snapshot_observed_at":"2026-08-15T17:21:43.040880Z","title":"Taming visually guided sound gener- ation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.040880Z"},"links":{"cited_paper":"/paper/2110.08791","citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:e834b8c970d5808d2994a09cabdb0d9c825c7d46bb44a68ef6b8cbc34351099b","observation_id":"14d8d485-3a71-43f2-a02b-a7a4b0c4b893","resolution":{"observed_at":"2026-08-15T17:21:43.040880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:44.159171Z","title":"Diff-foley: Synchro- nized video-to-audio synthesis with latent diffusion models,","venue":null,"work_id":"9e9fb0fb-365b-4683-b29f-075fea371cf5","year":2023},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.046097Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:263e533325c41c4f63afeb09417d3a685f6cb93e5c95e85de73d8597c0b0e0f2","observation_id":"e43d8064-4de2-473f-be73-47c4f09ba2af","resolution":{"observed_at":"2026-08-15T17:21:44.169148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.051962Z","title":"Frieren: Efficient video-to-audio generation network with rectified flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.051962Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:2dba910bd3ec3942495ed78fd61dd644a997cbc34769dce74fc109725791fab8","observation_id":"37cc7545-c9ea-4137-b28d-e8dfa059c323","resolution":{"observed_at":"2026-08-15T17:21:43.051962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-15T17:21:43.057249Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.057249Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:9b1b67eea56016588a1f3f9cc4a9c6d13d139f8d0618d7157e0a7b2878c4ef9e","observation_id":"2ce1d1e6-2bc4-4162-87a2-de85026c3551","resolution":{"observed_at":"2026-08-15T17:21:43.057249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:44.132786Z","title":"V2a- mapper: A lightweight solution for vision-to-audio generation by connecting foundation models,","venue":null,"work_id":"6acaa7a0-e738-4619-9064-526bec47f838","year":2024},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.063835Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:f1d06af60e360703de4ec9b122f8a900a0f6359e0a2f01f2cf7ffab45972b009","observation_id":"dba47347-d8b9-448c-aa1d-10d3e86ba961","resolution":{"observed_at":"2026-08-15T17:21:44.139203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.069268Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.069268Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:764a5853f7c4e181ec8e1fe1f6bbd1452ef138bb972b1694cca2ed94edd838b4","observation_id":"ab791b33-c29c-48dd-a3d7-c98694753ba5","resolution":{"observed_at":"2026-08-15T17:21:43.069268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.073200Z","title":"Clap learning audio concepts from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.073200Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:f0f75abf81e0fd544f9ca6f288bc9dcdd3b34e6623bec8a86d3aaf61d30fa89d","observation_id":"b392579d-4bd6-4231-af63-b8a24d5553d8","resolution":{"observed_at":"2026-08-15T17:21:43.073200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-16T15:59:22.404915Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-15T17:21:43.078213Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.078213Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:33169b6911156a78bdd554b77b94dc83c6944d54abe75909d5eec4c1625ec2d8","observation_id":"4145e155-a408-496d-9784-c893c8cccf14","resolution":{"observed_at":"2026-08-15T17:21:43.078213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:44.090297Z","title":"Mmaudio: Taming multimodal joint training for high-quality video-to-audio synthesis,","venue":null,"work_id":"af20679f-ce6d-4b54-8cdc-d5d48e4085ac","year":2025},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.082858Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:45d713b31752a73cbc6baa128d525ffa961790400366c51a9af823eaae049135","observation_id":"a70c76f8-6cba-4d0a-9a7f-ef673a9e7e92","resolution":{"observed_at":"2026-08-15T17:21:44.095240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10522","last_updated":"2026-04-15T16:32:32Z","snapshot_observed_at":"2026-07-31T02:51:01.521373Z","submitted_at":"2025-03-13T16:30:59Z","title":"AudioX: A Unified Framework for Anything-to-Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10522","snapshot_observed_at":"2026-08-15T17:21:43.088608Z","title":"Audiox: Diffusion transformer for anything-to-audio generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.088608Z"},"links":{"cited_paper":"/paper/2503.10522","citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:5f2799e09a285f0460c7be50f1e66feaafdf42986fec9c5d1c40fa3bf03d4889","observation_id":"1e157850-3b2c-46bd-9672-6859671aeb04","resolution":{"observed_at":"2026-08-15T17:21:43.088608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.093884Z","title":"Thinksound: Chain-of-thought reasoning in multi- modal large language models for audio generation and editing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.093884Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:791dd4345b66db1998a3fe84d007191d55320c96292419f80bdf0c23a41a0d45","observation_id":"3fa8e323-1186-40fd-8084-214010a83296","resolution":{"observed_at":"2026-08-15T17:21:43.093884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:44.075767Z","title":"On our perception of the direotion of a source of sound,","venue":null,"work_id":"244808fb-b779-453e-a72a-406441a65c67","year":null},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.098196Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:ae1789093cc8b78dce1311aad722455984ee53ac2a274a1e9e9a59dee25051d9","observation_id":"b04b8288-e6b9-4f07-ae4b-ab4e6a986df2","resolution":{"observed_at":"2026-08-15T17:21:44.081235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:44.055746Z","title":"Binauralgrad: A two-stage conditional diffusion probabilistic model for binaural audio synthesis,","venue":null,"work_id":"74bdd28c-d401-4514-83f4-55228188002d","year":2022},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.102600Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:6cf284195575055ad1a6041bd6704cef1887d1a2e14b43f16e6c48f28fc37d95","observation_id":"45540763-bc2c-483f-bda9-cedcd0e7f423","resolution":{"observed_at":"2026-08-15T17:21:44.066106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06612","last_updated":"2025-07-07T17:42:19Z","snapshot_observed_at":"2026-08-18T22:48:48.285681Z","submitted_at":"2024-06-06T22:55:01Z","title":"SEE-2-SOUND: Zero-Shot Spatial Environment-to-Spatial Sound","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06612","snapshot_observed_at":"2026-08-15T17:21:43.107637Z","title":"See-2-sound: Zero-shot spatial environment-to-spatial sound,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.107637Z"},"links":{"cited_paper":"/paper/2406.06612","citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:a50e33742999ad08db96f1bcb42d6d26c377734fc5093acaae2d67a380fae57f","observation_id":"71feed8d-ad26-431e-baa4-a6dbff4ce751","resolution":{"observed_at":"2026-08-15T17:21:43.107637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:44.034453Z","title":"2.5 d visual sound,","venue":null,"work_id":"9c9b8776-eb6f-4fe5-add4-27ca2dd76ee8","year":2019},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.112550Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:cd0ec5ffe5c601be25b52fb0d183cd1a3bc872b589462f574d3545155487de54","observation_id":"b4c46e2d-4fcc-4609-8663-e2949880deb4","resolution":{"observed_at":"2026-08-15T17:21:44.040861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:44.014217Z","title":"Visually-guided audio spa- tialization in video with geometry-aware multi-task learning,","venue":null,"work_id":"4ec0de58-6a96-44a0-9ccb-9483e1f8aabb","year":2023},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.117453Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:83ce85188a53e7e97cc98b93e35d27eefea196c8db27bee82ec91769e0f6444f","observation_id":"b6e8dc6a-a3a3-4b41-9e87-03707602a641","resolution":{"observed_at":"2026-08-15T17:21:44.021922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.996886Z","title":"Visually guided binaural audio generation with cross-modal consistency,","venue":null,"work_id":"ec28b6f9-5117-4efa-bdc7-ab3b6debd8c0","year":2024},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.122580Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:a9fa78e4d7d7f40579ea1c3a48fa510215f946d76dbb1fe06724215976f7f93d","observation_id":"64cf3ee9-d638-4209-92ed-ad462cbe637f","resolution":{"observed_at":"2026-08-15T17:21:44.001856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.978424Z","title":"Cross-modal generative model for visual-guided binaural stereo generation,","venue":null,"work_id":"904029c2-b6bf-4776-b516-97d05cc984be","year":2024},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.127212Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:df4ffff37b52f12bd48e3b995d687b995bd65f15f0d4e427ef1f466b6f62449a","observation_id":"52c7a403-3bb6-4a9e-b095-6757b1f884e8","resolution":{"observed_at":"2026-08-15T17:21:43.983707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14945","last_updated":"2025-02-07T19:26:14Z","snapshot_observed_at":"2026-08-16T13:07:52.170917Z","submitted_at":"2024-10-19T02:28:53Z","title":"ImmerseDiffusion: A Generative Spatial Audio Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":"2410.14945","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.14945","snapshot_observed_at":"2026-08-15T17:21:43.468536Z","title":"ImmerseDiffusion: A Generative Spatial Audio Latent Diffusion Model","venue":"cs.SD","work_id":"d2a8f0ac-ace8-4f78-8d99-8f1c5c84e892","year":2024},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.131398Z"},"links":{"cited_paper":"/paper/2410.14945","citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:c408fb98867e97d2d5abf268f4f8649d30163442f0d9f60d21ecf124b721b199","observation_id":"ac538c02-559f-4f20-9ff7-ce1d3cf88416","resolution":{"observed_at":"2026-08-15T17:21:43.477011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11299","last_updated":"2024-10-15T05:37:22Z","snapshot_observed_at":"2026-08-18T21:16:28.160429Z","submitted_at":"2024-10-15T05:37:22Z","title":"Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11299","snapshot_observed_at":"2026-08-15T17:21:43.136060Z","title":"Diff-sage: End-to-end spatial audio generation using diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.136060Z"},"links":{"cited_paper":"/paper/2410.11299","citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:26f51963b3ac7fadaadb9233ebbbdb9a25330bda8adabb83d5802ddd7dbbbd9a","observation_id":"f461fcbf-7193-46a3-a738-86a7273a1a5c","resolution":{"observed_at":"2026-08-15T17:21:43.136060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.959184Z","title":"Visage: Video-to-spatial audio generation,","venue":null,"work_id":"c0262853-2e4c-45f6-b450-a83f0754df12","year":2025},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.141631Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:2229d390bd2e927dfa3219f23486bfcd4f4caf7572ac170184e943edab9e512b","observation_id":"216e6c86-42ad-481f-9892-a745f735b33d","resolution":{"observed_at":"2026-08-15T17:21:43.965132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14906","last_updated":"2025-06-03T03:27:47Z","snapshot_observed_at":"2026-08-17T22:53:48.202284Z","submitted_at":"2025-04-21T07:21:28Z","title":"OmniAudio: Generating Spatial Audio from 360-Degree Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14906","snapshot_observed_at":"2026-08-15T17:21:43.146268Z","title":"Omniaudio: Generating spatial audio from 360-degree video,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.146268Z"},"links":{"cited_paper":"/paper/2504.14906","citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:2ddf65df1387bc60c72477df74850a4a9939e2e2eb795568981d87684db7d132","observation_id":"bfd2d03f-b1c0-4a9c-a520-33339dbfbc99","resolution":{"observed_at":"2026-08-15T17:21:43.146268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.935691Z","title":"Yolo-world: Real-time open-vocabulary object detection,","venue":null,"work_id":"4f138498-56e8-449e-b36c-9446a0f1007f","year":2024},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.151063Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:1972fb1d33da9ec4023f380a5b90fb118912f7e13d6594d16cbcaab1d2186103","observation_id":"7e1036c8-21d4-4e82-b6e6-48612867b93b","resolution":{"observed_at":"2026-08-15T17:21:43.943830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02576","last_updated":"2026-04-23T14:21:49Z","snapshot_observed_at":"2026-08-17T03:35:45.144163Z","submitted_at":"2025-01-05T15:18:32Z","title":"DepthMaster: Taming Diffusion Models for Monocular Depth Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02576","snapshot_observed_at":"2026-08-15T17:21:43.156711Z","title":"Depthmaster: Taming diffusion models for monocular depth estimation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.156711Z"},"links":{"cited_paper":"/paper/2501.02576","citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:700573721b4d581cf7f4758df9736a546d20ff082d2bd2cbf481505757584ff0","observation_id":"947ee8dd-1e71-463a-80cc-dd061c17d3a6","resolution":{"observed_at":"2026-08-15T17:21:43.156711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09761","last_updated":"2021-03-30T19:48:38Z","snapshot_observed_at":"2026-07-06T09:57:19.117228Z","submitted_at":"2020-09-21T11:20:38Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09761","snapshot_observed_at":"2026-08-15T17:21:43.162088Z","title":"Diffwave: A versatile diffusion model for audio synthesis,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.162088Z"},"links":{"cited_paper":"/paper/2009.09761","citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:6b84d3d543a73360e66dc1682dc08ee48ebced30ab26ccc9452c1d2b2a6c36c4","observation_id":"8df860bf-3109-4351-8426-bead4cdece57","resolution":{"observed_at":"2026-08-15T17:21:43.162088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.913146Z","title":"Vggsound: A large-scale audio-visual dataset,","venue":null,"work_id":"4d578093-555c-499c-8ca3-9954aef4cc94","year":2020},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.167653Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:317bf6a2ff7e82e0139ff66d3b2115e326a05ca716d3a33ef1e8c610681f9640","observation_id":"51d1486a-3044-4d1c-b003-7a020efbe367","resolution":{"observed_at":"2026-08-15T17:21:43.924828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.898422Z","title":"The hutubs hrtf database,","venue":null,"work_id":"8726c85a-6608-4353-985b-b9601607f653","year":2019},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.173339Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:670749591614f9c6f4b4c8afb92c52463be01916a8ad6f7e1c8d98025b33cbf8","observation_id":"4ee85f91-8f27-44bd-8f61-6365124042fb","resolution":{"observed_at":"2026-08-15T17:21:43.902520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.880381Z","title":"Interpolation of head-related transfer functions,","venue":null,"work_id":"b81a01c4-fa46-493b-86d9-306fa88f3cc7","year":2007},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.177132Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:70e53ce95f6be6c3648a7fda5fbbaedfb02d7622f4eae7a3b0e02675ed91f4a0","observation_id":"327ebba4-9998-4acf-9dc1-d825a850cfb0","resolution":{"observed_at":"2026-08-15T17:21:43.887411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.862338Z","title":"gpurir: A python library for room impulse response simulation with gpu acceleration,","venue":null,"work_id":"d20c60eb-ddb3-45d8-9f00-30ff7a508a12","year":2021},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.183072Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:0d9973385a7efebe461371345fb2284ba689e803546dec8e8c711907e64dd1e2","observation_id":"09cb53e3-85a0-4d9f-a60f-ff754d0196b3","resolution":{"observed_at":"2026-08-15T17:21:43.868453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21227/m57x-cr16","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.296738Z","title":"VGGSound-Solo,","venue":null,"work_id":"e44f941b-1f2d-4dc4-9e9c-e45afd48ff97","year":2025},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.187312Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:98d9344b26fb0e61e2ee021e87cc8d54bd581bb2b13aeb3d419da1c63e96354d","observation_id":"4879aecf-5d9b-4f95-a1d6-6c4ae0b976fc","resolution":{"observed_at":"2026-08-15T17:21:43.306330Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.833838Z","title":"Image method for efficiently simulating small-room acoustics,","venue":null,"work_id":"5e764d3b-89cc-4c83-b209-28d9bafc6e88","year":1979},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.194308Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:ff2172b552b2e7a8e57c90a5ac607b598039c0b2d32a53c80dc9ea50079e3b46","observation_id":"317afbdb-f592-4f26-9ec8-00a0f368314f","resolution":{"observed_at":"2026-08-15T17:21:43.841792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.811243Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":"9e2c37f8-1591-4da3-9ac2-d2254f14338f","year":2020},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.199702Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:43cc93cdc5ce322ae87fb885c42e27c236ab233fc535375e45a51a9a7652e1ef","observation_id":"5075d5b9-e663-4e14-a36b-a1b86f80e065","resolution":{"observed_at":"2026-08-15T17:21:43.818158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.207546Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.207546Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:398c44994ff5c24c28ad09ff8a5d8e7988da95b13e2ed4f1aee77e821001e721","observation_id":"1889291e-32fe-4df7-899f-b4d126060da3","resolution":{"observed_at":"2026-08-15T17:21:43.207546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.778888Z","title":"Effi- cient training of audio transformers with patchout,","venue":null,"work_id":"f20bc5f4-832f-4ff7-a645-7d16f7d19bc5","year":2022},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.218905Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:2d54ee6eb4fe947eb80b5be2fb91e3189404bc1bc73f7e2d5fa4fec7a68e9d4c","observation_id":"22a32682-3267-40d1-bff4-a0110f0ea2cd","resolution":{"observed_at":"2026-08-15T17:21:43.783979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.758956Z","title":"Improved techniques for training gans,","venue":null,"work_id":"0ef9d376-ac14-4605-b018-e0df0454513f","year":2016},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.224501Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:053cf5896111a796fb7b1df2c6495f2f12084659d8e3e85cee4d806747198df4","observation_id":"c47ae119-6ff3-4ed3-a697-ccd8b6d11da3","resolution":{"observed_at":"2026-08-15T17:21:43.766574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.738492Z","title":"Temporally aligned audio for video with autoregression,","venue":null,"work_id":"a8ad800e-b411-4912-9c2c-bbf25dff6d63","year":2025},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.229533Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:72d63be85323b23005c6455deddaf940e84a945eff7ff81a1a13029dd37e8ec2","observation_id":"95bfd8e5-77ba-4b93-bdf7-71476b7b07c5","resolution":{"observed_at":"2026-08-15T17:21:43.745587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18952","last_updated":"2025-06-05T18:44:26Z","snapshot_observed_at":"2026-08-17T13:07:13.166363Z","submitted_at":"2025-02-26T09:01:59Z","title":"DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18952","snapshot_observed_at":"2026-08-15T17:21:43.238079Z","title":"Dualspec: Text-to-spatial-audio generation via dual-spectrogram guided diffusion model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.238079Z"},"links":{"cited_paper":"/paper/2502.18952","citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:964897302ad3b41f1fa45406b079d8de13aae9d8f898ae0ae4ecdc6b619279db","observation_id":"2f482fc7-5f0b-402b-ae2f-3db2fb57042e","resolution":{"observed_at":"2026-08-15T17:21:43.238079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.715631Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":"689d45d3-35a9-4f42-af22-a1604cdb78c6","year":2014},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.243812Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:530d5f9653503d24232ed7b5d45189fc2e39408c829697c37973f52e03e4c541","observation_id":"075c5672-fb03-446c-b4e6-e7db40dacc66","resolution":{"observed_at":"2026-08-15T17:21:43.722940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.251406Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.251406Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:ef6bb0fd0a55dbbe2773b5ff494469c3d67feb4f672d3b808dafd1b913813209","observation_id":"b9a46742-bfed-40b6-b0e0-84c4c9f2be2c","resolution":{"observed_at":"2026-08-15T17:21:43.251406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:21:43.687364Z","title":"Pyroomacoustics: A python package for audio room simulation and array pro- cessing algorithms,","venue":null,"work_id":"a4b00346-7232-46c8-a462-cd11f999fd39","year":2018},"citing_paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T17:21:43.256404Z"},"links":{"citing_paper":"/paper/2508.12918"},"observation_digest":"sha256:caafe4f5cf6e5cabde750654f52a283df76c2f4e811371271d76a31fd4fefb98","observation_id":"68a4f987-16da-4c66-b57d-f0b12f3fa4ca","resolution":{"observed_at":"2026-08-15T17:21:43.692892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.12918","last_updated":"2025-08-21T10:10:06Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-17T19:03:25.715810Z","submitted_at":"2025-08-18T13:34:10Z","title":"FoleySpace: Vision-Aligned Binaural Spatial Audio Generation"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":2,"verified_fuzzy":24},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2508.12918."}