{"as_of":"2026-08-24T01:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1aca88b34d4c926ac40f13d098e583594729acc4c4348f985c895a32ac2d459a","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:43:56.792270Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.12154/citation-record","integrity":"/paper/2505.12154/integrity","json":"/paper/2505.12154/citation-record.json","paper":"/paper/2505.12154"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.645610Z","title":"Self-supervised learning of audio-visual objects from video.European Conference on Computer Vision (ECCV), 2020","venue":null,"work_id":"c3817047-0699-465c-be0e-3f707f371d63","year":2020},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.514472Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:e425ce009b4b9e32adb4c174a7d153b25570be22d9a9825c3583d15ca1a6db9d","observation_id":"a51cb12f-4da1-434e-b5f3-bc35db7a6d7a","resolution":{"observed_at":"2026-08-15T20:43:57.648890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.634384Z","title":"Condensed movies: Story based retrieval with con- textual embeddings, 2020","venue":null,"work_id":"8cb9642f-a9ff-483b-863f-9d94b37d11e1","year":2020},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.519297Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:28ef5e524d29456c7a8c8a4bdd4619bf69c0c59f692076042ca4436abafb97b0","observation_id":"efd189c0-596a-480b-8655-4baec0512960","resolution":{"observed_at":"2026-08-15T20:43:57.637795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.622385Z","title":"Ac- tion2sound: Ambient-aware generation of action sounds from egocentric videos","venue":null,"work_id":"638a12d1-1fae-4f9c-ba71-0d1fb53952f6","year":2024},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.522620Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:f2636268ef0dc53d7e81fdc9d21c60a38858a4c07d252381b6c3903c0d2e51e3","observation_id":"4ae7a440-8f83-4193-97db-7fa0c7546888","resolution":{"observed_at":"2026-08-15T20:43:57.626421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.610025Z","title":"iquery: Instruments as queries for audio-visual sound separation","venue":null,"work_id":"c530e8d7-eb70-4f5b-a029-a7002a784f73","year":2023},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.526501Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:73cc9310fe613ec068ed6d4a14b51eb806ebb8dbf547ef8f401dd394efe59511","observation_id":"53f02eec-1e20-4b44-90aa-df0abfd222a2","resolution":{"observed_at":"2026-08-15T20:43:57.614154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.599500Z","title":"Deep cross-modal audio-visual generation","venue":null,"work_id":"edab39a4-a70f-495d-8021-a5c8825a25e3","year":2017},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.530288Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:bae3d11432412811ea095c611178e86553b17b67ea2ec5727ae5508a87e6e38f","observation_id":"0734e2fc-d2f9-4d0e-aff6-241ae8fb73b1","resolution":{"observed_at":"2026-08-15T20:43:57.602687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-15T20:43:56.533483Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.533483Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:222527131b347c683da22d53be14073c4b1aaff031881d6bead7d5b0331cca23","observation_id":"b6a8e257-6df4-4329-ad6b-3aac5c0fbaf0","resolution":{"observed_at":"2026-08-15T20:43:56.533483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.589735Z","title":"Hybrid spectrogram and waveform source separation","venue":null,"work_id":"a1d933e1-b6d6-495a-97aa-c7c1af46a6d3","year":2021},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.537629Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:e796b8c060ded55f02fef09cf68f1f2f409be5232b99a9c87afd4673af3117d0","observation_id":"f7e39f33-5a47-464d-96c6-546ecd93302e","resolution":{"observed_at":"2026-08-15T20:43:57.592847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.579448Z","title":null,"venue":null,"work_id":"e111fe47-5bda-4ac7-a6db-3f34bfeb5ec3","year":2023},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.540935Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:32277f773cfb856d980e2a4fafbc1f4c7a2af760ff6b2313909e884cabf4232e","observation_id":"707a6090-138d-412f-a9a4-d3a40e48138b","resolution":{"observed_at":"2026-08-15T20:43:57.582419Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.568132Z","title":"2.5 d visual sound","venue":null,"work_id":"5e84311b-47a4-4b8c-839d-24b680b1eb2f","year":2019},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.544175Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:b504d3528112a1c4224743d4a0eac843d4052d4d7044099f361a2a9bfa341c89","observation_id":"69ff8f18-e499-423c-aef9-456a83a10399","resolution":{"observed_at":"2026-08-15T20:43:57.571789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.556168Z","title":"Visualvoice: Audio- visual speech separation with cross-modal consistency","venue":null,"work_id":"bc97ee16-5fa2-4f55-9acd-b7d96f415b63","year":2021},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.548256Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:93a4fb53f6b2260bd6db6f939fc19715e18f49bfa5af4f600600cd6b91de0582","observation_id":"b6e9256d-c195-4a72-9fc8-23af8cf15207","resolution":{"observed_at":"2026-08-15T20:43:57.560090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.544797Z","title":"Learning to separate object sounds by watching unlabeled video","venue":null,"work_id":"c6746a64-793f-4d1c-954b-7720acce5414","year":2018},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.551644Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:ed0785f270772f1ed408cec8f22b2e86934e3fe84ed27c80beae0c9a02aa22da","observation_id":"e6c7b969-1af2-45d8-b1eb-f5019b8a7e45","resolution":{"observed_at":"2026-08-15T20:43:57.549047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.533810Z","title":"Visualechoes: Spatial visual represen- tation learning through echolocation","venue":null,"work_id":"05e1dbba-75c4-4978-bbb8-3624c03ac7a9","year":2020},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.555313Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:046e2e81d69dc67fe5d24eef76f58cbd8dbe78ae6dd70ccd8f413c4e7bf0aee7","observation_id":"f89806ec-22ee-4f94-a61a-9446c289d34e","resolution":{"observed_at":"2026-08-15T20:43:57.537485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.524197Z","title":"Geometry- aware multi-task learning for binaural audio generation from video","venue":null,"work_id":"723773bf-e51a-4e76-9f6f-d2cfdfc7d59d","year":2021},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.559422Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:ba1c9b4e6abf5ad6f7bbb726f9c1d53d363ea0907b96cf6a8c236e2bd75eeef7","observation_id":"c6f0c507-2f36-4c9d-9462-e1e5352bf898","resolution":{"observed_at":"2026-08-15T20:43:57.527645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.513320Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"191da1d4-1e6e-47cc-9dab-0b01812994f3","year":2023},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.562285Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:64f0f2f1f7a41e598a01ab2def5bc511a0e28f7b3d6949b4caf7f6a4a6902328","observation_id":"dbca678e-ff69-478e-a506-bcbb0b3a19da","resolution":{"observed_at":"2026-08-15T20:43:57.517094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.501201Z","title":"Semiautomatic visual-attention modeling and its application to video compression","venue":null,"work_id":"2b052e3e-32b9-4878-bc26-ce82711aa039","year":2014},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.565249Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:06e970dbccbf1bc7e2ff552a1a20d1a9799062070bac865c309a60c22af1bc6b","observation_id":"724abbb1-111d-4851-a1d4-656b623be8b5","resolution":{"observed_at":"2026-08-15T20:43:57.504850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.489518Z","title":"Graph- based visual saliency.Advances in neural information pro- cessing systems, 19, 2006","venue":null,"work_id":"dd23f19a-0858-42a8-936b-57a19be6920c","year":2006},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.568846Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:c55a720746c13a6a4ac30726fe50d2cc9c9e3667576cce4ac44faf1755f39008","observation_id":"6f000980-fe6e-4f15-903f-a6b14612f71e","resolution":{"observed_at":"2026-08-15T20:43:57.492813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.479075Z","title":"Discriminative sounding objects localization via self-supervised audiovisual matching","venue":null,"work_id":"68323f28-fa56-45fd-a95a-10c918d7f56f","year":2020},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.571693Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:ac61af8d5eb965a60e6b4ad01ebff780228cfac40fc1d27155ae46e4d6f2f5bc","observation_id":"d41504b6-8ad8-4cea-9780-c53e07f9cb2b","resolution":{"observed_at":"2026-08-15T20:43:57.482793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00122","last_updated":"2024-10-10T23:32:28Z","snapshot_observed_at":"2026-08-21T07:28:35.708913Z","submitted_at":"2023-07-31T19:41:49Z","title":"High-Quality Visually-Guided Sound Separation from Diverse Categories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00122","snapshot_observed_at":"2026-08-15T20:43:56.574566Z","title":"Davis: High-quality audio-visual sep- aration with generative diffusion models.arXiv preprint arXiv:2308.00122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.574566Z"},"links":{"cited_paper":"/paper/2308.00122","citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:b759cc15ae3aa85a14997c305d0dd10315bdd377eb99e0718014c75c51941a6d","observation_id":"7be17340-7ffd-4a40-82f7-391657c0bb44","resolution":{"observed_at":"2026-08-15T20:43:56.574566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13471","last_updated":"2023-03-23T17:43:11Z","snapshot_observed_at":"2026-08-18T12:57:49.118748Z","submitted_at":"2023-03-23T17:43:11Z","title":"Egocentric Audio-Visual Object Localization","version":1},"cited_work":{"arxiv_id":"2303.13471","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.13471","snapshot_observed_at":"2026-08-15T20:43:56.941591Z","title":"Egocentric Audio-Visual Object Localization","venue":"cs.CV","work_id":"91a0e3d0-50e2-4232-b9a9-3021f13ef042","year":2023},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.578357Z"},"links":{"cited_paper":"/paper/2303.13471","citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:4548169f9ed4b2c9dc5bd50e52ab08a11a43a0c83c348db40f7a93dea50b58e5","observation_id":"7d1955e9-c3f1-402e-a6a4-3f8493bd6dbb","resolution":{"observed_at":"2026-08-15T20:43:56.945592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24151","last_updated":"2024-10-31T17:09:55Z","snapshot_observed_at":"2026-08-20T15:50:16.633155Z","submitted_at":"2024-10-31T17:09:55Z","title":"Scaling Concept With Text-Guided Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24151","snapshot_observed_at":"2026-08-15T20:43:56.582004Z","title":"Scaling concept with text- guided diffusion models.arXiv preprint arXiv:2410.24151,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.582004Z"},"links":{"cited_paper":"/paper/2410.24151","citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:5b5d2751a9c352c8eca79110e8edb943fdb6ab228013f6b2d41bdf1d77831ed8","observation_id":"85336f2f-9a80-42a8-9ea3-f6db42de32cf","resolution":{"observed_at":"2026-08-15T20:43:56.582004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13083","last_updated":"2024-07-20T22:25:07Z","snapshot_observed_at":"2026-08-20T15:49:57.998982Z","submitted_at":"2024-07-18T01:05:13Z","title":"Modeling and Driving Human Body Soundfields through Acoustic Primitives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13083","snapshot_observed_at":"2026-08-15T20:43:56.585883Z","title":"Modeling and driving human body soundfields through acoustic primitives.arXiv preprint arXiv:2407.13083,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.585883Z"},"links":{"cited_paper":"/paper/2407.13083","citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:8208abc79ae0474a279e5b0d5e96c843d2d1959d3489427464b4e9cf9c31c43b","observation_id":"741c074a-9015-4618-ac23-770861379861","resolution":{"observed_at":"2026-08-15T20:43:56.585883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02154","last_updated":"2025-05-29T04:20:04Z","snapshot_observed_at":"2026-08-20T15:40:16.136244Z","submitted_at":"2025-04-02T22:03:11Z","title":"FreSca: Scaling in Frequency Space Enhances Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02154","snapshot_observed_at":"2026-08-15T20:43:56.589829Z","title":"Fresca: Unveiling the scaling space in diffusion models.arXiv preprint arXiv:2504.02154, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.589829Z"},"links":{"cited_paper":"/paper/2504.02154","citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:161b189217e99bc12735b9fa33087982ffb263187b579905172a4cd4353b0d77","observation_id":"23ea06e0-87ed-482c-9860-65a8fd1bd170","resolution":{"observed_at":"2026-08-15T20:43:56.589829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.466797Z","title":"A model of saliency-based visual attention for rapid scene analysis.IEEE Transactions on pattern analysis and machine intelligence, 20(11):1254–1259, 1998","venue":null,"work_id":"8eb53d50-302b-40ca-8d3f-c714f33f109b","year":1998},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.592902Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:7dcf95e0cd9d5f79abbcad2e9728476b2ceedb54b5a74b7018a782db2350875c","observation_id":"fbda7ce5-5822-44b2-ac39-1928ac38e497","resolution":{"observed_at":"2026-08-15T20:43:57.470855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.456127Z","title":"Vinet: Pushing the limits of visual modality for audio-visual saliency prediction","venue":null,"work_id":"974753e8-ad47-4a00-aae5-02b58ed9d5db","year":null},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.596601Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:bd9fddfeb4cbdd232426a37054f4254392565086ab4106a9fb3a21e9143e4adf","observation_id":"94133073-34b5-48c0-afb4-5977fef7089c","resolution":{"observed_at":"2026-08-15T20:43:57.459500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.445144Z","title":"Deepvs: A deep learning based video saliency prediction approach","venue":null,"work_id":"5cf8443e-ab6f-463a-ac8f-c0de60df521a","year":2018},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.600611Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:81370a04d075c8ec5aa5b546fa415df20699589a713973dbe50fd4765c020a93","observation_id":"7dd20d2a-4a2d-4c1f-b53e-fe320916bd52","resolution":{"observed_at":"2026-08-15T20:43:57.449445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03710","last_updated":"2025-06-11T01:11:56Z","snapshot_observed_at":"2026-08-22T06:18:17.667399Z","submitted_at":"2024-02-06T05:05:38Z","title":"Listen, Chat, and Remix: Text-Guided Soundscape Remixing for Enhanced Auditory Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03710","snapshot_observed_at":"2026-08-15T20:43:56.604651Z","title":"Listen, chat, and edit: Text-guided soundscape mod- ification for enhanced auditory experience.arXiv preprint arXiv:2402.03710, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.604651Z"},"links":{"cited_paper":"/paper/2402.03710","citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:4fa654819e9424c7a49a77e3f2c65436385bfd5e6f82216fdabf0086f2d9d2d8","observation_id":"80a96d51-b988-49a0-822d-3c9664759b63","resolution":{"observed_at":"2026-08-15T20:43:56.604651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.433654Z","title":"Mu- sic mixing style transfer: A contrastive learning approach to disentangle audio effects","venue":null,"work_id":"709002a5-20a0-480d-9128-d93a5f9e9e23","year":2023},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.609564Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:6ccf191e628aba4477bed185c1fa27ed5c6a83f6b4aa5936a61f9cd3121d2248","observation_id":"23f984b5-2772-4dd2-ab09-1d2effee0c11","resolution":{"observed_at":"2026-08-15T20:43:57.438056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.423258Z","title":"Efficient training of audio transformers with patchout","venue":null,"work_id":"1f454077-077a-40bd-a0aa-c4d313ce67dc","year":2022},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.612796Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:1b0341dc0e4ee50c0943c60b3f00790bedb033f692028f2ec2d6b050dee8e947","observation_id":"3287e27c-0d82-490f-ad63-dd5acad755c3","resolution":{"observed_at":"2026-08-15T20:43:57.427306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.412260Z","title":"Contextual encoder–decoder network for visual saliency prediction.Neural Networks, 129:261–270, 2020","venue":null,"work_id":"d5515e6b-2315-486a-bfd0-d7ea27e2e288","year":2020},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.615732Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:e40627fdfbf5bb67b986a3990dd8357c64fc1f5e10333606f875f3e1185bfe93","observation_id":"07bba70a-f0b2-4f80-ba63-7abe270ccec2","resolution":{"observed_at":"2026-08-15T20:43:57.415971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:56.618846Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.618846Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:b664c971d7f50e71db6fc1b02af126c2b9166ebbbc2992f1755a2394e4cdfb33","observation_id":"edf28029-4bb3-484f-aa78-11f2af63b8c4","resolution":{"observed_at":"2026-08-15T20:43:56.618846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15977","last_updated":"2023-09-27T19:50:50Z","snapshot_observed_at":"2026-08-16T14:57:04.528978Z","submitted_at":"2023-09-27T19:50:50Z","title":"Neural Acoustic Context Field: Rendering Realistic Room Impulse Response With Neural Fields","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15977","snapshot_observed_at":"2026-08-15T20:43:56.621828Z","title":"Neural acoustic context field: Rendering realistic room impulse response with neural fields.arXiv preprint arXiv:2309.15977, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.621828Z"},"links":{"cited_paper":"/paper/2309.15977","citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:439dc81ba0b11aca71cc36d91317023fba3f1a9e67fdbdb165a129772078a12b","observation_id":"9c41f0c1-cf73-4cad-a3cd-bdd9bdd1b52b","resolution":{"observed_at":"2026-08-15T20:43:56.621828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.394541Z","title":"Av-nerf: Learning neural fields for real- world audio-visual scene synthesis","venue":null,"work_id":"1140ae92-13dd-47df-ac23-1e4107792c3e","year":2023},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.625686Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:055fa11cb6112c059b782bc7425c44bb5db62b0a2803ebcbc035b59758d505c6","observation_id":"8534be2d-cf15-4240-b9f2-50dca2d259b8","resolution":{"observed_at":"2026-08-15T20:43:57.398688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.384543Z","title":"Language-guided joint audio-visual editing via one-shot adaptation","venue":null,"work_id":"b6a14a90-eb16-4e6b-9aca-8d5dc4631560","year":2024},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.629422Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:517aea407be648e319d916fdc85642390ae0fc7f65543c42cc71017fd195d7e0","observation_id":"fbd16d28-3950-4686-ad02-2abd546af6c4","resolution":{"observed_at":"2026-08-15T20:43:57.387931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.373669Z","title":"Univtg: Towards unified video-language temporal grounding","venue":null,"work_id":"e31993cb-4908-4f75-b6d2-d7ae521745b1","year":null},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.632947Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:ec5e82541214b9f0ec9f8e6ec2ab2a52e75aa0da2fd9d8f4ca889db103641af6","observation_id":"0d561870-2553-4441-baea-3fbe1ab9aa2c","resolution":{"observed_at":"2026-08-15T20:43:57.377122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-16T15:59:22.404915Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-15T20:43:56.636913Z","title":"Audi- oldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.636913Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:3c5c22d4f79634661d68fedfbf5fe0d502f26dd54a695bbce6420c47b835f230","observation_id":"c8ac7ba1-5261-47cc-a9c6-a888539a8327","resolution":{"observed_at":"2026-08-15T20:43:56.636913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.360768Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection","venue":null,"work_id":"154e19e3-41fa-47d8-9647-d8b38344489c","year":2022},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.640283Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:2207a495e55e98434651fa14e2a3abe6e6f002640110e7e0797d8139d1b72bac","observation_id":"49cbf520-a9a8-43d5-96ec-777ff50b9ea6","resolution":{"observed_at":"2026-08-15T20:43:57.365652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.349564Z","title":"Play as you like: Timbre-enhanced multi-modal music style transfer","venue":null,"work_id":"3c9bb030-cf4d-4503-9098-a86b1555d7cf","year":2019},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.643348Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:72a6543f3292eca24743b876763c59635007979fd689e4d31461a335bab062a7","observation_id":"0d3900ed-99b6-4b67-88da-b3530d474552","resolution":{"observed_at":"2026-08-15T20:43:57.352953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.338961Z","title":"Conv-tasnet: Surpassing ideal time–frequency magnitude masking for speech separation","venue":null,"work_id":"3983ad48-875a-4978-bfe1-ce56e26f2fc9","year":2019},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.646793Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:13506953fbce0a83b5b9a97c71853745748d52b0744f7cdf177e9bfd1a94fe38","observation_id":"431016d6-3d3d-42da-823d-2e78a30ad435","resolution":{"observed_at":"2026-08-15T20:43:57.342275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.328355Z","title":"Deep learning for black-box modeling of audio effects.Applied Sciences, 10(2):638, 2020","venue":null,"work_id":"4cbec230-3c22-4fb4-a149-c73cdfaca057","year":2020},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.649716Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:cb07e070874ad903bf9a7e3535b8331af844a0185f72b21843c9ed8762065b59","observation_id":"bdab03a7-f680-4d18-96ef-6e955dc90fe6","resolution":{"observed_at":"2026-08-15T20:43:57.331961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09324","last_updated":"2022-03-29T12:59:11Z","snapshot_observed_at":"2026-08-16T17:13:47.391549Z","submitted_at":"2022-03-17T13:52:58Z","title":"Localizing Visual Sounds the Easy Way","version":2},"cited_work":{"arxiv_id":"2203.09324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.09324","snapshot_observed_at":"2026-08-15T20:43:56.871677Z","title":"Localizing Visual Sounds the Easy Way","venue":"cs.CV","work_id":"ff7fbf80-9701-4e11-88b8-dd6d525cf4c2","year":2022},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.652693Z"},"links":{"cited_paper":"/paper/2203.09324","citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:be71070d3c48a766424a2a5c1e8cef45555b1db6748b6413800d9a361d82f968","observation_id":"1c1838d5-dfd6-4d6b-ad7f-76553942cffe","resolution":{"observed_at":"2026-08-15T20:43:56.875627Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.318446Z","title":"Query-dependent video representation for moment retrieval and highlight detection","venue":null,"work_id":"8dcfeb40-162a-4a1e-ab52-d686a3b364ab","year":2023},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.656659Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:19b40d8b75eb9e420175b35114402baa3f22562288c2f5205a2f532220bf8753","observation_id":"d1c98d3c-13eb-4573-993a-3fad69e861ae","resolution":{"observed_at":"2026-08-15T20:43:57.321856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.308588Z","title":"Self-supervised generation of spatial audio for 360 video.Advances in neural information processing systems, 2018","venue":null,"work_id":"c0755047-fd93-4d90-afe1-8fa8a229e26d","year":2018},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.659796Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:f367058752821229fe2d5337ca67b238f8af20ee963cd1ba429e939103ac9c95","observation_id":"d1933679-1a7b-47be-901e-1fbf8c8d2b7a","resolution":{"observed_at":"2026-08-15T20:43:57.311931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:56.662916Z","title":"Audio-visual scene analysis with self-supervised multisensory features","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.662916Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:469e98317f4163add8c6e612c3f53fd5e55bd137618dbe3e1df5d1bff4da44e1","observation_id":"5a9f839e-4a35-4ebc-a2f1-6429a22aecb7","resolution":{"observed_at":"2026-08-15T20:43:56.662916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.291490Z","title":"Visually indicated sounds","venue":null,"work_id":"80937c80-00d3-4eaf-9502-9263e86a5d91","year":2016},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.666206Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:02eb27293d872a8468fdc25eac9016547599556a5f6a4eae4a40de454d6e2073","observation_id":"e328d08e-43df-4140-8eb0-3c65150d10b9","resolution":{"observed_at":"2026-08-15T20:43:57.295557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.10125","last_updated":"2022-06-01T13:40:28Z","snapshot_observed_at":"2026-08-22T06:18:19.409963Z","submitted_at":"2022-04-21T14:22:44Z","title":"Physical Modeling using Recurrent Neural Networks with Fast Convolutional Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.10125","snapshot_observed_at":"2026-08-15T20:43:56.669576Z","title":"Physical modeling using recurrent neural networks with fast convolutional layers.arXiv preprint arXiv:2204.10125, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.669576Z"},"links":{"cited_paper":"/paper/2204.10125","citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:4157b95c2d196effe3ed4cde043b3a5c6c97aa26b848957b77088e0afd0ee2a0","observation_id":"168c549d-fd24-4996-8c6c-170a804288db","resolution":{"observed_at":"2026-08-15T20:43:56.669576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-15T20:43:56.672711Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.672711Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:d750da01ddb687bb34231237441114914a1ff2706fa3c9f00b2f1b5c2cb0a84d","observation_id":"07c0f6e1-903b-4a55-a0d8-89dfa53deb06","resolution":{"observed_at":"2026-08-15T20:43:56.672711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.281029Z","title":"Multiple sound sources localization from coarse to fine","venue":null,"work_id":"b4fc37f7-a042-415b-aa83-707d4033c269","year":2020},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.676491Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:fbd0911e8bff0c84e331c60fcfe8c37386b876583386adca9a50b283380190e1","observation_id":"1d8d05b0-b0d6-4ce7-986f-a076a02267b5","resolution":{"observed_at":"2026-08-15T20:43:57.284465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:56.680364Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.680364Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:43a7938298368df152aa81b5cbc6c50f88c0c013509705c65cd7ec0baf05137b","observation_id":"063563da-5171-437a-9c77-cc836439d59f","resolution":{"observed_at":"2026-08-15T20:43:56.680364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:56.683920Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of machine learning research, 21(140):1–67, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.683920Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:e48804b6d0071345668adb671d69219e9083f03eed872dc6b641ff7b111a88cf","observation_id":"f05f1a3c-6f88-40ab-8328-6fef90a5d6f4","resolution":{"observed_at":"2026-08-15T20:43:56.683920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.257715Z","title":"Modeling nonlinear audio effects with end-to-end deep neural networks","venue":null,"work_id":"5ce2953a-4ec2-4be3-bfdc-a9584c7b32db","year":2019},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.687835Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:e7d932b1622381b62e063a049f1ba93f97b3e732edddfc443e9e929eebe764e6","observation_id":"7638f41c-ab81-432f-b841-a17ed6e74334","resolution":{"observed_at":"2026-08-15T20:43:57.261368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.244856Z","title":"Dynamic storyboard generation in an engine-based virtual environment for video production","venue":null,"work_id":"0275e786-4eb5-4748-b699-5dbfb1490237","year":2023},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.691332Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:c17a7b86cffcb57d4a844a5395681ba51001702725ad5cb0dd677f28bc9d6c8b","observation_id":"f9226e98-9c7a-418b-b13f-196d4a7b7510","resolution":{"observed_at":"2026-08-15T20:43:57.250108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.233684Z","title":"U- net: Convolutional networks for biomedical image segmenta- tion","venue":null,"work_id":"56779aee-905c-4dae-a47f-a2f6f2a413d7","year":2015},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.694435Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:770d92e42ecaa6c55cc4faf2dbea699888ce2ff23f14a496d6b7af80f0dfb4c9","observation_id":"06ffbbbc-e9f2-4ab6-8bd5-0fce5b7d3964","resolution":{"observed_at":"2026-08-15T20:43:57.237273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.223118Z","title":"Separate and reconstruct: Asymmetric encoder- decoder for speech separation","venue":null,"work_id":"b249997e-11d1-4686-b7ce-308811c92d47","year":2024},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.698015Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:e154d45d67d5d2f3cb6a9c2353cc2d066baf59ac4018587c34012d45041af104","observation_id":"c93b2b5f-62e9-4ed8-b979-29b9b4f3d239","resolution":{"observed_at":"2026-08-15T20:43:57.226711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:56.701754Z","title":"Freeu: Free lunch in diffusion u-net","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.701754Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:5a47d1400faba7fd73e164f492e61c7af8f5888de971efb99c860aef8908088c","observation_id":"6f206bb7-7f26-4109-bee8-fabfb42f6dfa","resolution":{"observed_at":"2026-08-15T20:43:56.701754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.205311Z","title":"Steinmetz and Joshua D","venue":null,"work_id":"55088a7f-aa91-44fa-a29c-184610a48ae3","year":2021},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.705407Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:65815ee201ae2681d3332c553c38d22c7db624c614311f5f08035544a9178d58","observation_id":"36502121-6b6d-4db9-ab22-6d7caab824fc","resolution":{"observed_at":"2026-08-15T20:43:57.208937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.08759","last_updated":"2022-07-18T17:06:19Z","snapshot_observed_at":"2026-08-16T16:45:05.515245Z","submitted_at":"2022-07-18T17:06:19Z","title":"Style Transfer of Audio Effects with Differentiable Signal Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.08759","snapshot_observed_at":"2026-08-15T20:43:56.709150Z","title":"Style transfer of audio effects with differentiable signal pro- cessing.arXiv preprint arXiv:2207.08759, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.709150Z"},"links":{"cited_paper":"/paper/2207.08759","citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:c78ff76a461ffa298296e70c296d83df61b2d4612fea9f151c456a2ee088279f","observation_id":"26208ba6-5455-4d66-8fd0-39b920f92be0","resolution":{"observed_at":"2026-08-15T20:43:56.709150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.194254Z","title":"Attention is all you need in speech separation","venue":null,"work_id":"773cde41-82ee-4027-908c-26f11287cc52","year":2021},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.712576Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:df1874c38042038cc09efc2da4bdc7b025543b6dd733a91e1e62afe4b80aab5f","observation_id":"0350546e-c7a0-4146-bd0a-8a9dbf807237","resolution":{"observed_at":"2026-08-15T20:43:57.197769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.183665Z","title":"Audio-visual event localization in unconstrained videos","venue":null,"work_id":"6a81d24c-b30c-4790-aef2-204add3486c9","year":2018},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.716308Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:560d4bd8f783eefc3d409894da8e54603d3d407fc60f07ba2568921ac2b637b7","observation_id":"21aec616-cc3f-4502-87a9-638554ad89f3","resolution":{"observed_at":"2026-08-15T20:43:57.187126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.173401Z","title":"Unified mul- tisensory perception: Weakly-supervised audio-visual video parsing","venue":null,"work_id":"b330c154-80a5-400f-93ca-3bb477d44fea","year":2020},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.720114Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:5cd28b45d4a8a17aa981303448a8c545de3b915cd005bbb9012ddc2870b5fcb4","observation_id":"956420ac-a5d3-43de-be8a-05a7a83109b2","resolution":{"observed_at":"2026-08-15T20:43:57.177004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.162681Z","title":"Cyclic co-learning of sounding object visual grounding and sound separation","venue":null,"work_id":"afe9fd48-fd0b-4413-96d3-07045da7421d","year":2021},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.723508Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:5da4351b114bdbc1ddbfcd28d007a5b1aa38926e929ad2dd317d19477ba82d98","observation_id":"b1998293-151d-4492-a605-d5e121ae2904","resolution":{"observed_at":"2026-08-15T20:43:57.166104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08889","last_updated":"2024-07-11T23:06:47Z","snapshot_observed_at":"2026-08-16T13:34:56.065649Z","submitted_at":"2024-07-11T23:06:47Z","title":"Diff-MST: Differentiable Mixing Style Transfer","version":1},"cited_work":{"arxiv_id":"2407.08889","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.08889","snapshot_observed_at":"2026-08-15T20:43:56.828868Z","title":"Diff-MST: Differentiable Mixing Style Transfer","venue":"eess.AS","work_id":"e6933097-0599-4c42-8cee-19626d4e6fee","year":2024},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.726488Z"},"links":{"cited_paper":"/paper/2407.08889","citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:b14d3fec4e3e97124f0623b90ab4a69315440ed0412edfd2fcdc666eb1e1528f","observation_id":"240678ba-d242-42be-a186-a6b14e95e1c3","resolution":{"observed_at":"2026-08-15T20:43:56.834097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:56.730758Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.730758Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:d68b967a4ea44196269d26e0e4c2b9fe02be8547e4b957319c129e76c8f7b85e","observation_id":"73a6042c-3a3b-4f8e-9f2b-a6bfe96d4d65","resolution":{"observed_at":"2026-08-15T20:43:56.730758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-15T20:43:56.733736Z","title":"Audiobox: Unified au- dio generation with natural language prompts.arXiv preprint arXiv:2312.15821, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.733736Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:b452ac9d62640e4ab6cd851d96771337a02ab3b5b49c624097426450de6ec622","observation_id":"e82070b1-dc75-47cd-8e42-a328bcf9458e","resolution":{"observed_at":"2026-08-15T20:43:56.733736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.144982Z","title":"Lave: Llm-powered agent assistance and lan- guage augmentation for video editing","venue":null,"work_id":"f1cc29e7-f183-4dc3-bb1f-68af552fd139","year":2024},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.736927Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:b753846a2b38d73708fac7e7a674d7ade5fa8307ab1c44b932004fcef4c76ec5","observation_id":"588209f5-3e04-4bd8-969f-c3d9dbd5a46a","resolution":{"observed_at":"2026-08-15T20:43:57.148137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.133881Z","title":"Re- mastering divide and remaster: A cinematic audio source separation dataset with multilingual support","venue":null,"work_id":"80ce86af-b650-46d7-b4bc-2e0f95ae8292","year":null},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.739997Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:8a13545a599e7fd6de519acbee7a85bcb06e9e13b1ed69784d26cda0aa671346","observation_id":"2c7b2960-a070-4896-873e-d5ce0e1b6b3c","resolution":{"observed_at":"2026-08-15T20:43:57.138080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.123376Z","title":"Seeing and hearing: Open-domain visual-audio generation with diffusion latent aligners","venue":null,"work_id":"6ed0127f-3c18-4a1a-bd97-d8d91b38306e","year":2024},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.742881Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:abcddb76652d47fe1c07759816a0b4686f989825313660f8c913e059d3045a25","observation_id":"5f9369f9-e204-4661-b1de-1db0971b3ade","resolution":{"observed_at":"2026-08-15T20:43:57.126835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.112184Z","title":"Visually informed binaural audio generation without binaural audios","venue":null,"work_id":"ea673c1d-093f-4c05-a268-ba46a2d1c191","year":2021},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.746460Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:95c556f1c1fac5ac0daa39985a5f0ca38180d40cb3fad75575e6efa6c5e50101","observation_id":"39e53fed-cf3b-47f2-bb7d-3ea808ac5f13","resolution":{"observed_at":"2026-08-15T20:43:57.116273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.099915Z","title":"Parallel waveform synthesis based on generative adversarial networks with voicing-aware conditional discrimi- nators","venue":null,"work_id":"7275ca47-3b17-4ef7-86f0-812e5ba5ea6c","year":2021},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.750477Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:460d2126055a46f83ba5a5e8b771297185f353339edc233b1d01d9f530a3b577","observation_id":"ba62b237-6e36-4e89-a921-933173a54bc0","resolution":{"observed_at":"2026-08-15T20:43:57.103980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.087794Z","title":"Don’t separate, learn to remix: End-to-end neural remixing with joint optimization","venue":null,"work_id":"98f3823f-36ff-4c29-af59-bd0ebdb7562d","year":2022},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.754003Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:05724d729c9cd84caba3b39d05da28e34aa3e2e64c3f2950ebde31e79a7e389d","observation_id":"58100920-6946-4136-8f85-3a21f59bbebb","resolution":{"observed_at":"2026-08-15T20:43:57.091200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:56.757729Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.757729Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:854ce44aac251e627592837d0c9a5f92132d876439070cb4c2ad6d39e22cbc17","observation_id":"1fdaf460-d2cd-4561-816d-67b5374b9ab1","resolution":{"observed_at":"2026-08-15T20:43:56.757729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.071795Z","title":"The sound of pixels","venue":null,"work_id":"7a60f1d4-e216-4bdb-94b4-2fd1f8121e06","year":2018},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.761397Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:aed002e424e7dcedc15b32e210775557e176f85f1bd9328ffa6963a52007b533","observation_id":"76347d0f-2d62-4dd0-bf79-94fbd0648e83","resolution":{"observed_at":"2026-08-15T20:43:57.075481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.061364Z","title":"github.io/VisAH/) to illustrate our method and show- case our results.We strongly encourage readers to visit this webpage and use headphones","venue":null,"work_id":"3b90b870-acc7-4dc9-a19a-fb11ad1a7e57","year":null},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.764301Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:21c96a8cc528234642f60fe27c1df2673abc2b5ed3a9fb5d14967644d9307b65","observation_id":"415e7205-2712-4e0b-82de-4fba7e2ef488","resolution":{"observed_at":"2026-08-15T20:43:57.064682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.051424Z","title":"Here, we provide case studies to illustrate the conditions under which such failures occur","venue":null,"work_id":"d9d874bf-94b2-4d3d-b276-9f505ecdf0db","year":null},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.768303Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:d4928606ff92b3d0ac50ebcbdd7249d01655ffb76642cbb2d5e4997f2a682250","observation_id":"0a7cf33a-e181-407f-b6ec-d94281377909","resolution":{"observed_at":"2026-08-15T20:43:57.054799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.040952Z","title":null,"venue":null,"work_id":"085f2194-f402-454f-8dd7-670307b7ee5a","year":null},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.771662Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:05732497116df83063993fdce0e25aafcb18e8d5b4deecd52170eb09a1be887f","observation_id":"94548f8d-8eca-4427-99a0-eee2e9a3e3da","resolution":{"observed_at":"2026-08-15T20:43:57.044369Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.029090Z","title":"As illustrated in Fig","venue":null,"work_id":"353c3ccd-4c48-4723-95e5-f9307aee41b8","year":null},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.774632Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:b2c6f9466834e4b67fc933f70f21561746d85003df282dc189385b6ca3a39671","observation_id":"cabe2c01-cf69-4541-9555-05bdb35bd001","resolution":{"observed_at":"2026-08-15T20:43:57.032536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.018521Z","title":"The MR-STFT loss is implemented by computing theℓ1 distance between the am- plitude spectrograms of the predicted signalˆsand the ground truth signals","venue":null,"work_id":"0bd1a8c0-0bb4-4715-8075-1637ae138831","year":null},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.777714Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:ea00732425841aabf30c077f93bfbc926afe033c6f839c1a78b011b09359084c","observation_id":"2ef2ea07-7f12-4c1f-98b1-4422d3d36c6f","resolution":{"observed_at":"2026-08-15T20:43:57.021947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:57.007144Z","title":"a dark, elegant outfit","venue":null,"work_id":"b1a27553-142c-456c-bb60-ecac8dca1623","year":null},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.781104Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:6890784a995e592b9534b73bca8e0706be23b1981a03ef6f5ba641c72b2bd300","observation_id":"c3c7a137-52bd-4382-ae78-2c65293b09dc","resolution":{"observed_at":"2026-08-15T20:43:57.010808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:56.995143Z","title":"While our method requires more time, it remains efficient for practical applications","venue":null,"work_id":"20a6e5d1-9efe-4fb5-a533-f4f31db38839","year":null},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.784741Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:f258bd2600322a3c057cd5c83e85afc0ee156d1407ea252fb92a5c374779e18a","observation_id":"f4be45b9-2dbe-4033-8b72-8c5670f5ae98","resolution":{"observed_at":"2026-08-15T20:43:56.999109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:56.985074Z","title":"12 across differ- ent levels of dataset difficulty, as discussed in Sec 5.3.2 and shown in Tab","venue":null,"work_id":"6dcd4fe1-32cf-4b52-8af0-7c8e8c96cca0","year":null},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.788803Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:1f7f02cd1f3434052bbb5e132229df749ff971b57f29e6716c836aba91f2270c","observation_id":"ad2d3e47-8658-4e39-8e88-954984990296","resolution":{"observed_at":"2026-08-15T20:43:56.988438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:43:56.974631Z","title":null,"venue":null,"work_id":"01abc986-3c7c-4a73-bb00-e247c6c4a85a","year":null},"citing_paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T20:43:56.792270Z"},"links":{"citing_paper":"/paper/2505.12154"},"observation_digest":"sha256:b81d6085a1ccf146fa27168bdbc8b66dfc1f50755d89fc04207a724f49da09e8","observation_id":"61a0208a-99d0-4bc1-984b-f29713def338","resolution":{"observed_at":"2026-08-15T20:43:56.977948Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.12154","last_updated":"2025-05-17T22:03:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T15:50:18.086392Z","submitted_at":"2025-05-17T22:03:57Z","title":"Learning to Highlight Audio by Watching Movies"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":3,"verified_fuzzy":55},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2505.12154."}