{"as_of":"2026-08-09T12:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6f26ca27fe9a5664b48b40b1557fda46438d4a23511514309a0192e900e8c05f","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:40:26.157629Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:28:48.510861Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T19:12:07.238377Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04476","snapshot_observed_at":"2026-08-07T11:28:48.510861Z","title":"Adiff: Explaining audio difference using natural language","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:48.510861Z"},"links":{"cited_paper":"/paper/2502.04476","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:c90e28b7262ce3dfd75a059750c5061326dce9ecd277326d46cc2da1d6e1d583","observation_id":"aceb2984-3db4-4261-9616-02507bf01c93","resolution":{"observed_at":"2026-08-07T11:28:48.510861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04476","snapshot_observed_at":"2026-08-07T10:17:46.418856Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10019","last_updated":"2025-06-06T11:09:46Z","snapshot_observed_at":"2026-08-08T16:55:23.964977Z","submitted_at":"2025-06-06T11:09:46Z","title":"A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:46.418856Z"},"links":{"cited_paper":"/paper/2502.04476","citing_paper":"/paper/2506.10019"},"observation_digest":"sha256:766b380bc3d188cb314d31199a8fe9ff1db306a65b042e32e28cacdfd03a6775","observation_id":"1936ce45-52aa-4d17-bf6c-9eaf66ce0390","resolution":{"observed_at":"2026-08-07T10:17:46.418856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"cited_work":{"arxiv_id":"2502.04476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.04476","snapshot_observed_at":"2026-08-06T19:12:07.238377Z","title":"ADIFF: Explaining audio difference using natural language","venue":"cs.SD","work_id":"cf2e60dd-d09f-4744-8aa7-1ab76f667157","year":2025},"citing_paper":{"arxiv_id":"2507.06329","last_updated":"2025-07-08T18:33:26Z","snapshot_observed_at":"2026-08-09T00:16:14.528524Z","submitted_at":"2025-07-08T18:33:26Z","title":"MixAssist: An Audio-Language Dataset for Co-Creative AI Assistance in Music Mixing","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:12:01.787842Z"},"links":{"cited_paper":"/paper/2502.04476","citing_paper":"/paper/2507.06329"},"observation_digest":"sha256:46ceb59d5275efe39c0eeb3474ea21942998077f5482bad4e6c4a62293393a58","observation_id":"97cf3465-2f7c-466e-885c-9a779fc7eaa6","resolution":{"observed_at":"2026-08-06T19:12:07.296957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04476/citation-record","integrity":"/paper/2502.04476/integrity","json":"/paper/2502.04476/citation-record.json","paper":"/paper/2502.04476"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:25.847277Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.847277Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:f1a6292303327f7553a4153579f4a531cc5af566ed652087be154427098149c6","observation_id":"9b48841a-6c0f-453b-b57a-75b117973ebc","resolution":{"observed_at":"2026-08-08T22:40:25.847277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.793772Z","title":"Getting vit in shape: Scaling laws for compute-optimal model design","venue":null,"work_id":"a159e301-b726-4002-b480-6409ec6cbaa7","year":2024},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.853389Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:24b36a865dac5cd6ef4b4745185c6359447bb3eef94d9a389a959c81b162c2f7","observation_id":"22469d2e-87e4-4c30-af75-7f4bafb529c3","resolution":{"observed_at":"2026-08-08T22:40:27.798472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.778680Z","title":"Spice: Semantic propositional image caption evaluation","venue":null,"work_id":"81f84097-b0f2-4b43-8832-40d14bf9424b","year":2016},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.858087Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:1c9a7b064354a03fd88ed4be016986d81bba4f998871109e980f4aac10675a53","observation_id":"3182d79d-073c-4234-886f-a0b8b13277bf","resolution":{"observed_at":"2026-08-08T22:40:27.783679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.763772Z","title":"METEOR : An automatic metric for MT evaluation with improved correlation with human judgments","venue":null,"work_id":"8d824e79-ce83-463c-9b64-d92ab143d794","year":2005},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.865805Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:4f19ea567796c95a82c5f2a62fed7517fd5d89ac09ed5abcafb5b435e6d1e6b4","observation_id":"a4f7567f-4375-41f4-af7e-4a13897be366","resolution":{"observed_at":"2026-08-08T22:40:27.767958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-08T22:40:25.870623Z","title":"Paligemma: A versatile 3b vlm for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.870623Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:19fb911123dde65a0e06fd72c0cfa04b43c91a80aca8f366ea81aa93c26ebfd7","observation_id":"211752ad-a296-4b7c-9bca-249d42484cee","resolution":{"observed_at":"2026-08-08T22:40:25.870623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-2257","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:26.255049Z","title":"Selm: Enhancing speech emotion recognition for out-of-domain scenarios","venue":null,"work_id":"fe7d5a00-cecd-4ec0-88b3-31e2a1ec01e5","year":2024},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.875537Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:060687eaa3d36c2b5b34fde1be6ed2ac9883d865b7c031dcf502e6f2d403d6f7","observation_id":"6b195f82-ac43-4b5d-a65e-f46f804eb9d4","resolution":{"observed_at":"2026-08-08T22:40:26.259570Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.750166Z","title":"Audio quality assessment techniques—a review, and recent developments","venue":null,"work_id":"d4bf339e-9f6b-488f-b5e5-6add14eb4446","year":2009},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.880510Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:d16c3cc1c75b64eb6d41e38dd92cd40a51a7b89aff7b2bfb666b0ac835c88682","observation_id":"a2f4ae70-1ccb-4dad-8caa-d228ed5cf4d1","resolution":{"observed_at":"2026-08-08T22:40:27.754434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.736082Z","title":"Hts-at: A hierarchical token-semantic audio transformer for sound classification and detection","venue":null,"work_id":"4e4dc909-7ecb-4255-869b-f8708bf7630b","year":2022},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.885456Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:8f9cc8dd605202f0cd66db2c1faeffd98dcb7646aea6183767a4bcc3936d8f9a","observation_id":"c156397e-419f-4024-85ef-95d5055d2982","resolution":{"observed_at":"2026-08-08T22:40:27.740547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-08T22:40:25.889755Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.889755Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:a7ee323ec577186dc2c473c1aed7c41632e1d1d929883bf7acb7a91c01b4734a","observation_id":"2e54e352-653f-47f8-bb6b-edce2e3f3c7a","resolution":{"observed_at":"2026-08-08T22:40:25.889755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.722108Z","title":"Pengi: An audio language model for audio tasks","venue":null,"work_id":"1b8b7680-69a8-47f6-8d42-edd87347bcb0","year":2023},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.894405Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:50476220701c943c6b9099850fa083e33339eed853d598ba5822a5ce7bddf47f","observation_id":"646f3069-7740-4295-ba76-49001678b1b1","resolution":{"observed_at":"2026-08-08T22:40:27.726491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:25.898652Z","title":"Audio Retrieval with WavText5K and CLAP Training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.898652Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:9f666de45d46ae2cd0060e1ba680359d0baaeedf258eb887704d8028ec913cdd","observation_id":"9c489b94-280a-4e2c-9dc2-8ca8ec8cdfc0","resolution":{"observed_at":"2026-08-08T22:40:25.898652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:25.903434Z","title":"Pam: Prompting audio-language models for audio quality assessment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.903434Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:f0e95a3c43543fd19708b61356e39c2ad26895b43410b55ceffae1bf7cb0811c","observation_id":"400897e4-5812-4823-bff3-3ad20e4676e4","resolution":{"observed_at":"2026-08-08T22:40:25.903434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18062","last_updated":"2024-07-25T14:17:56Z","snapshot_observed_at":"2026-08-09T11:26:54.015185Z","submitted_at":"2024-07-25T14:17:56Z","title":"Audio Entailment: Assessing Deductive Reasoning for Audio Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18062","snapshot_observed_at":"2026-08-08T22:40:25.912138Z","title":"Audio entailment: Assessing deductive reasoning for audio understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.912138Z"},"links":{"cited_paper":"/paper/2407.18062","citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:cd8b80c5b376aea1430917d7a56a23ef3c4dc6c00b8c124288943d755567376a","observation_id":"4abf38a1-108b-4ffe-b47d-21fb429e4bc7","resolution":{"observed_at":"2026-08-08T22:40:25.912138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-41","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:26.220733Z","title":"Domain adaptation for contrastive audio-language models","venue":null,"work_id":"1637bde1-5314-4688-8fc9-d0bea11f303a","year":2024},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.916764Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:e7775cad351f812dde7e46877d36757c5ca486cdd9d490d674a0defb42a9b6fc","observation_id":"f3e44766-a8a7-4457-b81c-6116a4cb5688","resolution":{"observed_at":"2026-08-08T22:40:26.225279Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.708041Z","title":"Automated audio captioning with recurrent neural networks","venue":null,"work_id":"9010b911-caf2-4178-87ef-d0cdea54710e","year":2017},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.925095Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:137af467bdcc6548faed6637e4b927b5232e4cf5660a353402341c442a4a468d","observation_id":"e167ca20-ddec-4085-ac54-beb23d60b09b","resolution":{"observed_at":"2026-08-08T22:40:27.712572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.084348Z","title":"Clotho: an audio captioning dataset","venue":null,"work_id":"8e224499-bc84-4544-93f4-4004372a55ad","year":2020},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.929302Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:6b70283737c6a7f7b000236f1f145f092a0bab7ccac76e53426cb90eed1d06a4","observation_id":"e98c71dc-6f5e-4296-b97e-d85f0bf64096","resolution":{"observed_at":"2026-08-08T22:40:27.090329Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:25.933591Z","title":"Clap learning audio concepts from natural language supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.933591Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:4ee8fb76b0b1a503909a72fdbfedc186d49bab4887d88bd3defbb1f7978a926f","observation_id":"9df2d0b1-07f1-439a-bc77-ccd1d3671679","resolution":{"observed_at":"2026-08-08T22:40:25.933591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.684030Z","title":"Natural language supervision for general-purpose audio representations","venue":null,"work_id":"1e8509ca-5f20-4635-8a27-83f950efe66e","year":2024},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.938080Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:ad4c6855eae4e599a64817717f68d48029034f7775d494068237202196a51a8d","observation_id":"85c3e55a-2f65-47ab-b226-5360e2625853","resolution":{"observed_at":"2026-08-08T22:40:27.688645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:25.942337Z","title":"Fsd50k: an open dataset of human-labeled sound events","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.942337Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:99fceba003de428917437c5f1070eb01b00c5d93d34e54c24de5e1168f9a760a","observation_id":"117f560f-8cbe-4943-bae9-bb1e892573c1","resolution":{"observed_at":"2026-08-08T22:40:25.942337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:25.946631Z","title":"Gemmeke, Daniel P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.946631Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:151731691fb8ece7b7f76519af8d6c32e359d9fdf134d80c418bbd9f00128caa","observation_id":"bf32190f-e38f-4606-9f2a-c8bb0dbb9f05","resolution":{"observed_at":"2026-08-08T22:40:25.946631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-08T22:40:25.950869Z","title":"Gama: A large audio-language model with advanced audio understanding and complex reasoning abilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.950869Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:74221d4c1bc731529074b269184605f5f010d1bfbc76d9b47518358dabab7787","observation_id":"c0617f60-88eb-4658-89b5-6cd0b76d2cf5","resolution":{"observed_at":"2026-08-08T22:40:25.950869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.658783Z","title":"Compa: Addressing the gap in compositional reasoning in audio-language models","venue":null,"work_id":"815e6ab4-5533-4bd2-88d3-1886c6631157","year":2024},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.955699Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:c1ebd9589b8854c72f62a377f4317a49c93d4e6a3c16d340c12c8868a3fd7036","observation_id":"3e2429e1-f8d7-4bcf-a645-aa8f97baface","resolution":{"observed_at":"2026-08-08T22:40:27.663548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.644370Z","title":"Joint audio and speech understanding","venue":null,"work_id":"ee5f9416-41c3-49fc-a92e-abdaedf0b7f1","year":2023},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.959780Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:d52efcee118ed7e74b8425d93633cd9c51c0801a5bc60b534dd985d4a0fc4b5d","observation_id":"d95d4d87-eb38-4820-8e89-48e3dbaf16ef","resolution":{"observed_at":"2026-08-08T22:40:27.648939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.629776Z","title":"Liu, Leonid Karlinsky, and James R","venue":null,"work_id":"586d2c0b-8567-435c-a0ab-c47ae62d7be9","year":2024},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.964199Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:a6cb2e4327290238e82532fe362951c50d659e4895e8fb5b294b4f3c480556c1","observation_id":"60ada09a-9b23-4dca-9221-478d5821ca12","resolution":{"observed_at":"2026-08-08T22:40:27.634434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.615085Z","title":"Clip4idc: Clip for image difference captioning","venue":null,"work_id":"c276149f-8751-4ac9-acea-d7e7208d7627","year":2022},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.968411Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:bf76de94e02ae2876b6c9d848ab84bb93e3f742a21f342fa34d26096d476f337","observation_id":"0fa94c8d-612c-45e9-8ed0-fd9d42a86019","resolution":{"observed_at":"2026-08-08T22:40:27.619797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2302.09719","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:26.953669Z","title":"Heller, Benjamin Elizalde, Bhiksha Raj, and Soham Deshmukh","venue":null,"work_id":"3761632a-d574-4f26-b2a4-94acd0748048","year":2023},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.972792Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:043ecab9d884843ef79d447b7aa8897732ccc9d442850a3b042d2303b1b2cb3f","observation_id":"efe20142-1389-4633-8b71-e5baddffd82e","resolution":{"observed_at":"2026-08-08T22:40:26.960895Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.600073Z","title":"Training compute-optimal large language models","venue":null,"work_id":"f9a6f60e-ecb1-4d5d-8038-429ac5bfe7a4","year":2022},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.976835Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:b6e296ab90bc53a1068721479a581809db51facaf91c7d60c9d436abf6dc0f44","observation_id":"15988846-ea06-40a3-9f20-4c47d2874d8b","resolution":{"observed_at":"2026-08-08T22:40:27.604807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:25.980953Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.980953Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:98c87d165806de91c7637524be6038165d2615f03062ec65775799af04a16bd1","observation_id":"f4376b1b-401e-4ba3-be4d-6afeb2cafe46","resolution":{"observed_at":"2026-08-08T22:40:25.980953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:25.985308Z","title":"Learning to describe differences between pairs of similar images","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.985308Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:6180ffe0cb72c5246385e6b8a611d10e6ac310462fed76017dbef7d990e921c1","observation_id":"2297d55e-3536-4197-8d43-451eaaf10104","resolution":{"observed_at":"2026-08-08T22:40:25.985308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.576701Z","title":"Acoustic and auditory phonetics","venue":null,"work_id":"d2620747-2a25-474d-9853-6bf645f524c8","year":2004},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.989730Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:32b9166423add2ed5fc0a6747d7605ec8ab4f823bf0796ea9b55b9daedbe4507","observation_id":"da759e54-0ac9-448b-b7c3-ec1b1d2316ab","resolution":{"observed_at":"2026-08-08T22:40:27.581001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.562245Z","title":"Deductive reasoning","venue":null,"work_id":"5f55f014-0896-4ec0-b312-a15bba39d1fa","year":1999},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.993960Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:a8ff274da936f8bb7588dd7153e9446fe4da1d4e7090be65ba89da4cd48405a6","observation_id":"478f2a89-9134-4063-9c3c-016a1cf2ee85","resolution":{"observed_at":"2026-08-08T22:40:27.566972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-08T22:40:25.998134Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.998134Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:e3075f7e82b5ae1a979057a36d4149ecceea5cde89e4ebf7e0d42db9d3f84202","observation_id":"d676bbb7-0d52-4e41-9c18-00d0e8ed64fe","resolution":{"observed_at":"2026-08-08T22:40:25.998134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.547401Z","title":"AudioCaps: Generating Captions for Audios in The Wild","venue":null,"work_id":"a9803964-eb2d-40db-8628-3e327f557960","year":2019},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.002871Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:ba3120ad632f8a34f05c319bf9b30ad0cd3cf362cd538dacd2747c97d699232f","observation_id":"e217a7d3-cf79-44a3-9687-7f2851cad396","resolution":{"observed_at":"2026-08-08T22:40:27.552222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-08T22:40:26.007244Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.007244Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:c83b40c3fa42ce94502cef3ffcdbba2310cf784eff9523e458d1d4b32f5e8f44","observation_id":"a218f7da-772e-477a-a637-1ff59cfcab33","resolution":{"observed_at":"2026-08-08T22:40:26.007244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.533810Z","title":"Audio retrieval with natural language queries: A benchmark study","venue":null,"work_id":"9188d88d-66f4-4b32-995e-1c7c94c2a7be","year":2022},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.011742Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:725a1d1cb3951ecd682fb0f3ed856676b7d7658fd6e0dae0a5f1f2baa2a7c1ef","observation_id":"2553c111-5dd3-4839-8e55-222eaf552465","resolution":{"observed_at":"2026-08-08T22:40:27.538191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.520801Z","title":"Audio flamingo: A novel audio language model with few-shot learning and dialogue abilities","venue":null,"work_id":"b72686a0-36f9-45ea-a77c-17201422161a","year":2024},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.019830Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:ca0855fa5c88cd54f4712cf138c2ed164dc6cbeec048d8d4018b3ab9c21a6af9","observation_id":"1cd7dbcc-d41b-4288-baef-a9662a65e6d6","resolution":{"observed_at":"2026-08-08T22:40:27.524843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8869.12888","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:26.836360Z","title":"Digital audio forensics: a first practical evaluation on microphone and environment classification","venue":null,"work_id":"4a191f0f-294d-495a-9aa7-49124d465e5a","year":2007},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.024034Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:c2bc5d727f32e3c6aa4c0a826af209d22e098f72b0d58ada2f782481b20a1a3b","observation_id":"c0ce7e19-fe0a-4873-acd7-97fb6c2d2ae8","resolution":{"observed_at":"2026-08-08T22:40:26.844147Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.507179Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":"aa57207e-a4e5-4735-bbe9-f50865c8ec7f","year":null},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.028209Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:7a48beea6ccaa91d19e3fc4195a60580539160821d9477ac85eacb80823fdfbf","observation_id":"b388490f-25eb-4608-9fd5-71afe3bd2f50","resolution":{"observed_at":"2026-08-08T22:40:27.511501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-1076","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:26.193350Z","title":"Understanding sounds, missing the questions: The challenge of object hallucination in large audio-language models","venue":null,"work_id":"37bc4d06-3206-4b48-82d8-88e8acdba482","year":2024},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.032524Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:f413a0cc66ae97f27808aa973483c2457aa8a944067859fb427fa988eb027fb7","observation_id":"a13066a4-e9f4-4cdc-bae1-9b7b1be7f8f7","resolution":{"observed_at":"2026-08-08T22:40:26.200276Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:26.036963Z","title":"Clotho-aqa: A crowdsourced dataset for audio question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.036963Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:5a04657d7ffc60e4e31249f14bc56dc4ea1af9fd2db41c3fad1d48e28cd37455","observation_id":"2ef30c04-b77c-4d80-b6a0-b9cccf821b30","resolution":{"observed_at":"2026-08-08T22:40:26.036963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.492804Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"cf9abbfd-4e5a-4a76-a64c-fa2ecfa78805","year":2023},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.041398Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:83d128af1995d62ef4bb45a8617860eca1c62baef9f67e77fc3b059b9dbdbf7c","observation_id":"439949ec-7a75-41d3-b2a2-89cf996f6618","resolution":{"observed_at":"2026-08-08T22:40:27.497356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.477990Z","title":"Improved image captioning via policy gradient optimization of spider","venue":null,"work_id":"9339c69b-468c-4526-b46c-f2c488d54675","year":2017},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.045697Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:1c7ea1bfcd69686732f6ffcb05d1fee26a96f0e51c287397ab00887d0748e422","observation_id":"1957f0d7-8389-4118-8a89-cff98c696da8","resolution":{"observed_at":"2026-08-08T22:40:27.482504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2008.93108","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:26.669691Z","title":null,"venue":null,"work_id":"f769d1d3-35e2-4238-8b17-4c7d2c59b8b0","year":2009},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.049830Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:7f2e7a2ce41c89ab80062e6b5185da1a9cac23a307bd2fe4cea90ea6ebc77ebd","observation_id":"de25405b-8187-4cb4-beae-f8128b59dde7","resolution":{"observed_at":"2026-08-08T22:40:26.678668Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.461629Z","title":"Automated audio captioning: An overview of recent progress and new challenges","venue":null,"work_id":"2eaeeefe-5870-463d-9fee-bc378339f4a0","year":2022},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.054009Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:b07a25e64d2c6c104bc1e2ef396d5fbc2a45acf1ea1ae2cf0b762a17d5b5340a","observation_id":"8fb10fba-90b6-4da9-80c6-f03405677ace","resolution":{"observed_at":"2026-08-08T22:40:27.467200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.445236Z","title":"Diverse audio captioning via adversarial training","venue":null,"work_id":"7dc8f8e4-bccc-46bd-b3f1-76b229a18431","year":2022},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.058365Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:fb742e574a85bf21703a7d90295f1dfb0ef6c9769fc39ed40e36fa00d4ec8b35","observation_id":"806d8eb2-2ff4-4031-b4ce-7062e8ff3170","resolution":{"observed_at":"2026-08-08T22:40:27.450989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.428267Z","title":"Towards generating diverse audio captions via adversarial training","venue":null,"work_id":"cc6f3db0-95ce-420b-8e7c-40f745ee5ec2","year":2024},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.062641Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:232db163d100997ac1b9929788bf4d306d691fa8e8761e1305cd1e1e4c9a2a85","observation_id":"7026ab62-d8d1-4435-a88e-f6ba4dd2400b","resolution":{"observed_at":"2026-08-08T22:40:27.433992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:26.066886Z","title":"Plumbley, Yuexian Zou, and Wenwu Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.066886Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:0fb39a84ef026f7ec1096bf9817c3d5f105c84a752a1dcac949d4e590ea38d29","observation_id":"e84060fd-f5b7-4092-a53b-af18ca16ac6e","resolution":{"observed_at":"2026-08-08T22:40:26.066886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-08T22:40:26.071258Z","title":"Clipcap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.071258Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:24589da6ef6c6a9323c91449743ba53183c65a6fbbdc3a4da7dde4fc91e532d9","observation_id":"5236dadf-4852-4991-8817-d122aa7d8f9b","resolution":{"observed_at":"2026-08-08T22:40:26.071258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.412263Z","title":"Diversity and bias in audio captioning datasets","venue":null,"work_id":"b124968a-bde7-4609-a189-3181264c0ed9","year":2021},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.076195Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:fa91d93cdf489e15a5acf0b60aadb9efe74cdac35a2cc5e7556f84725491ce9f","observation_id":"96103ec6-861b-43b8-95e8-f200c9d660b7","resolution":{"observed_at":"2026-08-08T22:40:27.418020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09774","last_updated":"2024-01-18T07:50:07Z","snapshot_observed_at":"2026-08-08T14:40:01.471920Z","submitted_at":"2024-01-18T07:50:07Z","title":"On the Audio Hallucinations in Large Audio-Video Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09774","snapshot_observed_at":"2026-08-08T22:40:26.080330Z","title":"On the audio hallucinations in large audio-video language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.080330Z"},"links":{"cited_paper":"/paper/2401.09774","citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:8a2978267cfe1a221099571d8c7ba69fe6cafa083c1877fdcbcd28f52fbe3be4","observation_id":"33e0debe-e788-4feb-86ea-003d9f9f5388","resolution":{"observed_at":"2026-08-08T22:40:26.080330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:26.084813Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.084813Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:26f7e50e07b72835a837dc24ce0cf40c3aa59c22abeaab679336a512f4633120","observation_id":"8eb14dbe-4f4c-4bd5-a58d-496414828426","resolution":{"observed_at":"2026-08-08T22:40:26.084813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.387531Z","title":"Robust change captioning","venue":null,"work_id":"69b6e856-19b0-49a0-97cf-98c0bcd9ab49","year":2019},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.089162Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:104500d4f897416f83b533df4416bb57090d982165cb68dd7e4f0c3f7edb4767","observation_id":"09858cef-9d95-4f5b-83bb-ee6cf5478676","resolution":{"observed_at":"2026-08-08T22:40:27.392941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:26.093356Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.093356Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:ddfcb76c8415a9e94bb7f24ae9d8fd7de5b6ded57a1af4092e2dbe2738ea2b2e","observation_id":"f5b8dc08-8daf-4645-8df1-c926c1144dd5","resolution":{"observed_at":"2026-08-08T22:40:26.093356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-08T22:40:26.097426Z","title":"Scaling language models: Methods, analysis & insights from training gopher","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.097426Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:f3a52069d6ffebd2fc2b3004edd9c8388e4a05652c18214b59ff9ce2d043550c","observation_id":"fee5dd68-f9b9-472f-806e-0103bcca5156","resolution":{"observed_at":"2026-08-08T22:40:26.097426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.362154Z","title":"Acoustic phonetics, volume 30","venue":null,"work_id":"31361956-738d-41b3-91f3-8e8b8b9891f0","year":2000},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.101787Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:ed64c8530e0b59e40c77d04d9177bca34a75f93c9a96d06ed3a764c96120b025","observation_id":"bcd93b80-6872-4fb8-932b-3f4ca73328d5","resolution":{"observed_at":"2026-08-08T22:40:27.367637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.345546Z","title":"Audio difference captioning utilizing similarity-discrepancy disentanglement","venue":null,"work_id":"75cc6f86-56c7-45ad-a9e4-2d9a495ab481","year":2023},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.106037Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:feb3f2b9bdabfd75521f95cd58ca43bcbe9f2dd3bfdafd2f914dbb6da49bf5d8","observation_id":"9cc831c7-c9cc-4502-ab69-c576fa1ebffd","resolution":{"observed_at":"2026-08-08T22:40:27.351899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:26.110428Z","title":"Extending large language models for speech and audio captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.110428Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:d6c2cc15c184621a3a37440cd07ffd1376ca253d3a318462034f5cb97fafda2e","observation_id":"13cb819c-e4a3-4cbd-8452-abd914c08621","resolution":{"observed_at":"2026-08-08T22:40:26.110428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.328722Z","title":"SALMONN : Towards generic hearing abilities for large language models","venue":null,"work_id":"7a0b2660-e85c-427e-b314-4b650dfe9525","year":2024},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.114441Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:3514a0ca44126f21b9c56952c0cdfaa2c823e471c1560e2691cfc6afdef72104","observation_id":"b4938af6-a8bb-464f-ab9b-f02c2cb5efdb","resolution":{"observed_at":"2026-08-08T22:40:27.334277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2002.80056","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:26.460730Z","title":"Tzanetakis and P","venue":null,"work_id":"78715e46-fb6e-43d3-bdfd-f93597cac164","year":2002},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.118620Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:86c611591af0b4d70ff36769657217e80e413dce94448db5788e8ed47b3cc28e","observation_id":"965bd9a9-cc83-4345-bfcb-3fcc3b9990a4","resolution":{"observed_at":"2026-08-08T22:40:26.468134Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.309990Z","title":"Cider: Consensus-based image description evaluation","venue":null,"work_id":"1e9bdd6e-13b7-449f-a237-608d275380dc","year":2015},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.122607Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:58fa6bdf0178408620ba347d4c660753d7d2052f7f2c8aa15bb0411be5586f22","observation_id":"a4459a2d-ab10-49d0-ae9a-a9b11a8b33b4","resolution":{"observed_at":"2026-08-08T22:40:27.315538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.294184Z","title":"Beats-based audio captioning model with instructor embedding supervision and chatgpt mix-up","venue":null,"work_id":"8d921bce-be27-4d91-bc12-73382567eec8","year":null},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.126797Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:f3a5cea521df770de76760b7999c2c3f7b80bba7d9098bf26b6940be9aa5a227","observation_id":"b4eb0bf4-1abe-40b6-af8a-813348c697ae","resolution":{"observed_at":"2026-08-08T22:40:27.299550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.278157Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"1e637703-f51e-4265-8bf8-e62a016a2a94","year":2023},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.131122Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:e4728a84ed63185189677771583960f203f55ce4d5fae207d0b3ff195e043602","observation_id":"b7630099-b4c1-491c-b35c-13ab3aca2395","resolution":{"observed_at":"2026-08-08T22:40:27.283826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.262023Z","title":"Image difference captioning with pre-training and contrastive learning","venue":null,"work_id":"064d9111-7c33-40cb-8f04-e069cac34c23","year":2022},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.135100Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:776e2ab2b69aee970cfeca95dfbe2ad0a299b0c1098579f61123df66beb23bf9","observation_id":"febee63c-35b8-423f-b8af-607bdb290feb","resolution":{"observed_at":"2026-08-08T22:40:27.267320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:27.238804Z","title":"Pre-training language models for comparative reasoning","venue":null,"work_id":"e028efa6-2119-4ca0-9f5f-2d3484c05f87","year":2023},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.139230Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:de23dafcd19c5af8bb5f97ad2063ea2062366bbd569955879e942439288da65c","observation_id":"dd0e0ac3-3aec-4830-bb65-d61fe57f0891","resolution":{"observed_at":"2026-08-08T22:40:27.251015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02148","last_updated":"2021-10-05T16:24:19Z","snapshot_observed_at":"2026-08-03T11:37:17.942207Z","submitted_at":"2021-10-05T16:24:19Z","title":"NaRLE: Natural Language Models using Reinforcement Learning with Emotion Feedback","version":1},"cited_work":{"arxiv_id":"2110.02148","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.02148","snapshot_observed_at":"2026-08-08T22:40:26.363746Z","title":"NaRLE: Natural Language Models using Reinforcement Learning with Emotion Feedback","venue":"cs.CL","work_id":"3ef2c8cb-c54a-4dfd-bd86-44e2679b63f2","year":2021},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.143516Z"},"links":{"cited_paper":"/paper/2110.02148","citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:00f3fc3452a02b1e1c92c3db2a400cfaa017f801d954564f62a71952101a0e27","observation_id":"1fda5dd7-caa2-47a3-b3a1-5f4a0fa709f4","resolution":{"observed_at":"2026-08-08T22:40:26.368889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:26.148096Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.148096Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:646ed8aa06c852fc2ffb99415dac9e6f183f6d35b3ba99c94672d39a810cd719","observation_id":"a76c2d0c-01c4-49e8-a3df-26c952f5f910","resolution":{"observed_at":"2026-08-08T22:40:26.148096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:26.152867Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.152867Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:9542e7cd17084bf537db867c271344f8a6c4e625c0a69c2cf935f3370a37ecdd","observation_id":"835026b5-32b0-4b7a-859b-071a2e393de6","resolution":{"observed_at":"2026-08-08T22:40:26.152867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:40:26.157629Z","title":"or ``caption the second audio","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:26.157629Z"},"links":{"citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:b3cbabb35381b6bf56adc9206595d6c1243768650bf0222bc3fa39a5996cc421","observation_id":"a4d37c76-28ef-46c8-a52d-8186c2769fe2","resolution":{"observed_at":"2026-08-08T22:40:26.157629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":25,"verified_exact":6,"verified_fuzzy":34},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 3 inbound Pith citation observations for arXiv:2502.04476."}