{"as_of":"2026-08-10T01:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d7c32cde11a01553c35222ebe1713611a6da1926c168e336cabcaf3fa688cf25","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:38:17.057432Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":18,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-18T02:29:46.242983Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2310.13289"},"observation_digest":"sha256:c68a9e91ff691a14d009d9d8ed59737eacfba0e8c25373a44ec13cbfb30f9c24","observation_id":"ae54b952-a671-44b9-a4dd-944c328f4b6e","resolution":{"observed_at":"2026-05-18T02:29:46.312500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-08T15:38:17.057432Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06390","last_updated":"2025-02-11T04:42:24Z","snapshot_observed_at":"2026-08-09T09:14:59.400822Z","submitted_at":"2025-02-10T12:20:08Z","title":"When Data Manipulation Meets Attack Goals: An In-depth Survey of Attacks for VLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T15:38:17.057432Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2502.06390"},"observation_digest":"sha256:f5992bb4894027399ac59fca35a5671d467b67703590307867ac4d107a3d4e89","observation_id":"cd77a381-8ad5-4801-b6df-7d80726574a8","resolution":{"observed_at":"2026-08-08T15:38:17.057432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T15:23:01.487032Z","title":"Listen, think, and understand // arXiv preprint arXiv:2305.10790","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.487032Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:ee520139493440a4e63f6859d02bcf8eead5b6f0ba15784ce984165a9b3f8484","observation_id":"1bcd468c-9691-4cef-ad2d-f78d419acf2b","resolution":{"observed_at":"2026-08-07T15:23:01.487032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T14:33:46.290154Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18517","last_updated":"2025-05-24T05:28:22Z","snapshot_observed_at":"2026-08-09T04:18:06.978746Z","submitted_at":"2025-05-24T05:28:22Z","title":"LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:46.290154Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2505.18517"},"observation_digest":"sha256:7302440dc057debb369265329ce27a216e85e68dd1574eb0a53ebe66ea093c09","observation_id":"2dc77620-fe8f-4b0e-9d6d-95e4b0b6e9f9","resolution":{"observed_at":"2026-08-07T14:33:46.290154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T14:07:22.512637Z","title":"H., Karlinsky, L., and Glass, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-09T04:16:14.877460Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:22.512637Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:448ca9a364354cdddbc3bb8429fcba85cf62ee0a37a573bc93c894d6a64b610b","observation_id":"4ee1ee6e-52f7-4975-adb3-778e897e1cef","resolution":{"observed_at":"2026-08-07T14:07:22.512637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T12:46:43.933695Z","title":"Listen, think, and understand","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23625","last_updated":"2025-05-29T16:31:45Z","snapshot_observed_at":"2026-08-09T00:06:44.396244Z","submitted_at":"2025-05-29T16:31:45Z","title":"ZeroSep: Separate Anything in Audio with Zero Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:43.933695Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2505.23625"},"observation_digest":"sha256:405da289bf16a6638f21d5d1de8f3e35a70243a80fa0cea0eef17e4f1ee761a4","observation_id":"9f77e224-6bc4-4f47-9b94-1564d3bedd32","resolution":{"observed_at":"2026-08-07T12:46:43.933695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T10:50:52.670777Z","title":"Listen, think, and understand.arXiv preprint arXiv:2305.10790, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-09T06:09:58.091457Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.670777Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:aa6d0d4c9815929a23c6a22e4b208f5b317a79c153cea5f64491271129453146","observation_id":"b19e6aaa-7840-46aa-9110-6e641672ca3c","resolution":{"observed_at":"2026-08-07T10:50:52.670777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T05:15:46.367352Z","title":"H., Karlinsky, L., and Glass, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08524","last_updated":"2025-06-11T05:18:01Z","snapshot_observed_at":"2026-08-07T05:05:48.868065Z","submitted_at":"2025-06-10T07:42:56Z","title":"Teaching Physical Awareness to LLMs through Sounds","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:15:46.367352Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2506.08524"},"observation_digest":"sha256:4ae66f15477b256cce609bc64675d0d65d712fae4119514125a3c7df62240538","observation_id":"552328a7-1953-4cf0-8c24-8804d68a40a1","resolution":{"observed_at":"2026-08-07T05:15:46.367352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T04:54:13.382210Z","title":"Lis- ten, think, and understand,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:13.382210Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:d306e879083db372f8ec6479144ccb57ca0b05e85462af051b572e38f538d776","observation_id":"ed050362-11eb-4766-9b85-376437709e6e","resolution":{"observed_at":"2026-08-07T04:54:13.382210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T00:15:33.044745Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14973","last_updated":"2025-06-17T20:49:41Z","snapshot_observed_at":"2026-08-09T13:35:29.921830Z","submitted_at":"2025-06-17T20:49:41Z","title":"Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.044745Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2506.14973"},"observation_digest":"sha256:6cdc633e4b6763d077365f432169a85f13d06ccb3bd194109520f42eaae915f9","observation_id":"da6c1df5-b888-478a-a255-ece4e2b54297","resolution":{"observed_at":"2026-08-07T00:15:33.044745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-06T19:12:02.588908Z","title":"Listen, think, and understand","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06329","last_updated":"2025-07-08T18:33:26Z","snapshot_observed_at":"2026-08-09T00:16:14.528524Z","submitted_at":"2025-07-08T18:33:26Z","title":"MixAssist: An Audio-Language Dataset for Co-Creative AI Assistance in Music Mixing","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T19:12:02.588908Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2507.06329"},"observation_digest":"sha256:c142f6efc0b05d5feef6181ef2b599937ed13bd5c495fc466aee15a7ac179b6a","observation_id":"4862910b-5f00-43ed-aa02-27eb8444c0a2","resolution":{"observed_at":"2026-08-06T19:12:02.588908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:5d1e8892d65d22f428abe24b526401e2a27c8073dd470ad3f1fca5534deee2cf","observation_id":"74ecce0c-3ad2-4bb4-8d8d-44359d549937","resolution":{"observed_at":"2026-05-16T05:59:51.125480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T16:46:48.796047Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:48.796047Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:d5409d1f74f40c5f33a2e4a40d8247eb9bd1026f208f062c93c45d23e3c02783","observation_id":"003dd5a5-a870-433e-8397-f892f8ba0cb1","resolution":{"observed_at":"2026-08-05T16:46:48.796047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-04T17:54:57.049705Z","title":"Lis- ten, think, and understand,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.049705Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:137222ff58b0e3c424a791c0a20823b081eaeadfc736681169f1fc1ba84ba288","observation_id":"bac6bdd2-ca36-427f-a2f2-b3064ac08d97","resolution":{"observed_at":"2026-08-04T17:54:57.049705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-04T11:23:17.396777Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.396777Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:57787cc330fd110c04ef706cd80a27a1cb36c7ea249db3118131ad0b56e79c40","observation_id":"589131f7-a8e1-4d51-9804-9259c77714ec","resolution":{"observed_at":"2026-08-04T11:23:17.396777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2604.12527","last_updated":"2026-07-03T08:49:19Z","snapshot_observed_at":"2026-07-12T21:18:44.451500Z","submitted_at":"2026-04-14T10:00:39Z","title":"Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T14:10:03.707886Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2604.12527"},"observation_digest":"sha256:b849880e74b5e628337393d570243f281e4e674e7b3dc0c68da1236a8157e922","observation_id":"0c8682ac-6584-4734-bcc3-398ed0e6e7e3","resolution":{"observed_at":"2026-05-10T14:10:28.361593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-07-12T21:18:46.566338Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.12527","last_updated":"2026-07-03T08:49:19Z","snapshot_observed_at":"2026-07-12T21:18:44.451500Z","submitted_at":"2026-04-14T10:00:39Z","title":"Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T21:18:46.566338Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2604.12527"},"observation_digest":"sha256:66c509a655eaa5c0f008197d04af9b5ea07da2aebc00203abca8b551b3214c93","observation_id":"229861e9-348b-4d92-95c9-344776e2ebe3","resolution":{"observed_at":"2026-07-12T21:18:46.566338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2605.19101","last_updated":"2026-05-18T20:41:08Z","snapshot_observed_at":"2026-07-06T23:29:52.061489Z","submitted_at":"2026-05-18T20:41:08Z","title":"Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-20T07:13:29.041056Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2605.19101"},"observation_digest":"sha256:7d35f9982193e9790f9c085ee02b25040333e1ce320f265bf77a59ec9220e6b5","observation_id":"879e6f45-04f2-405d-a31d-8cc5cf3ef6a5","resolution":{"observed_at":"2026-05-20T07:18:07.291974Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2605.20519","last_updated":"2026-05-21T17:49:53Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T21:39:52Z","title":"Codec-Robust Attacks on Audio LLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-21T06:43:52.735211Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2605.20519"},"observation_digest":"sha256:b67763ef6905a06eeb181827c4c39390167d34c027ae5a2a06198ddcc732941e","observation_id":"812223e5-8250-45f0-81da-584609534252","resolution":{"observed_at":"2026-05-21T06:44:00.649442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2605.20519","last_updated":"2026-05-21T17:49:53Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T21:39:52Z","title":"Codec-Robust Attacks on Audio LLMs","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-25T05:44:46.831360Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2605.20519"},"observation_digest":"sha256:2adde90a785888345fbc2062b9ba9e2052af2f779891b99bea16983f27fa7069","observation_id":"680c47f9-08d4-44d4-b32f-47f012750bae","resolution":{"observed_at":"2026-05-25T05:45:23.640485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2606.10147","last_updated":"2026-06-08T20:26:09Z","snapshot_observed_at":"2026-08-03T03:43:21.595942Z","submitted_at":"2026-06-08T20:26:09Z","title":"From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T16:12:53.387567Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2606.10147"},"observation_digest":"sha256:62c6dc45099ca55deef1eb715d518973a43b1b32ac19b6ce8af551ad579e86ed","observation_id":"f870973a-d165-4d40-a668-bba16ed9cd2c","resolution":{"observed_at":"2026-07-03T01:57:32.387037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:2e15d0a02c91c0dc28304365558c9168244dcc05f5091508a51d3481db0f9d76","observation_id":"66c1f981-7254-4d5d-899a-28b74ca0c293","resolution":{"observed_at":"2026-06-30T22:15:05.497306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2606.18273","last_updated":"2026-06-05T11:38:30Z","snapshot_observed_at":"2026-07-06T23:53:45.117607Z","submitted_at":"2026-06-05T11:38:30Z","title":"Continuous Audio Thinking for Large Audio Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T21:52:49.839901Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2606.18273"},"observation_digest":"sha256:86ba74c6463c742f1dc8880dc926eac22839f3afb97d204fa256d283ac6d9657","observation_id":"a30199de-f6a5-4b06-947d-5661731f3b2b","resolution":{"observed_at":"2026-07-02T17:47:17.990037Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2606.25391","last_updated":"2026-06-24T04:42:57Z","snapshot_observed_at":"2026-08-04T17:58:05.494359Z","submitted_at":"2026-06-24T04:42:57Z","title":"From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-25T20:36:24.901454Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2606.25391"},"observation_digest":"sha256:fbf42157f7c1c685d15d92f9c57f7d2bc63d2b0bdc73bb34151dd789e781a83e","observation_id":"85c02625-1456-4d85-8dbf-f919989e25da","resolution":{"observed_at":"2026-07-04T20:10:07.985482Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2607.00247","last_updated":"2026-08-02T10:40:21Z","snapshot_observed_at":"2026-08-06T23:24:46.404599Z","submitted_at":"2026-06-30T22:55:22Z","title":"Adaptive Perturbation Selection for Contrastive Audio Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-02T16:59:50.615875Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2607.00247"},"observation_digest":"sha256:8e5670ce30b6c4373fbd7268d8b1ee778e1ebadf52ffc69165ee9d971f461adf","observation_id":"ce9e0568-b53f-4f2a-9712-b936fe1e0f0c","resolution":{"observed_at":"2026-07-02T17:07:12.186524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-04T04:34:50.710186Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00247","last_updated":"2026-08-02T10:40:21Z","snapshot_observed_at":"2026-08-06T23:24:46.404599Z","submitted_at":"2026-06-30T22:55:22Z","title":"Adaptive Perturbation Selection for Contrastive Audio Decoding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T04:34:50.710186Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2607.00247"},"observation_digest":"sha256:f1aa5d9fd121d4e5fb103925146b0ffe3c0486904c2a8dc1d6cad4e936b604e9","observation_id":"a95e9065-c56c-4d0a-ac26-03416fe65a3e","resolution":{"observed_at":"2026-08-04T04:34:50.710186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":"2305.10790","doi":"10.48550/arxiv.2305.10790","metadata_source":"pith","pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liu, Leonid Karlinsky, and James Glass","venue":"eess.AS","work_id":"3a0461d7-0968-4550-bb2f-3617cfd974a0","year":2023},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-09T15:40:13.197295Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:5746cea22cc5b0411f5c80e1d8a35de1e36f5a6d8348c9f6285d54dc6e30b406","observation_id":"7250104c-9e57-4d1b-890a-bd66ef6cea78","resolution":{"observed_at":"2026-07-08T00:04:22.649038Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2305.10790 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-09T15:40:13.197295Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:916794f0b392a15acecf87a4a47c15b5806810e3c9bb4f0273166f85097f9be4","observation_id":"c1c12e22-8a62-4bc5-9aac-0135690ebf68","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-01T21:22:41.155465Z","title":"arXiv preprint arXiv:2305.10790 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-09T20:04:41.256475Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:41.155465Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:6d102053b1a9af356c860420b1202fea02761a4ee505c87bfbe8ca8498176f47","observation_id":"e780d499-6b41-4c88-aca9-5acb343089f9","resolution":{"observed_at":"2026-08-01T21:22:41.155465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.10790/citation-record","integrity":"/paper/2305.10790/integrity","json":"/paper/2305.10790/citation-record.json","paper":"/paper/2305.10790"},"outbound":[],"paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 29 inbound Pith citation observations for arXiv:2305.10790."}