{"as_of":"2026-08-21T14:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b1ded3db1b6738932fe4de49c5ae06f1f2aab3f765c99d0fc83b6ae5323c5b03","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T11:35:16.646773Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T11:35:16.646773Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T07:57:44.596905Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"cited_work":{"arxiv_id":"2606.10838","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.10838","snapshot_observed_at":"2026-07-03T07:57:44.596905Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","venue":"eess.AS","work_id":"aaaa2183-4b1a-4e4a-b22b-b93a0e649612","year":2026},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"cited_paper":"/paper/2606.10838","citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:d17c60b2974cc770074ca5a358cdfc4fb30663f26d68703a7bdfd50a9f3a4541","observation_id":"9a1743c7-d57e-4f03-85a2-1688951c6e5f","resolution":{"observed_at":"2026-07-03T07:57:44.598243Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.10838/citation-record","integrity":"/paper/2606.10838/integrity","json":"/paper/2606.10838/citation-record.json","paper":"/paper/2606.10838"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Therefore, research is shifting to- wards adaptation of pre-trained large language models (LLM) for speech recognition and understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:97d1618cb22c33eb560ca6c45ad6ea70c44b62b3a44c8b7deaccd07bb45fe854","observation_id":"acd5e373-7857-4386-bbf5-07fba0ae9dfb","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"cited_work":{"arxiv_id":"2606.10838","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.10838","snapshot_observed_at":"2026-07-03T07:57:44.596905Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","venue":"eess.AS","work_id":"aaaa2183-4b1a-4e4a-b22b-b93a0e649612","year":2026},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"cited_paper":"/paper/2606.10838","citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:d17c60b2974cc770074ca5a358cdfc4fb30663f26d68703a7bdfd50a9f3a4541","observation_id":"9a1743c7-d57e-4f03-85a2-1688951c6e5f","resolution":{"observed_at":"2026-07-03T07:57:44.598243Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"audio-only","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:b6d596084de4bf9ed6f6e4842474dac66e08e15e377652f22f4fd9a8d09fc998","observation_id":"7b8adb40-daff-40b0-aa79-2917692a0321","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"use the context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:48f68ca14f43bc9bff667d0742cb2cbe140ac593d01dc2501f3d7d3351339ddf","observation_id":"e381f047-59fc-4796-962b-7e8ea919df76","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Hence, we should not expect massive WER improvements, especially when segments are rather short","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:c2bf788c570caad6eb7720ab46c3a7f012c43c234e96645925136c465874b7e0","observation_id":"ea0d76a0-27a8-4635-a2bf-8e2a1e38a3f7","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"We also introduced a pipeline and dataset that pair metadata with contextual transcript errors and correction rationales","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:2027ea0367a273f7591795f8aec3510067f3c1db6b2ba5aab9744836d341c3ea","observation_id":"8a1e48c3-bcee-4131-a022-dd9ca0bbaba1","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:0bce4f4f09133bf6cb43c575b25d35609521edaf9e90afa2fc501a45bc9d24f2","observation_id":"f784c8bd-53c0-4df0-a516-049f0f4a5b85","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"No part of the manuscript’s content or ideas was produced by generative AI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:d129815326b7001c2e0bef6ba4c59249a5c64a328c66d45c464f5839b190ecfe","observation_id":"020b58d4-090a-4f0c-9044-9173d43025b2","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:6132cbf97671bb6fd4d6786b6b4847bcd2713c27323282dd618d000a0df35916","observation_id":"d165279a-20bc-4274-9b35-5125fdcb84b0","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"OWSM v4: Improving open whisper-style speech models via data scaling and cleaning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:ddb1c5534ca09b8c2c37985eee87b1a7854c417e0fab62580a8cf3d0608a2ff8","observation_id":"eab2204e-8c00-4b1b-a18f-9702595a57b3","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Less is more: Accu- rate speech recognition & translation without web-scale data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:6b2e8913c88da5b3f45dada0d6c3b3c40a751dfa6a2468fb867c0259f1817805","observation_id":"b4342c52-138b-495d-b4d1-540952a43f17","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Contextualized end-to-end automatic speech recognition with intermediate bias- ing loss,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:434316d2df5eb128908faecee1abc6fe79042b3df6df19f72ae2dbaa37dedd65","observation_id":"d455614f-ef5a-47f3-85ea-c30083f859f0","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"BR- ASR: Efficient and scalable bias retrieval framework for contex- tual biasing ASR in speech LLM,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:dde13b56f8c67044aa6bd90110c990f00f1d2324bdb21cfa808c766c621edb8b","observation_id":"223b4596-07f9-4cc7-abdb-33ed92d9db3f","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Contextual biasing speech recognition in speech-enhanced large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:0712d29d536845dc5e00d11f2a7a910763c8db0be061b5cfb331cb3eafc2463c","observation_id":"33b18c3a-27f2-443e-a7ee-7ed0964e4051","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Improving domain-specific ASR with LLM-generated contextual descriptions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:720768737493bc66535ab42dd656412aa0f687480baf905731f55f14fd95ab3e","observation_id":"1e4361a6-2b13-4d4a-ae45-1ba3897b0215","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"MaLa- ASR: Multimedia-assisted LLM-based ASR,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:51b3113054b791468c8b979ed23cfd9ed1a8239b67587a9b57dd1bd59299c17f","observation_id":"89c05a2f-3aad-4286-b1f4-ef00acaee108","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Contextual biasing of named-entities with large lan- guage models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:948f5dee993b46ae1dfa4f379a900c422773157e8440beb507d25fe39f3ea159","observation_id":"802a4f8d-684f-40f1-bd6f-74c85405b212","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Listen again and choose the right answer: A new paradigm for automatic speech recognition with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:cb06c73f639bd1f011a0a53520b1fed56c18ab4659911d4edd8ce7136878fa1f","observation_id":"a85f323b-93d5-4371-b69e-de5908bdb9e2","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Towards interfacing large language models with asr systems using confidence measures and prompting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:40ee8fa35a87ade8ff559d0997fd188baf52a5f1473cead2189b9c2f72bc68a7","observation_id":"3db1e8d5-4731-406e-999a-4f36eda89892","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Predicting compact phrasal rewrites with large language models for ASR post edit- ing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:583e2d18d368d304d6f8090b5b6942ec7be9685f3b0e3191d4c1825c08b4aa3d","observation_id":"87c3bb3f-1cff-4a71-8c80-5be085830b21","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Chain-of-thought prompting elic- its reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:7050be5ebeb7ca1a5502b9cf7177072d65be2d4486977fb9c39eabcb41c0334c","observation_id":"cefe8e71-cb86-42f0-8935-72eda160ebac","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:ba337ae74dafd57b71f8da9007ca779a76463e0baf7a378e318eca537f59de40","observation_id":"85227b8a-768c-43ce-aea9-730a1382386f","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Speech recognition rescoring with large speech-text foundation models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:8e601a35192fbb48d069622eb4b4f8f88ecd0ad5104e17036592c1309ccd98e5","observation_id":"a323edff-fbb5-404f-a8a7-d13e1c1228c0","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Phonetically-augmented discriminative rescoring for voice search error correction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:7865b8c386366f4475eab2493ee7891963959df07afa8f16aeefc8d93dc1fe48","observation_id":"9259eaa1-fe73-416a-898d-290458286e7b","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"SALSA: Speedy ASR-LLM synchronous aggregation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:9fbc2b9bf9c365725a95c549f2381750e5ad0bf9aeb2858c4d454d22f842a97a","observation_id":"68dde5ba-dfa9-4e03-8391-48a514d37a25","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Skip-Salsa: Skip synchronous fusion of ASR LLM de- coders,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:b442c170db6796dc164ab394904692c16ac15939de41298fce9ed205e882a1e7","observation_id":"545d17d0-bfff-41fb-acd5-a98076934f6c","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"SAKURA: On the multi-hop reasoning of large audio-language models based on speech and audio information,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:2ed3175af5df4351db4631ac93cca3310a44f95c05a3b5170615576d4f97c7f5","observation_id":"35eda3da-a87d-4dcb-8e26-e4993f24c6de","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"MMAU: A mas- sive multi-task audio understanding and reasoning benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:05145096e6567213dabc56308e28bc30dc3422abb0b763fe7b88f84f18fa4624","observation_id":"686169e5-8eb6-4272-a024-a89dfb3179e7","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07246","last_updated":"2025-01-13T11:54:40Z","snapshot_observed_at":"2026-08-16T18:04:08.829886Z","submitted_at":"2025-01-13T11:54:40Z","title":"Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model","version":1},"cited_work":{"arxiv_id":"2501.07246","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07246","snapshot_observed_at":"2026-07-03T07:57:44.602800Z","title":"Audio-cot: Exploring chain-of-thought reasoning in large audio language model","venue":null,"work_id":"a29ac5b5-b39a-4024-b423-9a8a9f536e29","year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"cited_paper":"/paper/2501.07246","citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:6467d3f64c1f0e604fd575b8d725c49154e42b7e633adb9b9794636de9b6a116","observation_id":"2017c47c-82d9-43f0-a6f4-89138b205358","resolution":{"observed_at":"2026-07-03T07:57:44.604366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Audio- reasoner: Improving reasoning capability in large audio language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:6fc2d90610979ea7320b57f1720e9bf8c2b926800890217335ee58a8cfaab2dc","observation_id":"3e6019b8-a250-4d77-9ec6-2806549b1c65","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Can large audio-language models truly hear? tackling hallucinations with multi-task assessment and stepwise audio reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:c2be283d8db713a40d920c10b0519c9f3ab954dab8e4edd3843562a400ca7347","observation_id":"1e5b62ca-2395-481a-b670-fb09cca10408","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"DeSTA: Enhancing speech language mod- els through descriptive speech-text alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:0c8fb32d77223dad800329e3b7a001a9fba8cf8f044cced0d22716fb6856d5e0","observation_id":"d3024e32-e923-4cb2-88a3-3c95211dd8d1","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"Developing instruction- following speech language model without speech instruction- tuning data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:f8a911bedc4f81c3aa4bad8e6b8ec723b0a5d7de7f6b3699db2dab3062bcb8ed","observation_id":"c695309d-20f2-4b9d-a53e-d3b0b92d4c23","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.02768","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:35:32.882924Z","title":"Desta2. 5-audio: Toward general-purpose large audio language model with self-generated cross-modal alignment","venue":null,"work_id":"610f2c2b-d9a0-4b63-8595-d0902c725b31","year":2026},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:4e88105ca29fbd111e40944fb6fa2a2a434f5b8cc29633b3dc7d96aca406de8c","observation_id":"e8599cf0-eef5-487d-8c9c-9839136ce988","resolution":{"observed_at":"2026-07-03T07:57:44.601381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"GAMA: A large audio-language model with advanced audio understanding and complex reasoning abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:414dfd9b8d98bc4f44014d14e598447d9411af35a969135cca302d48f21361b3","observation_id":"18ee4180-e07f-45d2-994d-a7e493e06cc4","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"GigaSpeech: An evolving, multi-domain ASR cor- pus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:da9a6fbb635d3a288644cd775c7334f24433fd78c1b1aa6a5aae674ab527bfdb","observation_id":"f3062b14-86a2-46f7-8d3e-ce76488ef62b","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"SlideSpeech: A large scale slide-enriched audio-visual corpus,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:35312bf58e8eeeb137d3fefc64f0c4f935c726693f1199081209ac131feeec45","observation_id":"e7320777-0e57-4ee5-a56c-f88cd74721c1","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"SlideA VSR: A dataset of paper explanation videos for audio-visual speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:4fa5c4baed8d26874493ebb57dc2e78dfd84d21cf785e810d1e9680ea396c17a","observation_id":"d8e43eff-2ebf-45a5-aa2b-efd4b4c9af5e","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"M 3A V: A multimodal, multigenre, and multi- purpose audio-visual academic lecture dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:3b502408f1e6f166ff7cf949e11d5cb2b0b6b85aa829f72492d2f42fb5e9c231","observation_id":"a955a042-d024-4580-90f4-9bbe6c244734","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"BERT: Pre- training of deep bidirectional transformers for language under- standing,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:24a25c35260d04dcb12dd579c85c9efe3ac0461b42b7472df06520d193f8441b","observation_id":"82170b27-1925-4d80-bca0-df0dbf45eda2","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:35:16.646773Z","title":"QLoRA: Efficient finetuning of quantized llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T11:35:16.646773Z"},"links":{"citing_paper":"/paper/2606.10838"},"observation_digest":"sha256:05ce1c365d693e32841626768f586b9d9a60867859bae3c6018fa04934baaf97","observation_id":"57b9fb9d-ddd8-4c1a-8e00-c663128684de","resolution":{"observed_at":"2026-06-27T11:35:16.646773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.10838","last_updated":"2026-06-09T13:26:31Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-10T01:11:49.286491Z","submitted_at":"2026-06-09T13:26:31Z","title":"Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":36,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2606.10838."}