{"as_of":"2026-08-15T07:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:886b8a80ccb8034e8e7aa4f361d69e7cdb773d2113b5160bfdeff21d2d8263ab","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:10:45.928589Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:10:45.795060Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T10:40:51.433210Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08633","snapshot_observed_at":"2026-08-07T05:10:45.795060Z","title":"transcription","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.795060Z"},"links":{"cited_paper":"/paper/2506.08633","citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:d794baf6eecbb1f87ed9a33a9aa07f480b2391df7b63386d85e63e8a849ae6cb","observation_id":"97c0d8d2-6fbc-4f53-ae99-79fe19afd233","resolution":{"observed_at":"2026-08-07T05:10:45.795060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"cited_work":{"arxiv_id":"2506.08633","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08633","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Approaching dia- logue state tracking via aligning speech encoders and LLMs","venue":null,"work_id":"a3f379bb-a756-4487-b189-3e233c724291","year":2025},"citing_paper":{"arxiv_id":"2601.20898","last_updated":"2026-01-28T09:50:34Z","snapshot_observed_at":"2026-07-06T22:43:21.411174Z","submitted_at":"2026-01-28T09:50:34Z","title":"Reducing Prompt Sensitivity in LLM-based Speech Recognition Through Learnable Projection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T10:37:56.416600Z"},"links":{"cited_paper":"/paper/2506.08633","citing_paper":"/paper/2601.20898"},"observation_digest":"sha256:6bf242a921ab4abc89820890d0fa14fbc193218719ed4261dd50a7459e22efb9","observation_id":"a41ef3f2-56dd-4669-999b-90d20a1402cc","resolution":{"observed_at":"2026-05-16T10:40:51.435345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08633/citation-record","integrity":"/paper/2506.08633/integrity","json":"/paper/2506.08633/citation-record.json","paper":"/paper/2506.08633"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.377700Z","title":"book-restaurant","venue":null,"work_id":"70551494-b0e3-4db8-aa45-8d17a3b3d4ed","year":null},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.789990Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:8e84a434c65d282604316c0e1eae5592dad6ea69ddde9392841326c4a114c9b9","observation_id":"0bc859d3-d0d3-4056-9e5b-7351eb843369","resolution":{"observed_at":"2026-08-07T05:10:46.381548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08633","snapshot_observed_at":"2026-08-07T05:10:45.795060Z","title":"transcription","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.795060Z"},"links":{"cited_paper":"/paper/2506.08633","citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:d794baf6eecbb1f87ed9a33a9aa07f480b2391df7b63386d85e63e8a849ae6cb","observation_id":"97c0d8d2-6fbc-4f53-ae99-79fe19afd233","resolution":{"observed_at":"2026-08-07T05:10:45.795060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.366574Z","title":null,"venue":null,"work_id":"cde0920f-f65b-4677-bb9a-f67a49914bf0","year":2000},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.799204Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:8b735ae0ffb501d0ede1f89b23ed077705d9dde522a2de8367f2445f6c688bcd","observation_id":"b78d5723-1558-4052-a949-71c1906a62f0","resolution":{"observed_at":"2026-08-07T05:10:46.370266Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.353721Z","title":"dialogue history","venue":null,"work_id":"3fee341e-1246-4aa6-ad9b-cab8381df112","year":null},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.802913Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:aea8882a4f2a17711e94b0d29531a7ed0c51da9ad1e0c262a9666b3f05437ffd","observation_id":"c0693c05-0409-44d1-aa1f-b067c49c481a","resolution":{"observed_at":"2026-08-07T05:10:46.358233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.341643Z","title":null,"venue":null,"work_id":"08c66bfc-14fd-430d-8169-ddf8954e557e","year":null},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.806951Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:f73a1b4942b67e9c9f8085911d61330e7f43666ba4589666f90c4a5cfddf242a","observation_id":"7424e8ab-47fa-49da-b3e8-a428a320ebbc","resolution":{"observed_at":"2026-08-07T05:10:46.345460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.328799Z","title":"First, we observe that fine-tuning on the original Spoken- WoZ transcripts yields worse results than when using Whis- per transcripts, which are of higher quality","venue":null,"work_id":"28dff4ee-aa1e-4d01-981d-0b6e958bac89","year":null},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.810565Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:a292687f95fd29b393e1f4cbada62a0c701ff9520decfc88b39aeac79ba545cc","observation_id":"7248e32d-a210-48ad-b836-be1562a452f8","resolution":{"observed_at":"2026-08-07T05:10:46.333365Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.317661Z","title":null,"venue":null,"work_id":"ad57903b-562e-4459-b214-18f0a38028b1","year":null},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.814291Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:7e3264c7deb27501572242806e364daebd677abac2567b1b1b8a5c4b88e8f8f5","observation_id":"fd2957ef-7c02-49ea-9b9d-b142673df282","resolution":{"observed_at":"2026-08-07T05:10:46.321116Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.305516Z","title":"SEP-210943216 ”ELOQUENCE”, Euro- pean Defence Fund project ARCHER, Czech Ministry of In- terior project No","venue":null,"work_id":"7109c686-8a6c-452a-ab73-00616eb60fa6","year":null},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.817660Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:33ff04c0099fe9b49f5344e610d0b3e72c806227f1c7b43ff4080e5d9ea79801","observation_id":"11b19a0e-bd26-44a3-ac9f-f41d3b21c29c","resolution":{"observed_at":"2026-08-07T05:10:46.309909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.294044Z","title":"DSTC-11: Speech Aware Task-Oriented Dialog Modeling Track,","venue":null,"work_id":"e103f009-8d23-4146-80f7-4927b2910508","year":2023},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.822084Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:077952c8c886e66d0520ca5c3799cf7075c5c1e20f5f48620f6822ea7c7147aa","observation_id":"57c8faa5-ccc4-4000-9fea-146ab1934586","resolution":{"observed_at":"2026-08-07T05:10:46.298089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.281967Z","title":"SpokenWOZ: a large-scale speech-text benchmark for spoken task-oriented dialogue agents,","venue":null,"work_id":"d13bd79f-789a-4eb8-aae3-cdeb39e4c752","year":2023},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.826236Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:3810d1bcd15d8e46930b3df5d0eb394b809d9461707bed992f3eacf7313017a6","observation_id":"9f2ce2c7-bb58-453b-bd46-98b3c121bab2","resolution":{"observed_at":"2026-08-07T05:10:46.286343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.270178Z","title":"Speech-Aware Multi-Domain Dialogue State Generation with ASR Error Correction Modules,","venue":null,"work_id":"c5e4b84f-9261-4246-b572-7cf0bd6222d1","year":2023},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.830525Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:c9ff095e36d87205a5f58b8e88d17290986234217b6082fcddee6f26f2df5171","observation_id":"594d67a5-6a57-4fc9-81b8-0605624c0f4f","resolution":{"observed_at":"2026-08-07T05:10:46.274074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.257148Z","title":"Retrieval Augmented End-to-End Spoken Dialog Models,","venue":null,"work_id":"fcb19d05-6a2b-4bea-95dc-195f5028a56b","year":2024},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.834648Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:a7ea8fdaa9dd7d2da83c6ae44a9c773380990b69ef9bd0470511186478a6a07b","observation_id":"db5ee594-2828-4bc3-bc50-2763da4329ac","resolution":{"observed_at":"2026-08-07T05:10:46.261504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.244135Z","title":"MAESTRO: Matched Speech Text Represen- tations through Modality Matching,","venue":null,"work_id":"fcfb2f8b-83e4-44a3-a05d-287b756e9bb0","year":2022},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.838604Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:79d2a1735bed9508145c43167a8c35878219be9137c781574b0d93d2fd86375d","observation_id":"a9e50a96-ee82-4c5b-87fb-608cfff865e6","resolution":{"observed_at":"2026-08-07T05:10:46.249110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.231934Z","title":"Connecting Speech Encoder and Large Language Model for ASR,","venue":null,"work_id":"f21a2498-4771-4569-a50a-ad9597af50c5","year":2024},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.842642Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:f99ceac0bb334880d6c092183070e9260d22da9d0a82072efd95075c768c404e","observation_id":"02d94eda-4e32-43b0-8c7e-b5a650031990","resolution":{"observed_at":"2026-08-07T05:10:46.235715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"cited_work":{"arxiv_id":"2411.18294","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18294","snapshot_observed_at":"2026-08-07T05:10:46.013949Z","title":"Aligning Pre-trained Models for Spoken Language Translation","venue":"cs.CL","work_id":"ca08a41f-016b-49d9-9c77-fc5cfec93b2a","year":2024},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.846040Z"},"links":{"cited_paper":"/paper/2411.18294","citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:cb05c301908a253146886016cdd82a9f14c50141ba27445a585d0c8f6e2173be","observation_id":"106ac024-06cc-4c38-9ce2-e4a47fdef12d","resolution":{"observed_at":"2026-08-07T05:10:46.018666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.219805Z","title":"TTS4pretrain 2.0: Advancing the use of Text and Speech in ASR Pretraining with Consistency and Contrastive Losses,","venue":null,"work_id":"d3d74e5e-f92e-477b-9a82-e9ccbb3eef48","year":2022},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.850105Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:ed0359544a517ac7561f84fe7dbfe38880152f36dcaa5d42858766cee992150a","observation_id":"2183f8c1-959b-487e-bbd8-7550c66e9eb2","resolution":{"observed_at":"2026-08-07T05:10:46.223983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.208399Z","title":"Adapting Large Language Model with Speech for Fully Formatted End-to-End Speech Recognition,","venue":null,"work_id":"5e283cfd-13b5-40b2-8a2b-dcf53a7ee3b8","year":2024},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.855135Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:7b276e284f7d77b095d72aa41630244bcac452507e72d463dfa639a3d16ba0fd","observation_id":"7f86a36e-82ee-4339-908e-056ae8bc8734","resolution":{"observed_at":"2026-08-07T05:10:46.212538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.197286Z","title":"SLM: Bridge the Thin Gap Between Speech and Text Foundation Models,","venue":null,"work_id":"b5e67aa4-1fd3-4475-b792-200cb09f068d","year":2023},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.859663Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:4dd331f1d44b27d00cf66434add50020d2c8626af507024ab4b836d5f0e8ce87","observation_id":"4ce92274-ff2c-48f5-a4de-2635f5937949","resolution":{"observed_at":"2026-08-07T05:10:46.201101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.185905Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models,","venue":null,"work_id":"cfafbabd-40f5-41af-9a67-1399853056b7","year":2024},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.863095Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:6dabcd91105e8d66ef3777a361e1c294cf415a77eaf8674d898f316f11b5ded5","observation_id":"744a89fa-2762-40de-ba07-f011007decd1","resolution":{"observed_at":"2026-08-07T05:10:46.189654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.174305Z","title":"Integrating Speech Self-Supervised Learning Models and Large Language Models for ASR,","venue":null,"work_id":"e3b940cb-aa55-4f55-bdb2-89d50880eacc","year":2024},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.867643Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:4f70b9294a0186927372b154f00fc802456c165fc3cfb1483d2667504ffb4908","observation_id":"794890c2-8692-446b-858f-86e5caa506e6","resolution":{"observed_at":"2026-08-07T05:10:46.178283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08846","last_updated":"2024-02-13T23:25:04Z","snapshot_observed_at":"2026-08-13T04:19:27.486516Z","submitted_at":"2024-02-13T23:25:04Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08846","snapshot_observed_at":"2026-08-07T05:10:45.872164Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.872164Z"},"links":{"cited_paper":"/paper/2402.08846","citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:45de8a9ccac98b134d34000293297d7ef071df3a10bb67f9bc60c6a9ed25f710","observation_id":"a06b4a5b-7d7c-42bd-b31c-0dc901942f2e","resolution":{"observed_at":"2026-08-07T05:10:45.872164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03866","last_updated":"2025-01-22T09:48:34Z","snapshot_observed_at":"2026-08-12T22:06:33.006603Z","submitted_at":"2024-11-06T12:22:04Z","title":"Performance evaluation of SLAM-ASR: The Good, the Bad, the Ugly, and the Way Forward","version":2},"cited_work":{"arxiv_id":"2411.03866","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.03866","snapshot_observed_at":"2026-08-07T05:10:45.984816Z","title":"Performance evaluation of SLAM-ASR: The Good, the Bad, the Ugly, and the Way Forward","venue":"cs.CL","work_id":"96cfaa60-321a-4093-b664-47e1c9d5c18d","year":2024},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.876042Z"},"links":{"cited_paper":"/paper/2411.03866","citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:ff7979989098593dc1207c6d90b3521cb0cd050484a059d7ca0b1a13726a455e","observation_id":"3d3e7eea-f140-4af3-b7d9-738f9dd56376","resolution":{"observed_at":"2026-08-07T05:10:45.989108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.161999Z","title":"WavLM: Large-Scale Self-Supervised Pre- Training for Full Stack Speech Processing,","venue":null,"work_id":"9b41f33a-8852-4b0b-8ab7-179f4abeb2c3","year":2022},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.881033Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:3cc89930ebba835567c2b121e815b927b31b2c542d4eda0a658bb71299c165e3","observation_id":"167c317c-b609-426e-b759-d6b9bd237667","resolution":{"observed_at":"2026-08-07T05:10:46.166013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.149078Z","title":"OLMo: Accelerating the Science of Lan- guage Models,","venue":null,"work_id":"46b6769b-ca1f-4bee-8435-74adffbc5d2c","year":2024},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.884463Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:ebe62543359ba16919058f06e4ea985a58b9fe8acadb40a1a45e0d7efd233002","observation_id":"aee85f69-266e-4ab2-bfca-807d6a132a90","resolution":{"observed_at":"2026-08-07T05:10:46.153150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.136811Z","title":"LoRA: Low-Rank Adaptation of Large Language Models,","venue":null,"work_id":"cf81e1c2-461e-4b8b-be7d-4b87526d4f0d","year":2022},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.888485Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:b776204961e44f801d841ea0585c3cf38f66e7288f881d101128caa304c2aa36","observation_id":"c6a8ba5c-de6d-49fb-8afd-5aefb2b0fbea","resolution":{"observed_at":"2026-08-07T05:10:46.140994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.124621Z","title":"MultiWOZ - A Large-Scale Multi- Domain Wizard-of-Oz Dataset for Task-Oriented Dialogue Mod- elling,","venue":null,"work_id":"63581bec-bc01-4a97-8f7b-ddf9436e7ff4","year":2018},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.892436Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:28c2bdba0f18127efc1460e5ac930295dc7d22345d31c06e4dd1926374723491","observation_id":"e0a95d62-2f18-45ef-8c13-3e844268a67e","resolution":{"observed_at":"2026-08-07T05:10:46.128757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.111369Z","title":"MultiWOZ 2.1: A Consolidated Multi-Domain Dialogue Dataset with State Corrections and State Tracking Base- lines,","venue":null,"work_id":"12e625d2-40bb-4c72-97a6-efe78a90b9a2","year":2020},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.895540Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:f924cb2fe0f3873c5c23a8e3b2095a2eeb0ec4e7e6c48bd7d7e08cdc4096aef4","observation_id":"ec093bc1-5ef2-4afb-aff9-48669d1889ea","resolution":{"observed_at":"2026-08-07T05:10:46.115786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.098992Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision,","venue":null,"work_id":"27eeee8b-8c83-4a9b-b005-bb8911254278","year":2023},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.899660Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:a6d36246998fa0faf22fa1dfd4d69b12168318cfecb3a1a8e31d2387a7663a60","observation_id":"48a3965f-0e9c-4174-b392-68ed38465718","resolution":{"observed_at":"2026-08-07T05:10:46.103527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.086102Z","title":"Shades of BLEU, Flavours of Suc- cess: The Case of MultiWOZ,","venue":null,"work_id":"f145d7f5-c937-4951-9fbf-b5f5fdf1e60f","year":2021},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.903725Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:6c2c7f633ec6cab755fa5f65ca0b8fc443b83c2f250fd188c30eecb7ad200f32","observation_id":"6ea693d4-29d6-4d99-941f-728a5e2ff63b","resolution":{"observed_at":"2026-08-07T05:10:46.090123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.074145Z","title":"SWITCHBOARD: telephone speech corpus for research and development,","venue":null,"work_id":"73016100-8442-43b8-8e2d-15dd45b3eb22","year":1992},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.907565Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:51dd3a935f3c4172f990df9a9d1dc9e1811fa0f17f866aab4b487599839850b6","observation_id":"f0f42c35-7b82-44ea-ae86-89ee507bb942","resolution":{"observed_at":"2026-08-07T05:10:46.077969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.063224Z","title":"Librispeech: An ASR corpus based on pub- lic domain audio books,","venue":null,"work_id":"bcd981e7-a3d0-41d8-8e16-cfdcace2b2ce","year":2015},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.911406Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:b06828a7dd717eb07e126bd94a670da84eb1ebeaf1bbab8780b7d5ec57afd84c","observation_id":"129b36a1-1a7c-42d1-9382-2374814960aa","resolution":{"observed_at":"2026-08-07T05:10:46.067020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.050995Z","title":"How2: A Large-scale Dataset For Multimodal Language Understanding,","venue":null,"work_id":"0dc2dc58-fcc6-4056-bca7-7531aea300fc","year":2018},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.914574Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:28443e3892a7cdc108be8672da27c8cf97056f75c9886647cdb1a43d3f397fe7","observation_id":"962d2862-265b-4e32-b93e-78c0b61e5ddb","resolution":{"observed_at":"2026-08-07T05:10:46.054680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:10:46.039855Z","title":null,"venue":null,"work_id":"c2ae7604-8803-4c50-86df-286ac2b2d3d1","year":2024},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.919049Z"},"links":{"citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:486e412a118d7ada424507782d7177ebadf950e0c9bc51dff0bbedc670b21392","observation_id":"cdeb2438-a12b-46b3-8de8-eee539488d8d","resolution":{"observed_at":"2026-08-07T05:10:46.043588Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T05:10:45.924099Z","title":"Gemma 2: Improving open language models at a practical size,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.924099Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:41bc0088903026d185875b692d73baabe912f0fe3e7c6d2d0a2ed51fe37d33d8","observation_id":"1dcfedc5-6530-4a5d-b470-67014a5cac15","resolution":{"observed_at":"2026-08-07T05:10:45.924099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00150","last_updated":"2025-02-21T18:54:37Z","snapshot_observed_at":"2026-08-14T08:49:20.216499Z","submitted_at":"2024-10-31T18:57:59Z","title":"Schema Augmentation for Zero-Shot Domain Adaptation in Dialogue State Tracking","version":2},"cited_work":{"arxiv_id":"2411.00150","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.00150","snapshot_observed_at":"2026-08-07T05:10:45.955319Z","title":"Schema Augmentation for Zero-Shot Domain Adaptation in Dialogue State Tracking","venue":"cs.CL","work_id":"27663cdb-6e0b-429c-a7c1-8f4e02c92b67","year":2024},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.928589Z"},"links":{"cited_paper":"/paper/2411.00150","citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:ab31716f63b34274e47028cb40fcc968ec808a0af13a7de733fd60ab201975a2","observation_id":"cc7f19b4-16ec-4f14-9c7a-f3d89295cee6","resolution":{"observed_at":"2026-08-07T05:10:45.962064Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":3,"verified_fuzzy":24},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 2 inbound Pith citation observations for arXiv:2506.08633."}