{"as_of":"2026-08-11T01:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:10db37e82988989371dedd35a3dd081a2f76dafe53ca56e1dea5c3a6a6b6909f","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:33:19.591854Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T06:35:35.951554Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:38:39.602552Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"cited_work":{"arxiv_id":"2506.13642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13642","snapshot_observed_at":"2026-07-03T16:38:39.602552Z","title":"Stream-omni: Simultaneous multimodal in- teractions with large language-vision-speech model","venue":null,"work_id":"c01077b2-51f3-43a8-bc1b-a7c40d57abf6","year":2025},"citing_paper":{"arxiv_id":"2512.02231","last_updated":"2026-04-10T02:23:14Z","snapshot_observed_at":"2026-07-06T22:37:31.360740Z","submitted_at":"2025-12-01T21:57:26Z","title":"See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-17T02:12:55.170296Z"},"links":{"cited_paper":"/paper/2506.13642","citing_paper":"/paper/2512.02231"},"observation_digest":"sha256:22ff3d67f9e407b494c23f4d1822e51b10e957682199af6d19b7d10fa0af4d06","observation_id":"286ba852-3dfa-43a3-9a01-4abb28a5dfab","resolution":{"observed_at":"2026-05-17T02:13:52.168111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"cited_work":{"arxiv_id":"2506.13642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13642","snapshot_observed_at":"2026-07-03T16:38:39.602552Z","title":"Stream-omni: Simultaneous multimodal in- teractions with large language-vision-speech model","venue":null,"work_id":"c01077b2-51f3-43a8-bc1b-a7c40d57abf6","year":2025},"citing_paper":{"arxiv_id":"2604.08000","last_updated":"2026-04-09T09:06:13Z","snapshot_observed_at":"2026-07-06T22:57:13.745326Z","submitted_at":"2026-04-09T09:06:13Z","title":"PASK: Toward Intent-Aware Proactive Agents with Long-Term Memory","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T18:05:40.242925Z"},"links":{"cited_paper":"/paper/2506.13642","citing_paper":"/paper/2604.08000"},"observation_digest":"sha256:c8832e2aec883460d98ece5e7c2cbdff6f0faff832811da6952e62e3bd11e222","observation_id":"20d11b5b-424b-468b-98b5-45b0698792ac","resolution":{"observed_at":"2026-05-11T05:30:59.686225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"cited_work":{"arxiv_id":"2506.13642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13642","snapshot_observed_at":"2026-07-03T16:38:39.602552Z","title":"Stream-omni: Simultaneous multimodal in- teractions with large language-vision-speech model","venue":null,"work_id":"c01077b2-51f3-43a8-bc1b-a7c40d57abf6","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2506.13642","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:05863e96e09ea47a44bcc9ac27578bad058bc0f9ba786577b292e692317ff3b2","observation_id":"b3a8cf48-e086-43d3-bc8e-60ddc7414b0b","resolution":{"observed_at":"2026-07-02T17:27:15.634543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"cited_work":{"arxiv_id":"2506.13642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13642","snapshot_observed_at":"2026-07-03T16:38:39.602552Z","title":"Stream-omni: Simultaneous multimodal in- teractions with large language-vision-speech model","venue":null,"work_id":"c01077b2-51f3-43a8-bc1b-a7c40d57abf6","year":2025},"citing_paper":{"arxiv_id":"2607.01667","last_updated":"2026-07-02T03:47:45Z","snapshot_observed_at":"2026-08-05T09:34:18.453279Z","submitted_at":"2026-07-02T03:47:45Z","title":"Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-03T16:37:06.384435Z"},"links":{"cited_paper":"/paper/2506.13642","citing_paper":"/paper/2607.01667"},"observation_digest":"sha256:bc9453ec94ac1031f71bc0d6b0ce728f849a7786956192e262c6602aa85fe28c","observation_id":"95af9d12-ec95-40ab-8db1-5aad1f844823","resolution":{"observed_at":"2026-07-03T16:38:39.603859Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13642","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Stream-omni: Simultaneous multimodal interac- tions with large language-vision-speech model.arXiv preprint arXiv:2506.13642, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-06T10:36:18.804889Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2506.13642","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:5412658ed1bc6c120ef8bc4b9b51f5a7bd66e9e45c7c16b555fdb9aade596988","observation_id":"f28a4588-daff-4cac-8c3e-8020f4f57764","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13642/citation-record","integrity":"/paper/2506.13642/integrity","json":"/paper/2506.13642/citation-record.json","paper":"/paper/2506.13642"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.603120Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":"2f17c8ae-f146-4e74-b01b-c17f0a67f5e0","year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.211972Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:08b4d2a02d80f1113745280a9396e858ec32f24753b5e4e2f0dfe551cd344203","observation_id":"99f2d984-0e85-404f-af46-d47bad206dc3","resolution":{"observed_at":"2026-08-07T00:33:21.616625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.555835Z","title":"Gpt-4v(ision) system card, 2024","venue":null,"work_id":"490cc93b-9ac1-4540-adee-86b1e5f9ed6b","year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.217907Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:2cfed8f3f342af9d1b80ff8b65b2ecda73d78cb6d75b4d322619a83fd42b4ae8","observation_id":"4ca0a7a8-44db-47f7-ba61-10986922dad3","resolution":{"observed_at":"2026-08-07T00:33:21.579132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.513995Z","title":"Visual instruction tuning","venue":null,"work_id":"96aa7385-1b4c-4451-a23f-e4fd402444d1","year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.222673Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:0cb1d22b88995394d1049041fc186462ec7cdc7604167e0e8633da48a62b9527","observation_id":"cb87d4dc-dd24-4c03-98d4-d07b0c69ad42","resolution":{"observed_at":"2026-08-07T00:33:21.534744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.483224Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"b0ec8cbc-7615-4553-a8f2-2142746ed016","year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.227705Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:9945219a724b153c3f117fd5f8c747076a995095da39cd5e7c3b446109626be0","observation_id":"491b9874-b198-45ae-8e7b-ab812f1ef63d","resolution":{"observed_at":"2026-08-07T00:33:21.490643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.232753Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.232753Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:d738aef7ce356d7c5b7d5d429c34e3fd0b609f801e2280047056a11f277e69b0","observation_id":"5c78f174-2af0-4e89-8c5c-5555031f56af","resolution":{"observed_at":"2026-08-07T00:33:19.232753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T00:33:19.237792Z","title":"Llava-onevision: Easy visual task transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.237792Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:e12b116954de348d3cd88eee6b401298c037400945b2daae97f98445dafec9aa","observation_id":"b9c087cb-4c3b-42f8-9a46-81de19f1e5a2","resolution":{"observed_at":"2026-08-07T00:33:19.237792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T00:33:19.243615Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.243615Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:5efea5a3543e84eb478f3d5c95784b029df7d074866884c822715244af319d92","observation_id":"1ab3b4fb-bae9-4a7b-a7d3-1e62ea7e4305","resolution":{"observed_at":"2026-08-07T00:33:19.243615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-07T00:33:19.248709Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.248709Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:2cd7642133ffdf6944cfb528c5d2d62126f3df6829670ab5f3dfb2a3a6d3ac79","observation_id":"c1b7e80d-0a19-4bc4-9c34-91e24f446e9a","resolution":{"observed_at":"2026-08-07T00:33:19.248709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.445003Z","title":"LLaMA- omni: Seamless speech interaction with large language models","venue":null,"work_id":"94546496-a069-4c08-a40a-56bac90aae45","year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.253606Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:93aadb0b761dbc77aab9ebfe7aa94f64f16dd627149b9960d2d83ebc6afbfd72","observation_id":"7448f4ea-2857-4560-beb2-e3769993f9bd","resolution":{"observed_at":"2026-08-07T00:33:21.452144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T00:33:19.258298Z","title":"Moshi: a speech-text foundation model for real-time dialogue, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.258298Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:94a05e978e922d3d65e4399758709ffca66ecaadf177905185fc40292ef20d35","observation_id":"e1373ac1-5099-4818-8963-e2ba1604d6b3","resolution":{"observed_at":"2026-08-07T00:33:19.258298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-07T00:33:19.263029Z","title":"Glm-4-voice: Towards intelligent and human-like end-to-end spoken chatbot, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.263029Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:e98f80b50d25f7ed1c59de5ac06339c41ea68c8068c800b7fc83f60cc8262552","observation_id":"171ac415-b9c8-47de-aab3-1bd0b16a5aec","resolution":{"observed_at":"2026-08-07T00:33:19.263029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-07T00:33:19.267903Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.267903Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:3f01dae09acc86107595a23818965447a24c4773bfb0e82b720386d982dfcd71","observation_id":"3c0249fb-3f19-4f57-bc5e-ef16e778e3a3","resolution":{"observed_at":"2026-08-07T00:33:19.267903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.273419Z","title":"Baichuan-omni technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.273419Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:e549ee3d65393b4bf7d3a8d03bf49d7e9145f73eb742eb34ca1fc2ef75cc5083","observation_id":"00c9d13f-5346-4bb2-ad89-999189f95508","resolution":{"observed_at":"2026-08-07T00:33:19.273419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-07T00:33:19.277910Z","title":"Qwen2.5-omni technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.277910Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:c8da6aca108b5ca360afdfce9a686a0adb323e1aa1e9f84f221213ed022f47d9","observation_id":"0adcf620-700a-46e1-a44e-26ca606ba35a","resolution":{"observed_at":"2026-08-07T00:33:19.277910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.282753Z","title":"Connectionist tem- poral classification: labelling unsegmented sequence data with recurrent neural networks","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.282753Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:8c81805f9777b2f72d1fe012413b8283deb718feed22a377a7a42741d283c847","observation_id":"88f62f36-3081-4824-8222-4e2ba58ee3fe","resolution":{"observed_at":"2026-08-07T00:33:19.282753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.425457Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"71fafabc-8429-4051-923d-13e15d7808b7","year":2021},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.287814Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:1c3b65cebd90132c5b8e0a25dd550d5cc7a51f0292906b9be1f254a413acf3e5","observation_id":"77b2176b-144e-4162-aa55-adcd1168d97c","resolution":{"observed_at":"2026-08-07T00:33:21.431137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.406989Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond, 2023","venue":null,"work_id":"5e553191-25c8-42ae-bedb-144a453ab721","year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.292479Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:45540300319cbd9e6e5d239d8d40e28e47d7a7396f4472932e556d7834aa7900","observation_id":"e545fb63-b739-4379-885b-1e155e47775a","resolution":{"observed_at":"2026-08-07T00:33:21.412866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.384870Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"2ccbd707-c276-4aec-a24c-de1e3b74a3b2","year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.297381Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:f5e11d5f976e79cbd0b7509cd8b5a82f8bd3451dcac3464d4911dd1cdcbf2b73","observation_id":"162c306d-abff-46dd-a029-c6edbdfa953e","resolution":{"observed_at":"2026-08-07T00:33:21.391181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-07T00:33:19.302280Z","title":"Sphinx: The joint mixing of weights, tasks, and visual embeddings for multi-modal large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.302280Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:145f1a1367f20c1105f6b88945663d0a5b80e4503e1c85b6bb908c803506ba9d","observation_id":"16c684df-b327-4f82-8bb9-7e17c22b4528","resolution":{"observed_at":"2026-08-07T00:33:19.302280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.365020Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"3278c12f-e889-426b-87f3-9136e5793059","year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.307062Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:ba0df9fca9eb290f0df0e545ee382e4f9fe7270e3c760846889862a85c470e94","observation_id":"2828e8b0-ff6c-4883-b663-885ba785378b","resolution":{"observed_at":"2026-08-07T00:33:21.371372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T00:33:19.311995Z","title":"Internvideo: General video foundation models via generative and discriminative learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.311995Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:ed9ff4a136875cdb0ad17ec75b6e410c84cd71cc4fe29fe3661cb4d689fe862e","observation_id":"90ff68e9-ab1c-4fff-90a3-784606db2304","resolution":{"observed_at":"2026-08-07T00:33:19.311995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T00:33:19.316833Z","title":"Videochat: Chat-centric video understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.316833Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:a36bb692b0941a60955ce3cb1dc4379b5519883750ec994a7cae4c8ad983e308","observation_id":"bd4ad7ce-5871-44c9-9b2f-0bc008ee470e","resolution":{"observed_at":"2026-08-07T00:33:19.316833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.342832Z","title":"Video-ChatGPT: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"1df00723-8595-4660-af1b-ebfb0eb15b3f","year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.321745Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:a43d652488fe337de24232b0a1d952a731e4e6aaa25b225880313745cca61efd","observation_id":"aea73c1b-d24c-42f7-9447-41c286b980ea","resolution":{"observed_at":"2026-08-07T00:33:21.348872Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-10T13:02:01.821606Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-07T00:33:19.326679Z","title":"Llama-vid: An image is worth 2 tokens in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.326679Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:a182aba9bb66a62bb6e00e247b02700fad0249fc4868f94f33687f5bed55fa8e","observation_id":"fa43ef72-8084-4d98-b812-6fccee3b5343","resolution":{"observed_at":"2026-08-07T00:33:19.326679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.331593Z","title":"Video-LLaV A: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.331593Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:92517545c4939d7a77e1882297a34a13b7352054a30c6de50b3687542d3c4de5","observation_id":"d03987c5-bb12-41b9-896b-94b8880e4c21","resolution":{"observed_at":"2026-08-07T00:33:19.331593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-10T19:46:14.169100Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-07T00:33:19.341323Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.341323Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:835cd3b3cfe73641081898c10600e311a7660bd8720fd2262af6a73e8888197e","observation_id":"e40c7e43-5d2a-4814-a945-19f891f788fb","resolution":{"observed_at":"2026-08-07T00:33:19.341323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18138","last_updated":"2024-11-27T08:38:57Z","snapshot_observed_at":"2026-08-09T02:58:40.541098Z","submitted_at":"2024-11-27T08:38:57Z","title":"SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18138","snapshot_observed_at":"2026-08-07T00:33:19.346344Z","title":"Salmonn-omni: A codec-free llm for full-duplex speech understanding and generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.346344Z"},"links":{"cited_paper":"/paper/2411.18138","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:dc6cb23ef137342b4ce38b52d255c032fe8b8aee3feae08d70bc71ac53815a57","observation_id":"09ba4a5e-31cf-4a00-89cd-cc489715c8a5","resolution":{"observed_at":"2026-08-07T00:33:19.346344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.297239Z","title":"Slam-omni: Timbre-controllable voice interaction system with single-stage training,","venue":null,"work_id":"357c0759-0d93-470a-b148-d33a9d8886e6","year":null},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.351418Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:2f35980989440a97e5630c2abbcb13feb21d99ec389a844d1ed77746a62be3ee","observation_id":"a75a3f1e-d172-4cc1-a04d-c8d055653d95","resolution":{"observed_at":"2026-08-07T00:33:21.304020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.273050Z","title":"Robust speech recognition via large-scale weak supervision, 2022","venue":null,"work_id":"52b9d32f-dd65-4c21-b7a8-36da4954d971","year":2022},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.361775Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:cc3759c199f032d623133c3745c4bc2fc24f0de7df49b1696aba20546320f51b","observation_id":"7e87629b-a43e-499e-b0e3-1baac53bd90e","resolution":{"observed_at":"2026-08-07T00:33:21.278885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15649","last_updated":"2024-12-20T08:05:55Z","snapshot_observed_at":"2026-08-03T16:28:18.429985Z","submitted_at":"2024-12-20T08:05:55Z","title":"SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15649","snapshot_observed_at":"2026-08-07T00:33:19.356530Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.356530Z"},"links":{"cited_paper":"/paper/2412.15649","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:eb58f93a81252a742dd18239978640c996c758bc7b70f9c0395cd607ff965035","observation_id":"20ba2d0d-0fac-499b-a766-14073c675d5b","resolution":{"observed_at":"2026-08-07T00:33:19.356530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.371514Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 29:3451–3460, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.371514Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:e2949dfd2e33a3a80e09594aabd2636868eb4e151f17e0cd595ff62626440b11","observation_id":"76a7d486-85e6-46e4-a154-e4a7113a5e5d","resolution":{"observed_at":"2026-08-07T00:33:19.371514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.366716Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.366716Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:b9e78daa35d4dcaadd9eb8adc7bdc4b36336c69a7b4447fc998c93a4ca2dc317","observation_id":"364e34da-2e2e-4130-ae6e-9ecf434d071f","resolution":{"observed_at":"2026-08-07T00:33:19.366716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T00:33:19.381385Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.381385Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:ecd90800f5d423275764122e1bfe273e8827dfe312738157eebf859640b9c5af","observation_id":"40a80281-7f94-4d0c-a57c-851ee32bd298","resolution":{"observed_at":"2026-08-07T00:33:19.381385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.236669Z","title":"Speechtokenizer: Uni- fied speech tokenizer for speech language models","venue":null,"work_id":"0c44482e-6122-4383-a453-80979a1dfb33","year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.376928Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:05f7c1b80d8d54b4df6ec756ff33fa65776a8f33b4b051b883361150e4e5b23c","observation_id":"1393f3cc-df50-425f-a3c8-4714f50a3c8c","resolution":{"observed_at":"2026-08-07T00:33:21.255218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.390752Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.390752Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:fe44825048ab99f4ad838c164a89582eeafabcaa96359ec7c93082a19a8661ec","observation_id":"49e0837c-b280-4bda-9abb-ed83e6a41216","resolution":{"observed_at":"2026-08-07T00:33:19.390752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.205505Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":"d08c2b02-0fd6-44fa-8d20-90d613310b80","year":2020},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.386288Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:3346b00961057ee4b5f10d9d529d044f369b9d782a706f8560496bafe1ece33f","observation_id":"9b572f75-01bb-4bdd-8a94-1835bf8faf8e","resolution":{"observed_at":"2026-08-07T00:33:21.212324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18778","last_updated":"2025-04-07T08:54:28Z","snapshot_observed_at":"2026-08-07T17:48:24.066835Z","submitted_at":"2025-02-26T03:21:12Z","title":"M2-omni: Advancing Omni-MLLM for Comprehensive Modality Support with Competitive Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18778","snapshot_observed_at":"2026-08-07T00:33:19.400418Z","title":"M2-omni: Advancing omni-mllm for comprehensive modality support with competitive performance, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.400418Z"},"links":{"cited_paper":"/paper/2502.18778","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:c79ea7891240619a44e0120b5695551954b7ed846ed9c1cd6ba93eedfa842d67","observation_id":"6907a3a9-4e83-4aa4-a288-2d6d4560034d","resolution":{"observed_at":"2026-08-07T00:33:19.400418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.186018Z","title":"Megrez-omni technical report, 2025","venue":null,"work_id":"febcbe8a-8eb0-48ce-8db3-57580fa3e6f1","year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.395633Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:d35a6fdf3bf87b8cd20fb31dcd28a858e3c94beec0a888a53340ee400a6f0d67","observation_id":"79c360b9-12cc-47f9-8e9d-f0c67c6d7099","resolution":{"observed_at":"2026-08-07T00:33:21.191840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18042","last_updated":"2025-03-20T08:47:39Z","snapshot_observed_at":"2026-08-10T23:03:30.048848Z","submitted_at":"2024-09-26T16:44:02Z","title":"EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18042","snapshot_observed_at":"2026-08-07T00:33:19.410942Z","title":"Kwok, Hengshuang Zhao, Xiaodan Liang, Dit-Yan Yeung, Xiao Chen, Zhenguo Li, Wei Zhang, Qun Liu, Jun Yao, Lanqing Hong, Lu Hou, and Hang Xu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.410942Z"},"links":{"cited_paper":"/paper/2409.18042","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:99e52263f1a11dd70437e0eafea5f3e2dc463e4f6eadbc619c42ccf9672da483","observation_id":"3f5707ab-84f4-4a61-aa79-9f94835d864c","resolution":{"observed_at":"2026-08-07T00:33:19.410942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12315","last_updated":"2025-04-10T07:08:53Z","snapshot_observed_at":"2026-08-07T16:06:57.674761Z","submitted_at":"2025-04-10T07:08:53Z","title":"Capybara-OMNI: An Efficient Paradigm for Building Omni-Modal Language Models","version":1},"cited_work":{"arxiv_id":"2504.12315","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12315","snapshot_observed_at":"2026-08-07T00:33:20.184355Z","title":"Capybara-OMNI: An Efficient Paradigm for Building Omni-Modal Language Models","venue":"cs.CL","work_id":"e8d278b3-460e-43e1-ae7d-5a4f40933bd6","year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.405533Z"},"links":{"cited_paper":"/paper/2504.12315","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:a717dfef4b106fe723d26df61e40f8de4800e490e9ff22101f459c61fefca009","observation_id":"49d2bc70-bf19-47eb-9c8f-432f1887f8fb","resolution":{"observed_at":"2026-08-07T00:33:20.191604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09502","last_updated":"2025-01-16T12:27:05Z","snapshot_observed_at":"2026-08-10T19:55:29.245089Z","submitted_at":"2025-01-16T12:27:05Z","title":"Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09502","snapshot_observed_at":"2026-08-07T00:33:19.420806Z","title":"Omni-emotion: Extending video mllm with detailed face and audio modeling for multimodal emotion analysis, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.420806Z"},"links":{"cited_paper":"/paper/2501.09502","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:3ac2cf5d9f9ce25bf8672ff8aab40344ac058dd59ca0d9e122a0f8d10f8e4313","observation_id":"5f8eeb56-c015-44ca-b3ee-76677e515931","resolution":{"observed_at":"2026-08-07T00:33:19.420806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.416428Z","title":"Openomni: Advancing open-source omnimodal large language models with progressive multimodal alignment and real-time self-aware emotional speech synthesis, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.416428Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:669729ad189f5b7452a72f35d00c55e1a8bc548b6b9877a320f4056847706238","observation_id":"2337fda3-cc8c-4241-b296-8134f263461a","resolution":{"observed_at":"2026-08-07T00:33:19.416428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.430154Z","title":"Stream- Speech: Simultaneous speech-to-speech translation with multi-task learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.430154Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:325eccde6d3c5b84a15d10ff9471e3b68d6a6ded1e71a6cbb951a5418071d850","observation_id":"9eef4a63-d46b-45e7-b69a-d26e6226ab37","resolution":{"observed_at":"2026-08-07T00:33:19.430154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.167503Z","title":"LLaV A-mini: Efficient image and video large multimodal models with one vision token","venue":null,"work_id":"ad52f2db-9e7b-4299-846b-8a2ef9b8e221","year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.425639Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:fda18facd1cf8688df2659a5e2351bdb841c4bfe475478620f699cda0d2681e5","observation_id":"aec48e8a-01c8-456d-98c8-0c62539af473","resolution":{"observed_at":"2026-08-07T00:33:21.172880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.147483Z","title":"Future-guided incremental transformer for si- multaneous translation.Proceedings of the AAAI Conference on Artificial Intelligence, 35 (16):14428–14436, May 2021","venue":null,"work_id":"1e64d954-3717-45ea-9e63-8c2eed29c8fb","year":2021},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.439367Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:8c5bd1c763bdeaf2ea49ca0d498f7ef88f3a36d62ffdebf70e317d0e0f9cb9e6","observation_id":"7b3b7fc3-c782-4dd2-9b12-c42d5f2977ea","resolution":{"observed_at":"2026-08-07T00:33:21.153594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.434764Z","title":"STACL: Simultaneous translation with implicit anticipation and controllable latency using prefix-to-prefix framework","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.434764Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:1492889e01de01ac4f50f0a8884ea490131307b4ef89c4243bf4d56e1473d1ff","observation_id":"0d4c36c6-dd8c-4162-a85d-e910384fbe28","resolution":{"observed_at":"2026-08-07T00:33:19.434764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.448868Z","title":"Information-transport-based policy for simultaneous trans- lation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.448868Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:1ba9c07d4a22e8b0c8d09162e067f1d213bbde3e695f6fe7d4ff9b7d39b78887","observation_id":"b886f9d2-8782-415d-98a7-ca81cdb87e1f","resolution":{"observed_at":"2026-08-07T00:33:19.448868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.emnlp-main.581","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Universal simultaneous machine translation with mixture-of- experts wait-k policy","venue":"Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing","work_id":"dc009865-0293-41ef-a1b1-332fd2f7a323","year":2021},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.443755Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:8454c99781dfebb3200bdbc5e6f049a8686e331abbe4690506328ca1ac70a22b","observation_id":"ed288ccc-6968-47fe-9e67-c6d5fdd2ceaa","resolution":{"observed_at":"2026-08-07T00:33:19.693942Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.458294Z","title":"Librispeech: An asr corpus based on public domain audio books","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.458294Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:88d379a8ae8aa5ffd39851da8d1a42038185556c0453043c886abfa29b380f83","observation_id":"030d498b-c61a-4151-8daf-91be67b987b6","resolution":{"observed_at":"2026-08-07T00:33:19.458294Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-acl.485","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"End-to-end simultaneous speech translation with differentiable segmentation","venue":null,"work_id":"bce5a9b4-a072-445b-a30b-bbd75b9326b6","year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.453507Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:036aeb1be12faf4dcd5cce3c43e22e65d29c2f0714092a46adf89bfc2ed311fb","observation_id":"cad4eaf6-cc97-4b89-922c-a8f33a02d995","resolution":{"observed_at":"2026-08-07T00:33:19.662287Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.127317Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"376b0d46-3d2d-43bf-a3a5-4d75f5a83a25","year":2017},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.467939Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:d1406d925220bbe88c6ecf868e8fff0cb3327e6f801a5dadb97569585e981a75","observation_id":"9ddbca23-aa03-4346-b39c-71a5b8142f41","resolution":{"observed_at":"2026-08-07T00:33:21.133409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03370","last_updated":"2022-02-23T06:42:31Z","snapshot_observed_at":"2026-08-09T03:42:41.612429Z","submitted_at":"2021-10-07T12:05:29Z","title":"WenetSpeech: A 10000+ Hours Multi-domain Mandarin Corpus for Speech Recognition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.03370","snapshot_observed_at":"2026-08-07T00:33:19.462794Z","title":"Wenetspeech: A 10000+ hours multi-domain mandarin corpus for speech recognition, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.462794Z"},"links":{"cited_paper":"/paper/2110.03370","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:3e24871ec1c732402fda8844996ab2b384304ee9dd21978535f160e97f715445","observation_id":"8b54d6d9-9aaf-4136-a244-4645ab435966","resolution":{"observed_at":"2026-08-07T00:33:19.462794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.079802Z","title":"Stangl, Anhong Guo, Chi Lin, Kristen Grauman, Jiebo Luo, and Jeffrey P","venue":null,"work_id":"9e99ca2b-d5f6-43b2-ae71-7d2a84d600f5","year":2018},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.477513Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:cef2adb16e6893dc49df86c5feaad7d8a8ce2847bbd65a49870bb952166d7b68","observation_id":"47529764-308a-4bec-98c9-0cf8a7c46da4","resolution":{"observed_at":"2026-08-07T00:33:21.088297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.102738Z","title":"Hudson and Christopher D","venue":null,"work_id":"1102c650-90b7-48a7-9c3e-2e922170fc25","year":2019},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.472638Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:3bd730ed9e9c28ecb91c37a60acef059f7515d31167f0f3064011d0d0d67a190","observation_id":"15dbb48e-f8d2-4abf-a228-c45ec74ff014","resolution":{"observed_at":"2026-08-07T00:33:21.109643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.037069Z","title":"Towards vqa models that can read","venue":null,"work_id":"81e666d6-87e8-49e6-a07c-278a59766f66","year":2019},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.486601Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:3f5a5635447f97c88909f35b7ac5a5d552cb79e5032ed88a14b490be725262d5","observation_id":"b4715a3b-9719-4bfc-8ba2-92d0d69d98ad","resolution":{"observed_at":"2026-08-07T00:33:21.044743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.059260Z","title":"Learn to explain: Multimodal rea- soning via thought chains for science question answering","venue":null,"work_id":"ec3a9547-52f3-4a5a-a094-d44efc2601f7","year":2022},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.482086Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:fa57b2f32429b40ca19afa2f736f7e87ab1ef498d8cd51aaf2d93d472292ec82","observation_id":"ce3a6731-d55c-4499-acf2-7f72fe21f344","resolution":{"observed_at":"2026-08-07T00:33:21.065463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T00:33:19.496435Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.496435Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:bcc59d9208356463a1dfd8a94f3f2c8e59d855663a3b2755f0468a8ddb5c0b76","observation_id":"9ab882af-001f-4b7d-9ed5-96fe76b00cae","resolution":{"observed_at":"2026-08-07T00:33:19.496435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:21.017140Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"a67f3350-0a40-4810-9ec7-ed75e071a1f5","year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.491754Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:7c0c9ff108676130b129e80ad8c4dde9457cce9d8ead50114ced5c155e0a44bb","observation_id":"f8475a16-8b23-45cb-a4c0-978f7933fbb5","resolution":{"observed_at":"2026-08-07T00:33:21.023280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:20.998505Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":"ccbbb2ea-e59d-476c-a3ca-03b00ed09c26","year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.506706Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:239c1446b21494a4456e535d4bd55e1f7cab5d93cc7a84d0f97692c3ed9560d9","observation_id":"6f30e2b9-f600-4094-b497-c145b6453040","resolution":{"observed_at":"2026-08-07T00:33:21.004498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T00:33:19.501199Z","title":"Mmbench: Is your multi-modal model an all-around player?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.501199Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:33d8a9b2434ab5f927ec289c03ee3ee9bafd1d6be3a0947e4513b9e8a723d026","observation_id":"a170ddd9-daa1-4f37-8cb4-3e6b391b00ef","resolution":{"observed_at":"2026-08-07T00:33:19.501199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:20.966684Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities,","venue":null,"work_id":"6f9a871a-198e-4503-a6cb-857c2405faea","year":null},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.516384Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:5ea312cc654546ab4387758b966b2ebe2d038fb83e889c8391e2b795a1765085","observation_id":"0e0579f0-f8fe-4228-ad87-283cd2471329","resolution":{"observed_at":"2026-08-07T00:33:20.972598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.511589Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.511589Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:c3d75db902463867b0eb6f141d8991ca7cff24211cf82467914b1030e6548068","observation_id":"783463fc-6429-43de-aa46-6cdf7ab10579","resolution":{"observed_at":"2026-08-07T00:33:19.511589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:20.928860Z","title":"Semantic parsing on Freebase from question-answer pairs","venue":null,"work_id":"dee9d2ae-e2c1-46a7-9660-352a0468942a","year":2013},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.531289Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:773587f33297d749910f628799a110878c9c411dc5ddf9e10adcd0749f106172","observation_id":"5a224011-d38c-4c0b-8e36-661891981140","resolution":{"observed_at":"2026-08-07T00:33:20.935198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:20.891595Z","title":"Visit-bench: A dynamic benchmark for evaluating instruction-following vision-and-language models","venue":null,"work_id":"d61b7bb3-8920-4028-a4dc-21cb4832c657","year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.540625Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:6765bee1f73590b6ed58596bd0a873090e2c18e8382cd291a51283a1c42de922","observation_id":"3af33f61-c3d4-48a9-bffb-067b3f7454fe","resolution":{"observed_at":"2026-08-07T00:33:20.898083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:20.947777Z","title":"Spoken question answering and speech continuation using spectrogram-powered LLM","venue":null,"work_id":"81e24305-8584-4cb4-91a0-770bb13b8bee","year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.526568Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:79e2014d0dbda8011d90cdbc0eeddbd9adb2c0b8ee546bf27576e1ddc0efadb3","observation_id":"f5487bc2-ab3e-4bc9-b9d6-0d435ab04a66","resolution":{"observed_at":"2026-08-07T00:33:20.953856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.549650Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.549650Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:34c573e84a1687221f13a4fbca814b010ca8864492ca505c899319aba5ba92be","observation_id":"cf89375b-0d49-4cba-8248-1ed91245a399","resolution":{"observed_at":"2026-08-07T00:33:19.549650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:20.848249Z","title":"Introducing idefics: An open reproduction of state-of-the-art visual language model, 2023.URL https://huggingface","venue":null,"work_id":"5df9ce69-69d2-46d1-b5a6-9962f596eacc","year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.554791Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:fb44d04b6662d41ae311de291dc138f71d38dfba0a288e5efed17ebc74d720f1","observation_id":"40133eb9-41ff-4f21-979f-69e2e2a4f8ce","resolution":{"observed_at":"2026-08-07T00:33:20.854697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:20.828964Z","title":"Textually pretrained speech language models","venue":null,"work_id":"20315c58-e420-4e2c-b896-2f1dfc563366","year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.559359Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:757c2c2e530b689ce49c3e69e81ad5ebfaf38e7a3731ed4ea7b7eb6885bd2ca0","observation_id":"f2e0cdb4-aef5-43c3-a9d0-eae9f60b6d8e","resolution":{"observed_at":"2026-08-07T00:33:20.835643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.545187Z","title":"BLIP-2: Bootstrapping language- image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.545187Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:42f2831945288064a3ea3eb505262f855d60d5a2805f94f76080973fb3f9dc39","observation_id":"abe7db92-287e-4465-9595-8a98817694c7","resolution":{"observed_at":"2026-08-07T00:33:19.545187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:33:19.568881Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.568881Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:23845672ae55620572fa67356fcb3c0b96a0b243434fc1b1bc0cec5a6fa549a3","observation_id":"1cfecd7a-cb94-4f44-ba50-8e016548ba32","resolution":{"observed_at":"2026-08-07T00:33:19.568881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.573384Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.573384Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:bffa4cc952c63f519ea17685aebb75e06b5da0fc7f341bc0d540cef57b4e04bb","observation_id":"a119a8b9-f13b-4860-8699-792aabae8383","resolution":{"observed_at":"2026-08-07T00:33:19.573384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02625","last_updated":"2025-05-05T12:53:09Z","snapshot_observed_at":"2026-08-07T15:56:21.924963Z","submitted_at":"2025-05-05T12:53:09Z","title":"LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02625","snapshot_observed_at":"2026-08-07T00:33:19.577773Z","title":"Llama-omni2: Llm- based real-time spoken chatbot with autoregressive streaming speech synthesis, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.577773Z"},"links":{"cited_paper":"/paper/2505.02625","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:725ce5b87fedba904165fc3cfe0db9141921b51744205348969eeb86ebac1c0e","observation_id":"f5e67540-2a28-4247-9b5c-61fabd5ceea5","resolution":{"observed_at":"2026-08-07T00:33:19.577773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-07T00:33:19.563774Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.563774Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:92190acb7fd9cd56692d0e33b40f6d40d0d523da5af8b3a25634e7759d7e65ca","observation_id":"387faf8f-1424-435a-b860-dc09ef65783b","resolution":{"observed_at":"2026-08-07T00:33:19.563774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.586908Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.586908Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:8a4dbc44f5e48d796359c0a2ff9ca44e00821a581556ea2d2853ffeabe825591","observation_id":"b913fec9-ae1a-4c18-bfd8-c3f2b8284f66","resolution":{"observed_at":"2026-08-07T00:33:19.586908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.591854Z","title":"does not allow traveling to the second floor","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.591854Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:11b77194289d211d38ae7a2f0cef4ac156319281081ba2e935d7775a3f6c3f05","observation_id":"22b2724e-132d-4889-9947-a15400715054","resolution":{"observed_at":"2026-08-07T00:33:19.591854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17607","last_updated":"2024-12-02T16:13:24Z","snapshot_observed_at":"2026-08-09T12:37:18.065852Z","submitted_at":"2024-11-26T17:19:09Z","title":"Scaling Speech-Text Pre-training with Synthetic Interleaved Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17607","snapshot_observed_at":"2026-08-07T00:33:19.582482Z","title":"Scaling speech-text pre-training with synthetic interleaved data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.582482Z"},"links":{"cited_paper":"/paper/2411.17607","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:c2635042a7998da8765b8375b2f5599036a818ce86c11d4a193037196f287383","observation_id":"7d2c1a34-e4c4-48c0-b0cf-f4ee13d27e4e","resolution":{"observed_at":"2026-08-07T00:33:19.582482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:20.911291Z","title":"URL https://aclanthology.org/ D13-1160/","venue":null,"work_id":"a576aef2-16c3-4908-9a41-48bd34569a67","year":null},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.535826Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:e3ae534c75ad54c9aa616c07b6a2dff8929188bbf610be74f789bfdf1288014e","observation_id":"8c062e03-716e-412a-8997-ad76e25128a1","resolution":{"observed_at":"2026-08-07T00:33:20.916950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T00:33:19.521264Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.521264Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:4c5238693b2f812f03731768230a549459eda12dff398e0bbddfe36238fe28d8","observation_id":"8ede076c-5894-4de9-8ed9-890ce438eb60","resolution":{"observed_at":"2026-08-07T00:33:19.521264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:33:19.336391Z","title":"doi: 10.18653/v1/2024.emnlp-main.342","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.336391Z"},"links":{"citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:354cfb396d718ba57d424fe5b9ccea11cca4c9ccadfabd40717e38d1211c3efb","observation_id":"cba64abf-8252-40a7-9f0b-0e0ebac5daca","resolution":{"observed_at":"2026-08-07T00:33:19.336391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":3,"verified_fuzzy":30},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 5 inbound Pith citation observations for arXiv:2506.13642."}