{"as_of":"2026-08-18T05:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5a23153a2e5bd4e617c473911119449245ae29626b4bce90e6e39a6ca7dea079","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:58:10.657355Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:21:11.838092Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-15T23:21:11.838092Z","title":"Ming-omni: A unified multimodal model for perception and generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:11.838092Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:1d003ad88163d15fac541cc337bf16427ed606030311844dfc3d99511b827f03","observation_id":"f5a44a29-2cb8-4c17-8dc1-78f83a0dfabf","resolution":{"observed_at":"2026-08-15T23:21:11.838092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-06T23:10:11.299104Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19502","last_updated":"2025-07-15T06:04:25Z","snapshot_observed_at":"2026-08-08T09:12:20.223672Z","submitted_at":"2025-06-24T10:40:23Z","title":"MATE: LLM-Powered Multi-Agent Translation Environment for Accessibility Applications","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:10:11.299104Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2506.19502"},"observation_digest":"sha256:479e996e75a5b67fa1433dfdab57ec5b6e3760912bd32ecc5b20223783517b97","observation_id":"d3abfd34-b80c-4e53-9850-34275c614d48","resolution":{"observed_at":"2026-08-06T23:10:11.299104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2511.14582","last_updated":"2026-04-20T05:56:36Z","snapshot_observed_at":"2026-08-17T15:19:50.584357Z","submitted_at":"2025-11-18T15:22:32Z","title":"OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T20:45:37.418493Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2511.14582"},"observation_digest":"sha256:6f077caff87b478facb4daab6ad404b20a60506dd0cf09820a91eb5191942875","observation_id":"81019c43-5f2f-4939-90ec-c12646c4b2ac","resolution":{"observed_at":"2026-05-17T20:50:15.104995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-03T15:26:12.673638Z","title":"Ming-omni: A unified multimodal model for perception and generation.arXiv preprint arXiv:2506.09344, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16978","last_updated":"2026-06-16T16:38:58Z","snapshot_observed_at":"2026-08-07T04:10:11.766593Z","submitted_at":"2025-12-18T18:59:27Z","title":"A Benchmark for Omni-Modal Reasoning in Long Videos","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T15:26:12.673638Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2512.16978"},"observation_digest":"sha256:c99a822d390e1b78fa9c4ff46a869d31bc364541021fa0fa32b0572e61484296","observation_id":"59e6e5ba-9d8b-4c72-a1ef-1317b5dd4ecd","resolution":{"observed_at":"2026-08-03T15:26:12.673638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2602.07064","last_updated":"2026-04-07T13:49:35Z","snapshot_observed_at":"2026-08-11T15:55:44.194747Z","submitted_at":"2026-02-05T14:04:51Z","title":"OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-16T07:09:46.254851Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2602.07064"},"observation_digest":"sha256:0f4151c1159e9effd616210c9ca336b2f13c467542cb05e8b28ab58677720b3e","observation_id":"74fd0d8d-a4eb-4c6d-80d7-b164acdd6b87","resolution":{"observed_at":"2026-05-16T07:10:43.160927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2603.04415","last_updated":"2026-05-09T08:44:16Z","snapshot_observed_at":"2026-08-16T19:48:43.371128Z","submitted_at":"2026-02-04T04:13:39Z","title":"Dual Tuning for Reasoning Efficacy-Driven Data Curation in Multimodal LLM Training","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T08:12:25.063204Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2603.04415"},"observation_digest":"sha256:79526182624b6fac1ba2600c7c206283cfa3015dd6cab17077a2065172bb02f3","observation_id":"2d20c179-b2fc-46c8-9617-2633fc13e696","resolution":{"observed_at":"2026-05-16T08:12:35.432613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":237,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:1e065be07fecf96c1f1f4d9190c21dc438ddbff7c26274a3b7245cc4cf9cecad","observation_id":"69f0c9b0-bad1-475f-857c-98595b03aa46","resolution":{"observed_at":"2026-05-11T08:30:56.929867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2604.12527","last_updated":"2026-07-03T08:49:19Z","snapshot_observed_at":"2026-07-12T21:18:44.451500Z","submitted_at":"2026-04-14T10:00:39Z","title":"Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T14:10:03.707886Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2604.12527"},"observation_digest":"sha256:30ae29a555ff015ce34f2e438fea07f70bf844dc9c087eacf19590dfb0b36588","observation_id":"761672d4-f70a-472c-9291-12db54bc66cc","resolution":{"observed_at":"2026-05-10T14:10:28.289867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-07-12T21:18:46.566338Z","title":"Ming-omni: A unified mul- timodal model for perception and generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.12527","last_updated":"2026-07-03T08:49:19Z","snapshot_observed_at":"2026-07-12T21:18:44.451500Z","submitted_at":"2026-04-14T10:00:39Z","title":"Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T21:18:46.566338Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2604.12527"},"observation_digest":"sha256:eadb76ff456a9aadfad5f97d34cdc3cd49224cca428cbde2fb8af5e9903cf90c","observation_id":"c9f1329d-81bd-4abe-9103-0004a9efcaa5","resolution":{"observed_at":"2026-07-12T21:18:46.566338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2604.14520","last_updated":"2026-04-16T01:21:14Z","snapshot_observed_at":"2026-08-14T06:53:31.710132Z","submitted_at":"2026-04-16T01:21:14Z","title":"Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T12:05:54.551728Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2604.14520"},"observation_digest":"sha256:f3eb2ba7180dc5cffcb6043c3ad1ff612ce864e17d34873979c910f6a8d675b3","observation_id":"9ab75913-f338-49f0-aab7-c3e6c54e60dc","resolution":{"observed_at":"2026-05-10T12:10:22.069624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2604.16902","last_updated":"2026-04-29T05:22:54Z","snapshot_observed_at":"2026-08-10T23:36:15.762831Z","submitted_at":"2026-04-18T08:25:52Z","title":"Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-10T07:02:02.752466Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2604.16902"},"observation_digest":"sha256:8a96a4a3699d2e25539aa77b3a78fffe76ce6a32ff1c787ae1650868db4df07f","observation_id":"61e884c7-de6c-4fe5-b20f-6fa77e4eefd9","resolution":{"observed_at":"2026-05-10T07:11:53.701157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2604.21921","last_updated":"2026-04-23T17:58:38Z","snapshot_observed_at":"2026-08-16T05:47:41.086994Z","submitted_at":"2026-04-23T17:58:38Z","title":"Context Unrolling in Omni Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-09T22:02:57.841111Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2604.21921"},"observation_digest":"sha256:278533d0397c77d8588fb9b95bfa8a2595f23eebc5588fabe87860bbfd7539b3","observation_id":"acd9c863-5d3b-4c7f-bc21-31b756b26a82","resolution":{"observed_at":"2026-05-11T14:21:04.985281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2604.23996","last_updated":"2026-04-27T03:23:19Z","snapshot_observed_at":"2026-08-15T05:33:19.595727Z","submitted_at":"2026-04-27T03:23:19Z","title":"SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T04:41:52.098355Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2604.23996"},"observation_digest":"sha256:167e692528d92b16ee6cf5b9622dd38197bc199982ebf63d035cf7fdf86a514e","observation_id":"d2be920c-3348-412f-aa57-6314db1164f4","resolution":{"observed_at":"2026-05-11T21:41:13.497655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.01638","last_updated":"2026-05-02T22:56:17Z","snapshot_observed_at":"2026-08-16T06:10:46.050322Z","submitted_at":"2026-05-02T22:56:17Z","title":"Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T14:04:52.065878Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.01638"},"observation_digest":"sha256:c19f8c6cf9c09d694c3f0d0283e27d063ae88ec6fb531bcd7a448dd05cf6d05b","observation_id":"6e5184cd-82a6-4083-9a34-8a156e5a6c1b","resolution":{"observed_at":"2026-05-11T17:06:04.247249Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.10501","last_updated":"2026-05-11T12:58:25Z","snapshot_observed_at":"2026-08-17T03:27:36.703529Z","submitted_at":"2026-05-11T12:58:25Z","title":"Accelerating Compound LLM Training Workloads with Maestro","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T05:11:46.845356Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.10501"},"observation_digest":"sha256:a77e1a7f85946964cf49c4ffc6400e9ecba6c144ce0a7d68af405ab0faadf25f","observation_id":"befb3024-ca75-409d-a5ed-cdabcf8ad0aa","resolution":{"observed_at":"2026-05-12T05:31:25.597147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.12056","last_updated":"2026-05-12T12:42:44Z","snapshot_observed_at":"2026-08-14T17:54:30.472172Z","submitted_at":"2026-05-12T12:42:44Z","title":"OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T04:52:03.076788Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.12056"},"observation_digest":"sha256:12f3ab6af3d71a1498c1e8afefc084c2a3f10ace56460e1daf45a7199a0a9a2a","observation_id":"d8a9558d-9a54-4723-b445-58b8bf5b836e","resolution":{"observed_at":"2026-05-13T04:52:16.317482Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.16403","last_updated":"2026-05-13T05:00:19Z","snapshot_observed_at":"2026-07-06T23:27:34.514541Z","submitted_at":"2026-05-13T05:00:19Z","title":"When Vision Speaks for Sound","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T22:12:52.160596Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.16403"},"observation_digest":"sha256:8ff9cda10bca18a1b6d80a358f28f3c35fb73178cf03f112d58ba49bbc7c36f0","observation_id":"a59024a1-6a22-4c83-b3f2-a717820d62e9","resolution":{"observed_at":"2026-05-20T22:13:46.891952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-17T02:34:31.797934Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:edaedefd1f71494798966842c5c52e3f5b59620f2fe47c5de27dcdb994cca307","observation_id":"f9ee4736-29c4-4eb7-a044-59007715992e","resolution":{"observed_at":"2026-05-22T09:26:20.784211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:a1613b8729df91b096cf396e498f878a702cba9d16d114829b8f754c0ad293f7","observation_id":"c38594da-f5fd-434a-8324-fb58ef1d8085","resolution":{"observed_at":"2026-06-29T23:04:02.008433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.27918","last_updated":"2026-05-27T03:44:27Z","snapshot_observed_at":"2026-08-13T15:53:00.896578Z","submitted_at":"2026-05-27T03:44:27Z","title":"Addressing Variable Heterogeneity in Distributed Multimodal Training with Entrain","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T10:20:12.860927Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.27918"},"observation_digest":"sha256:9b7fcbd8c5ff2b43e7d376a7981ad36805b970422538b9c191a120fd4a9fd501","observation_id":"df39790b-feea-4da2-bf12-88b636dfa4a9","resolution":{"observed_at":"2026-06-29T10:23:18.014835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-17T08:21:54.606667Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:722e57f4a9ab62d3a42820002e9ec3e5fd48cf304f56955ed6131302896f1b64","observation_id":"d996737e-1647-4160-bc43-d7ba78b8ea99","resolution":{"observed_at":"2026-06-29T13:03:26.238741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.31603","last_updated":"2026-05-29T17:59:50Z","snapshot_observed_at":"2026-08-12T21:07:03.038294Z","submitted_at":"2026-05-29T17:59:50Z","title":"Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T22:56:21.783415Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.31603"},"observation_digest":"sha256:bc4d4f52a3f9ad39a5b6d90601c8cbcee3cb0c91eb187183c2687c1d7ff504aa","observation_id":"3b14cc91-248a-4b17-a5c9-f6a3c32c0e3e","resolution":{"observed_at":"2026-07-01T19:16:00.560543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2606.01016","last_updated":"2026-05-31T05:13:32Z","snapshot_observed_at":"2026-08-13T15:48:57.500872Z","submitted_at":"2026-05-31T05:13:32Z","title":"PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T17:44:07.669223Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2606.01016"},"observation_digest":"sha256:cb11c11803043d55079041596ada049d8da2db8da9257de1e9ca510110cd17d4","observation_id":"08c308ba-da7e-4407-9d0a-15ed987b1931","resolution":{"observed_at":"2026-06-28T17:52:27.077528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:8b236198669c5ccdda7ffb058722050b62ff41fdc0e8381a3db3ef65d6211459","observation_id":"02327fc4-30ea-44bc-9b36-2beebe1677fc","resolution":{"observed_at":"2026-07-02T17:37:14.025507Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2606.20970","last_updated":"2026-06-18T22:17:18Z","snapshot_observed_at":"2026-08-01T20:10:55.070907Z","submitted_at":"2026-06-18T22:17:18Z","title":"CogniRoute: Learning to Route Social Evidence in Omni-Modal Models","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-06-26T17:37:11.371892Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2606.20970"},"observation_digest":"sha256:60f30f0d6ed93659ab3551c0446696793b1d5116ca0b53300c71556ce2fb8914","observation_id":"ee1207c0-46e7-4a8e-ab52-f27799133443","resolution":{"observed_at":"2026-07-04T03:49:30.273485Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2606.22983","last_updated":"2026-06-22T08:04:12Z","snapshot_observed_at":"2026-08-13T19:15:54.888323Z","submitted_at":"2026-06-22T08:04:12Z","title":"LiveServe: Interaction-Aware Serving for Real-Time Omni-Modal LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T07:26:07.356352Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2606.22983"},"observation_digest":"sha256:8b8a6a2df1bef7ca1e94df91605a4219bed6ae94b05b00de4f17998b9fe639d7","observation_id":"90f74144-9e31-4f1f-aa25-c288041dabe8","resolution":{"observed_at":"2026-07-04T11:59:50.658325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2606.23080","last_updated":"2026-06-22T09:30:02Z","snapshot_observed_at":"2026-08-17T00:39:07.624929Z","submitted_at":"2026-06-22T09:30:02Z","title":"AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T07:24:01.244733Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2606.23080"},"observation_digest":"sha256:3d7996d4e221f33b229949968ea4cb116895851b62bdcdf7f6a39f704b02cd80","observation_id":"6d083d17-7830-4795-8cfb-bb967d85bd16","resolution":{"observed_at":"2026-07-04T11:59:50.906567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2606.26968","last_updated":"2026-06-25T12:40:39Z","snapshot_observed_at":"2026-08-14T12:28:23.502257Z","submitted_at":"2026-06-25T12:40:39Z","title":"RedVox: Safety and Fairness Gaps in Speech Models Across Languages","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-06-26T04:37:00.399470Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2606.26968"},"observation_digest":"sha256:d1343ed4112898e2a47e82529d61a9831b0f7e8bc44be161c0d196b90bb58714","observation_id":"0bf63540-2e1d-4b51-a92a-1afe5db3e18e","resolution":{"observed_at":"2026-07-04T13:59:52.826743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-04T20:58:27.262829Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01785","last_updated":"2026-08-03T06:59:15Z","snapshot_observed_at":"2026-08-15T19:40:12.543019Z","submitted_at":"2026-08-03T06:59:15Z","title":"HorizonServe: Coordinating Request Scheduling with GPU Sharing for Omni-Model Serving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:27.262829Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2608.01785"},"observation_digest":"sha256:facecd5cfb3cea98fd793c8c45a05a69980c98b09fd20e9a75c6e713d419ae55","observation_id":"2dc81df9-a333-482f-b9d6-c0138f50139a","resolution":{"observed_at":"2026-08-04T20:58:27.262829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-10T18:47:42.569068Z","title":"Jaeyong Kang and Dorien Herremans","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06900","last_updated":"2026-08-07T07:35:00Z","snapshot_observed_at":"2026-08-16T15:59:17.557541Z","submitted_at":"2026-08-07T07:35:00Z","title":"MMAG: A Multi-Control Mixed Audio Generation Benchmark","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T18:47:42.569068Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2608.06900"},"observation_digest":"sha256:20a17b5e54d127862896a4703c0d6f38d9a2017701fa7e8d064654f5d05d50d7","observation_id":"50206a3c-3d6f-47da-8401-f85120f2b15a","resolution":{"observed_at":"2026-08-10T18:47:42.569068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09344/citation-record","integrity":"/paper/2506.09344/integrity","json":"/paper/2506.09344/citation-record.json","paper":"/paper/2506.09344"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T04:58:06.798089Z","title":"Seed-tts: A family of high-quality versatile speech generation models.CoRR, abs/2406.02430,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:06.798089Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:f08910c6be2d4d6ac1535508cb7967914e67a740dd32d58a5dc389fcd4c3379a","observation_id":"97c7ba52-f118-4652-bb40-c2f3d27a5a33","resolution":{"observed_at":"2026-08-07T04:58:06.798089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T04:58:07.024845Z","title":"Qwen2-audio technical report.arXiv preprint arXiv:2407.10759,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.024845Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:8a0d5e068b5926ec2a856873162d7efbc798e54a6b68b6b6e09c4e0a78a5fcdc","observation_id":"c3067baf-60f0-4653-b297-95bb30c869df","resolution":{"observed_at":"2026-08-07T04:58:07.024845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04938","last_updated":"2017-06-13T22:48:53Z","snapshot_observed_at":"2026-08-14T21:39:35.517738Z","submitted_at":"2016-09-16T08:14:50Z","title":"Image-to-Markup Generation with Coarse-to-Fine Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04938","snapshot_observed_at":"2026-08-07T04:58:07.289619Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.289619Z"},"links":{"cited_paper":"/paper/1609.04938","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:feb7095432c480639770efcfdb3cfbf4712505e6864ce3a4605d9883142957c5","observation_id":"682af26a-c8b6-492e-ba35-32edade64f8a","resolution":{"observed_at":"2026-08-07T04:58:07.289619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:07.341301Z","title":"Chaoyou Fu, Y uhan Dai, Y ondong Luo, Lei Li, Shuhuai Ren, Renrui Zhang, Zihan Wang, Chenyu Zhou, Y unhang Shen, Mengdan Zhang, et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.341301Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:15a6716544519a747c5d8f743b8b6cb735953e5def31b09ad4637a727a681f08","observation_id":"374d689e-3863-4d1c-8886-b7d8710bd148","resolution":{"observed_at":"2026-08-07T04:58:07.341301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-16T17:41:04.946563Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-07T04:58:07.524656Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage.arXiv preprint arXiv:2111.09344,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.524656Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:cdeb757e38bd7824779c20e8e516b6461f327c039a63909d606b3de28e174e1c","observation_id":"007423dc-82e9-40c5-be88-0607471da412","resolution":{"observed_at":"2026-08-07T04:58:07.524656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-16T15:31:59.301352Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-07T04:58:07.617554Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit, 2023.https://arxiv.org/abs/2305.11013","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.617554Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:7f6be212f11649c9c175a5f24da53cb66eb7549abf94fad59451386adb57ed2a","observation_id":"70a0d441-835b-48cb-9407-933b084066dc","resolution":{"observed_at":"2026-08-07T04:58:07.617554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18778","last_updated":"2025-04-07T08:54:28Z","snapshot_observed_at":"2026-08-16T12:55:09.792048Z","submitted_at":"2025-02-26T03:21:12Z","title":"M2-omni: Advancing Omni-MLLM for Comprehensive Modality Support with Competitive Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18778","snapshot_observed_at":"2026-08-07T04:58:07.736425Z","title":"M2-omni: Advancing omni-mllm for comprehensive modality support with competitive performance.arXiv preprint arXiv:2502.18778,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.736425Z"},"links":{"cited_paper":"/paper/2502.18778","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:0692a62cb7509edb1e62986d1b5d22b349c87fb2392fec2accca10f1d973957e","observation_id":"fa731db0-4fbb-40fc-9444-209b2dd5062e","resolution":{"observed_at":"2026-08-07T04:58:07.736425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-07T04:58:07.970950Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.970950Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:7890f98dc68182e21a7947e6b3a5921307bd03e8e4f50a5136f1c2cc4ef0dbc5","observation_id":"608617b7-2ee3-443b-8385-e8a2114b71e8","resolution":{"observed_at":"2026-08-07T04:58:07.970950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02471","snapshot_observed_at":"2026-08-07T04:58:08.031807Z","title":"Ming-lite-uni: Advancements in unified architecture for natural multimodal interaction, 2025.https://arxiv.org/abs/2505.02471","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.031807Z"},"links":{"cited_paper":"/paper/2505.02471","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:d3c927f029ef380352d0cbeae6237356dec93c8940e4ba9a5d2e14bab33f393d","observation_id":"852eed35-e376-4708-b0b5-c93c3bc3d385","resolution":{"observed_at":"2026-08-07T04:58:08.031807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03929","last_updated":"2022-10-08T05:49:05Z","snapshot_observed_at":"2026-08-16T16:25:57.189395Z","submitted_at":"2022-10-08T05:49:05Z","title":"EgoTaskQA: Understanding Human Tasks in Egocentric Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03929","snapshot_observed_at":"2026-08-07T04:58:08.132037Z","title":"Wei Kang, Xiaoyu Y ang, Zengwei Y ao, Fangjun Kuang, Yifan Y ang, Liyong Guo, Long Lin, and Daniel Povey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.132037Z"},"links":{"cited_paper":"/paper/2210.03929","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:010cae60eebb4cd499e0e77e8df440b44e2f0d2cff5b557e67f15b8253bd9836","observation_id":"c10826b0-b811-4ac8-848d-710487f0c234","resolution":{"observed_at":"2026-08-07T04:58:08.132037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12241","last_updated":"2023-12-19T15:25:39Z","snapshot_observed_at":"2026-08-17T08:08:13.643438Z","submitted_at":"2023-12-19T15:25:39Z","title":"GeomVerse: A Systematic Evaluation of Large Models for Geometric Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12241","snapshot_observed_at":"2026-08-07T04:58:08.217484Z","title":"Geomverse: A systematic evaluation of large models for geometric reasoning, 2023.https://arxiv.org/abs/2312.12241","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.217484Z"},"links":{"cited_paper":"/paper/2312.12241","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:4ef8a3ad419668c5244b3517c0722b4a63c1275c5da442f0cdbac44afca93f5d","observation_id":"1d6e47b9-39d2-47d4-8707-2ace687eb27f","resolution":{"observed_at":"2026-08-07T04:58:08.217484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05139","last_updated":"2025-03-10T14:21:21Z","snapshot_observed_at":"2026-08-16T12:52:17.388517Z","submitted_at":"2025-03-07T04:43:39Z","title":"Every FLOP Counts: Scaling a 300B Mixture-of-Experts LING LLM without Premium GPUs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05139","snapshot_observed_at":"2026-08-07T04:58:08.521682Z","title":"doi: 10.18653/v1/2024.naacl-long.392.https://aclanthology.org/2024.naacl-long.392/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.521682Z"},"links":{"cited_paper":"/paper/2503.05139","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:781ac4671834c12c59fb384ee5411ccbf6605c027f59e0b037b88cbb60c38e64","observation_id":"45760fc5-91b9-4438-85c6-7bc341c48d89","resolution":{"observed_at":"2026-08-07T04:58:08.521682Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09542","last_updated":"2021-02-18T18:44:50Z","snapshot_observed_at":"2026-08-16T18:44:36.581805Z","submitted_at":"2021-02-18T18:44:50Z","title":"SLAKE: A Semantically-Labeled Knowledge-Enhanced Dataset for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09542","snapshot_observed_at":"2026-08-07T04:58:08.699216Z","title":"Slake: A semantically-labeled knowledge-enhanced dataset for medical visual question answering, 2021.https://arxiv.org/abs/2102.09542","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.699216Z"},"links":{"cited_paper":"/paper/2102.09542","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:e6f45116170e804835485135fc8a4dab636553ffb5629667e8ab0de9498d4325","observation_id":"241556af-9e91-45bc-b9e4-46a607fba19f","resolution":{"observed_at":"2026-08-07T04:58:08.699216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.findings-acl.177.https://aclanthology.org/2022.findings-acl.177/","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:10.682796Z","title":"doi: 10.18653/v1/2022.findings-acl.177.https://aclanthology.org/2022.findings-acl.177/","venue":null,"work_id":"436222f5-bcd7-4b1b-b381-bac55dea020e","year":2022},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.892938Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:51ff98795eb3e282002700c17d9e31cb096cafbc353b95cf33bf9f00d50d14f3","observation_id":"37d6edeb-42af-4c5b-a1e8-f2372a242aa4","resolution":{"observed_at":"2026-08-07T04:58:10.687629Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:09.033058Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.033058Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:88826712621d01e3e22e5368901345f5f74ac56f887b5db0d638acbdb9727370","observation_id":"ac6a8a02-1cf9-4fc5-ba9e-97f7ff1cced6","resolution":{"observed_at":"2026-08-07T04:58:09.033058Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07626","last_updated":"2025-03-25T06:19:32Z","snapshot_observed_at":"2026-08-15T15:31:36.046464Z","submitted_at":"2024-12-10T16:05:56Z","title":"OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07626","snapshot_observed_at":"2026-08-07T04:58:09.094956Z","title":"Xichen Pan, Satya Narayan Shukla, Aashu Singh, Zhuokai Zhao, Shlok Kumar Mishra, Jialiang Wang, Zhiyang Xu, Jiuhai Chen, Kunpeng Li, Felix Juefei-Xu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.094956Z"},"links":{"cited_paper":"/paper/2412.07626","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:f77a0cdc2525ac1159358a162ad2d79d6b33360f63f8223933c485d450838f0a","observation_id":"46ecc3aa-3986-4892-9349-3a8f625cc6e7","resolution":{"observed_at":"2026-08-07T04:58:09.094956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T04:58:09.209905Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.209905Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:8e5049e5e990e844f3b02dbdb36029da445b125c7bbf0870e0cc5adfd7a04723","observation_id":"f2333b94-35d2-4b2f-a9d0-565eff4f8b12","resolution":{"observed_at":"2026-08-07T04:58:09.209905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-08-15T16:45:09.638988Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-08-07T04:58:09.373118Z","title":"Mls: A large-scale multilingual dataset for speech research.arXiv preprint arXiv:2012.03411,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.373118Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:662f73bdf1005129d26a4d58337855851dc66a0424883d3dbd17f48173f0a330","observation_id":"7eafccbb-e235-443d-8afd-81a331039c9e","resolution":{"observed_at":"2026-08-07T04:58:09.373118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-08-15T18:07:41.591747Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-07T04:58:09.513337Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation.arXiv preprint arXiv:2412.03069,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.513337Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:f5346dc2481aea9925d6ed0cae085a12d5c4369d861682d0eaeb00b2313a4167","observation_id":"f69c249c-b6b3-444c-90c8-e4e86784bdca","resolution":{"observed_at":"2026-08-07T04:58:09.513337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-17T14:14:30.066593Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-07T04:58:09.654968Z","title":"Cinepile: A long video question answering dataset and benchmark, 2024.https://arxiv.org/abs/2405.08813","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.654968Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:c25d91ac11bc9120d7430fe0cf21d53fba91529db4d9d2e72807c8cfb3a50f0e","observation_id":"bf3a7020-ca82-45ec-a2de-6bcdbce815e5","resolution":{"observed_at":"2026-08-07T04:58:09.654968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-08-13T17:36:16.794649Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-07T04:58:09.864477Z","title":"Christoph Schuhmann, Romain Beaumont, Richard V encu, Cade Gordon, Ross Wightman, Mehdi Cherti, Theo Coombes, Aarush Katta, Clayton Mullis, Mitchell Wortsman, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.864477Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:9103200c7e9239ec9f48d2886b54be9e4248c4db591a852648942b9634cac519","observation_id":"c07e59de-411a-49eb-bf6f-bea0b08dda42","resolution":{"observed_at":"2026-08-07T04:58:09.864477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:11.611811Z","title":"Solving geometry problems: Combining text and diagram interpretation","venue":null,"work_id":"0baf2ea6-0b48-4bbc-b7f4-a81bc8f027d8","year":2015},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.991644Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:a89e94b2a8914b72af356fa291f588d50c3c2073a02b0cd00fa363f4391ed48e","observation_id":"d59c8a55-e419-462d-96a2-21ec867793db","resolution":{"observed_at":"2026-08-07T04:58:11.694092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-17T07:24:03.168446Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-07T04:58:10.204457Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning.arXiv preprint arXiv:2412.14164,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.204457Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:6210afc6388f8d23768d238eae3fcd683a47343bb7e5a7fe39b3198d46514ac8","observation_id":"9789e5df-5103-4315-9e4b-142f38f3933b","resolution":{"observed_at":"2026-08-07T04:58:10.204457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.01320","last_updated":"2020-06-09T19:24:52Z","snapshot_observed_at":"2026-08-06T23:26:52.451979Z","submitted_at":"2020-02-04T14:35:28Z","title":"CoVoST: A Diverse Multilingual Speech-To-Text Translation Corpus","version":2},"cited_work":{"arxiv_id":"2002.01320","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.01320","snapshot_observed_at":"2026-08-07T04:58:10.887678Z","title":"CoVoST: A Diverse Multilingual Speech-To-Text Translation Corpus","venue":"cs.CL","work_id":"d425c91e-f309-4da9-80f1-ac230200c582","year":2020},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.339655Z"},"links":{"cited_paper":"/paper/2002.01320","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:052018bb6908b50771e4bee2f6eba2ed3bad4333fbd937bdf04b52ace57dcf1a","observation_id":"b49d0d64-18d9-4b4d-8235-aa46a9201558","resolution":{"observed_at":"2026-08-07T04:58:10.891623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:10.428391Z","title":"Slidespeech: A large scale slide-enriched audio-visual corpus","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.428391Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:88359fbcd9473f4cd4bd711b1908ef2f621273c456cd75cd3db7071c30e41d32","observation_id":"32ca496a-6bf1-4228-b6be-b1ab8a8463ec","resolution":{"observed_at":"2026-08-07T04:58:10.428391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23218","last_updated":"2024-10-30T17:10:19Z","snapshot_observed_at":"2026-08-12T18:02:58.527813Z","submitted_at":"2024-10-30T17:10:19Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23218","snapshot_observed_at":"2026-08-07T04:58:10.542544Z","title":"Os-atlas: A foundation action model for generalist gui agents, 2024c","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.542544Z"},"links":{"cited_paper":"/paper/2410.23218","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:9fe2438ed14b682ea1b7948922cf26ef56f8facee657ab5bda17c00925fd455e","observation_id":"36a390e8-a972-421e-8826-460332d0dfae","resolution":{"observed_at":"2026-08-07T04:58:10.542544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:10.633339Z","title":"ISBN 9798400701085","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.633339Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:41727c9d5f9cd486fb66a9f13930d7554c1d19bcd97af262e3af5341e83ab32f","observation_id":"a82d713d-511c-41f1-8255-6d2bf0604a2a","resolution":{"observed_at":"2026-08-07T04:58:10.633339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-07T04:58:10.636410Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.636410Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:8a5045a7ae074b6fb0968717a22367a55156e4e432b3d5374661e4591f789fc4","observation_id":"4bb92906-f6d6-4b38-a808-d40f05bc41ba","resolution":{"observed_at":"2026-08-07T04:58:10.636410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06040","last_updated":"2024-10-25T06:32:09Z","snapshot_observed_at":"2026-08-16T13:44:40.227891Z","submitted_at":"2024-06-10T06:17:55Z","title":"Vript: A Video Is Worth Thousands of Words","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06040","snapshot_observed_at":"2026-08-07T04:58:10.639605Z","title":"Vript: A video is worth thousands of words.arXiv preprint arXiv:2406.06040,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.639605Z"},"links":{"cited_paper":"/paper/2406.06040","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:bfc714f7ec561c9382ca58b3edf34178b59db4e3455d24656a28032813835555","observation_id":"049d0006-7368-460b-a253-3cfe11c2066f","resolution":{"observed_at":"2026-08-07T04:58:10.639605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-15T09:44:57.157415Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-07T04:58:10.642605Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization.arXiv preprint arXiv:2503.10615,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.642605Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:d7b20e5e53ef8ddaf57a1eb63d16f7d9763967e858d5a4896b9a90dce4f4f3dc","observation_id":"1f598556-2f20-496f-b72b-02e98b4cf9ad","resolution":{"observed_at":"2026-08-07T04:58:10.642605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:11.515595Z","title":"Fan Y u, Shiliang Zhang, Yihui Fu, Lei Xie, Siqi Zheng, Zhihao Du, Weilong Huang, Pengcheng Guo, Zhijie Y an, Bin Ma, Xin Xu, and Hui Bu","venue":null,"work_id":"2ee0f4af-129c-4115-ac31-cd7fea6154ec","year":2022},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.645410Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:c5ee3f6d69b3df11cb354022c9affe9eb74f2eed287b6472391bb880d4ec333f","observation_id":"41c20c2a-d8e2-49e7-88b9-94142f01a28d","resolution":{"observed_at":"2026-08-07T04:58:11.532420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:11.476590Z","title":"Icdar 2023 competition on structured text extraction from visually-rich document images,","venue":null,"work_id":"27dd52c0-b252-4cc4-b5e4-afbdfd7bfc44","year":2023},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.648677Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:b4287124ad718b27a83ed7c57e6c5874567a15c8c533d40294c7d2dff17614b0","observation_id":"9e141403-3595-47f2-9a8b-2d1e9bd1a02a","resolution":{"observed_at":"2026-08-07T04:58:11.488768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03287","last_updated":"2023-06-05T22:20:52Z","snapshot_observed_at":"2026-08-16T15:26:21.556086Z","submitted_at":"2023-06-05T22:20:52Z","title":"ICDAR 2023 Competition on Structured Text Extraction from Visually-Rich Document Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03287","snapshot_observed_at":"2026-08-07T04:58:10.651374Z","title":"Albert Zeyer, André Merboldt, Wilfried Michel, Ralf Schlüter, and Hermann Ney","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.651374Z"},"links":{"cited_paper":"/paper/2306.03287","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:f2882a2aa5f6326eefa07bfbfc64d027d74ee0dca2c1335f9dc5647a6b1efeb4","observation_id":"53a379cc-53de-4149-a087-873789b7006f","resolution":{"observed_at":"2026-08-07T04:58:10.651374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03370","last_updated":"2022-02-23T06:42:31Z","snapshot_observed_at":"2026-08-16T17:51:10.961289Z","submitted_at":"2021-10-07T12:05:29Z","title":"WenetSpeech: A 10000+ Hours Multi-domain Mandarin Corpus for Speech Recognition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.03370","snapshot_observed_at":"2026-08-07T04:58:10.654286Z","title":"WENETSPEECH: A 10000+ hours multi-domain mandarin corpus for speech recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.654286Z"},"links":{"cited_paper":"/paper/2110.03370","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:76fcda01d5b61349be31438135b2ae122d365019ffb30a36d4b73851c9365018","observation_id":"19cd9c47-a240-4442-9e8b-0599fd5ce481","resolution":{"observed_at":"2026-08-07T04:58:10.654286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:11.441851Z","title":null,"venue":null,"work_id":"cdf66757-6231-40bf-9ff4-e1ea6ee5d6de","year":2025},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.657355Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:2c2fb394b02c599ea703e938f28c7cce6873ba1f80d05de5d5517d8c8bc069b1","observation_id":"4defd50b-aaff-4b29-9951-93ad0d5ea30d","resolution":{"observed_at":"2026-08-07T04:58:11.450100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-16T14:18:27.107802Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-07T04:58:09.750924Z","title":"McAuley, and Derek Zhiyuan Cheng","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:09.750924Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:581e14dcb0e43b1d5d774625e0253a940ea9cbb966231652be47f943874e2d2d","observation_id":"9d290ed7-dc77-45a3-b4e6-29d20b1418fa","resolution":{"observed_at":"2026-08-07T04:58:09.750924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-17T03:46:28.942551Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-07T04:58:08.350784Z","title":"doi: 10.3115/v1/D14-1086.https://aclanthology.org/D14-1086/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.350784Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:a4ef88dacbc6829a4265563c68985b64b78317b81d7898fbef30af07cf448f3d","observation_id":"d2e49b1d-b157-49f3-9bcf-4b9f40b7fff0","resolution":{"observed_at":"2026-08-07T04:58:08.350784Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d15-1171.https://aclanthology.org/d15-1171/","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:10.976784Z","title":"doi: 10.18653/v1/D15-1171.https://aclanthology.org/D15-1171/","venue":null,"work_id":"50be67c6-b12d-4344-b7c1-7409b0e9c285","year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:10.103677Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:891b673f8bc02e8d1658de22861683b76a595182fcb18598011572177fb1bdc2","observation_id":"87b56999-0a42-4485-8fba-9bd04296c0b8","resolution":{"observed_at":"2026-08-07T04:58:10.979960Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:08.785940Z","title":"Ahmed Masry, Do Xuan Long, Jia Qing Tan, Shafiq Joty, and Enamul Hoque","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.785940Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:9d0b4d85cf3d38102d80f1111974ce8dae80713281483f8d6a46daa691186a12","observation_id":"63b21592-3895-4dd0-b2c3-1a91ca1766ec","resolution":{"observed_at":"2026-08-07T04:58:08.785940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:08.412448Z","title":"Chemvlm: Exploring the power of multimodal large language models in chemistry area, 2025.https://arxiv.org/abs/2408.07246","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:08.412448Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:b04a5455361c5954399b281b7919e2bc4db33a69ee260ff1def4a131cb6a5434","observation_id":"df7893b3-3daa-45b7-9005-e5980e6ac6e0","resolution":{"observed_at":"2026-08-07T04:58:08.412448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02746","last_updated":"2022-12-06T04:37:51Z","snapshot_observed_at":"2026-08-16T16:10:44.189376Z","submitted_at":"2022-12-06T04:37:51Z","title":"UniGeo: Unifying Geometry Logical Reasoning via Reformulating Mathematical Expression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02746","snapshot_observed_at":"2026-08-07T04:58:07.001154Z","title":"Unigeo: Unifying geometry logical reasoning via reformulating mathematical expression, 2022.https://arxiv.org/abs/2212.02746","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.001154Z"},"links":{"cited_paper":"/paper/2212.02746","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:6efebb94b5b1d1f3850d44ad1fb3624c25b272ad5cbb029c428be81f7045c9e4","observation_id":"8e9975ef-c8b3-42a2-a663-b1273312b613","resolution":{"observed_at":"2026-08-07T04:58:07.001154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:11.794728Z","title":null,"venue":null,"work_id":"a1972c99-da9b-4944-b6d0-084dd8f427f4","year":2022},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:06.958681Z"},"links":{"citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:667ba8fd31f01ceb2943a8fea2cd14defd599fdf1d0aa5d34ec768ef16351400","observation_id":"96fbd220-840b-4192-b178-0abc448886f6","resolution":{"observed_at":"2026-08-07T04:58:11.904982Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-07T04:58:07.163409Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models.arXiv preprint arXiv:2409.17146,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.163409Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:118c81d22cd8a3380952abcad59227fc3d4b3f12e0e5d17cc5b6c5c6cc43a379","observation_id":"414aa10c-dfc5-4e9a-aea4-45c25b413918","resolution":{"observed_at":"2026-08-07T04:58:07.163409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T04:58:06.891957Z","title":"Qwen2.5-vl technical report, 2025a.https://arxiv.org/abs/2502.13923","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:06.891957Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:e207deb3f66fbadfff4a815b7eceb061d73f8ae2186b23ab7506c387ae3d5806","observation_id":"7bf8485e-b10a-48ca-b658-b84698963118","resolution":{"observed_at":"2026-08-07T04:58:06.891957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-16T13:36:26.053658Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-07T04:58:07.862140Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation, 2024.https://arxiv.org/abs/2407.05361","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.862140Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:58cb42d5795707e376335a29b468c894c87b5bd6d4b003121026cdfe94c62b2b","observation_id":"619ad11f-4d92-493b-ac30-edf1ab09139c","resolution":{"observed_at":"2026-08-07T04:58:07.862140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":5,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 30 inbound Pith citation observations for arXiv:2506.09344."}