{"as_of":"2026-08-09T17:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a55d88cc8568f4f329d4b1ba6dde12bce6892bbe5d8ecfeae65be253d080e925","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:47:39.389717Z","state":"measured"},{"denominator":113,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":113,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:36:40.820699Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:49:57.266999Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T08:34:36.824053Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2505.23747"},"observation_digest":"sha256:83a93502ca05549928cc296502cefe6a662cb414b3e4070912bee3c828656967","observation_id":"72593941-1480-4b2f-8cae-5df4ae47d81a","resolution":{"observed_at":"2026-05-16T08:34:36.856851Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T00:59:13.826054Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2505.23747"},"observation_digest":"sha256:18b3bd7dd03b836c78c60043653898559406efa3c0481107143269d1cdbcaddc","observation_id":"f4be1992-5bfe-4944-9db6-92afa7afd6d1","resolution":{"observed_at":"2026-05-22T01:00:51.428555Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-07T11:36:40.820699Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment.arXiv preprint arXiv:2502.04328, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01872","last_updated":"2025-06-02T17:01:40Z","snapshot_observed_at":"2026-08-09T08:34:10.848320Z","submitted_at":"2025-06-02T17:01:40Z","title":"Is Extending Modality The Right Path Towards Omni-Modality?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:40.820699Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2506.01872"},"observation_digest":"sha256:0055a6ddb0cff08189c360425076790afbf6b8b98f13893557373c548f93e546","observation_id":"79da6943-9a46-463a-9bf6-86ecd9b7955a","resolution":{"observed_at":"2026-08-07T11:36:40.820699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-07T10:27:05.533023Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.533023Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:c282d711fc4ad3cdc0ee721016630662934a73d92811b53ed53053c33af821aa","observation_id":"be396407-bbd2-4d64-bb62-6ae72aab8163","resolution":{"observed_at":"2026-08-07T10:27:05.533023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-07T10:27:08.562512Z","title":"Ola: Pushing the frontiers of omni-modal language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.562512Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:9676556af0a332d12aff03a7b1b05a780cafbfa8e2a4423df004c535664f6290","observation_id":"bf4ec20d-c45d-4fb2-90a6-085f09707196","resolution":{"observed_at":"2026-08-07T10:27:08.562512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-07T10:50:52.719441Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-09T06:09:58.091457Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.719441Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:f17ddea13ca6d7713667bc0544bb5d9db71ac6ea930e992ceebab0cd9754f2b0","observation_id":"757897fa-3c40-4072-bca9-bb4530bc2848","resolution":{"observed_at":"2026-08-07T10:50:52.719441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-07T00:34:32.454824Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:32.454824Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:dd1b12f17e1d56a85a72a250e1e2ee651526535ef8919c04b22528d1835721e1","observation_id":"6a229ab0-3baa-4764-bed8-d65f74e078af","resolution":{"observed_at":"2026-08-07T00:34:32.454824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-06T22:36:13.250680Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.250680Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:39f885ce0f15adfa4ad155269b9a298b9e76441872caca9a17e533be6415ebb0","observation_id":"b21fc665-8563-4dac-84d1-1b4f15f5c7a2","resolution":{"observed_at":"2026-08-06T22:36:13.250680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2507.05920","last_updated":"2026-04-20T01:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T12:05:05Z","title":"High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T06:10:57.219445Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2507.05920"},"observation_digest":"sha256:9f3839dae0a71d52a217718c6e021cca795b167266358b8d7fff00d8e68f7d1b","observation_id":"891797d4-fed9-483a-87f6-fb8f24729b7f","resolution":{"observed_at":"2026-05-19T06:12:07.011738Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-06T15:48:33.446078Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15028","last_updated":"2025-07-20T16:30:33Z","snapshot_observed_at":"2026-08-08T09:10:28.397518Z","submitted_at":"2025-07-20T16:30:33Z","title":"Towards Video Thinking Test: A Holistic Benchmark for Advanced Video Reasoning and Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:33.446078Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2507.15028"},"observation_digest":"sha256:1f75149db08a3b0d238c0fd618dbc4def3fa1e26d16b480d57c59788aa0c4db7","observation_id":"37c6c68c-dfa0-458c-aa6f-d438fb959ff9","resolution":{"observed_at":"2026-08-06T15:48:33.446078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-05T19:03:07.832466Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13692","last_updated":"2025-08-19T09:52:04Z","snapshot_observed_at":"2026-08-09T03:24:13.317916Z","submitted_at":"2025-08-19T09:52:04Z","title":"HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:07.832466Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2508.13692"},"observation_digest":"sha256:acfbf945855506f04ae802f6e8b6ccd8559eb0e0a203a12791d54e5d66168283","observation_id":"96ea2f47-d8aa-495b-8e66-fb699670c22b","resolution":{"observed_at":"2026-08-05T19:03:07.832466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-05T14:42:21.059602Z","title":"Ola: Pushing the frontiers of omni-modal language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21113","last_updated":"2025-09-02T13:37:38Z","snapshot_observed_at":"2026-08-05T14:42:19.666014Z","submitted_at":"2025-08-28T17:48:19Z","title":"R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T14:42:21.059602Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2508.21113"},"observation_digest":"sha256:f3bc4968ca5c516d87ec68599bbb7bc8b4a70551263f8ca7fa8b88ba677d72e1","observation_id":"93a144e0-8404-42a2-b380-4c3252808c8b","resolution":{"observed_at":"2026-08-05T14:42:21.059602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-03T17:16:40.028245Z","title":"Ola: Pushing the frontiers of omni-modal language model.arXiv:2502.04328, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10324","last_updated":"2026-06-22T06:41:41Z","snapshot_observed_at":"2026-08-03T17:16:35.340426Z","submitted_at":"2025-12-11T06:18:58Z","title":"EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T17:16:40.028245Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2512.10324"},"observation_digest":"sha256:ba5baef5939f9188d2bd46132eb0da406ae7127ab4a30de8186cc720b01bf661","observation_id":"1b28e4ed-9481-4ad9-9b68-ffef3d04fb0f","resolution":{"observed_at":"2026-08-03T17:16:40.028245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-03T09:30:01.361938Z","title":"Ola: Pushing the frontiers of omni-modal language model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-08T07:44:31.776591Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:01.361938Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:566614cea8168a254f912474efdef676aafa29f30bf0c95b96a786919b079240","observation_id":"52c170a9-6577-4502-9730-ac4b1ecd25c6","resolution":{"observed_at":"2026-08-03T09:30:01.361938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2604.14520","last_updated":"2026-04-16T01:21:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T01:21:14Z","title":"Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T12:05:54.551728Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2604.14520"},"observation_digest":"sha256:6a6271ccc8f9ef6a2571ace903ce51c4a64ff7f5ad7073336093c8b8f0477741","observation_id":"feb94f13-ae33-40bc-a428-480a624c18e5","resolution":{"observed_at":"2026-05-10T12:10:22.170122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2604.16617","last_updated":"2026-04-17T18:13:27Z","snapshot_observed_at":"2026-08-02T22:28:35.019925Z","submitted_at":"2026-04-17T18:13:27Z","title":"AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T08:02:53.574120Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2604.16617"},"observation_digest":"sha256:f52159523c2744f9979a16773a2af4c771baf3fe54d7109f09e2f70ae780654a","observation_id":"2c6d5228-e79f-41a6-952e-3860e9100e21","resolution":{"observed_at":"2026-05-10T09:18:32.227284Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2604.18460","last_updated":"2026-04-20T16:16:36Z","snapshot_observed_at":"2026-07-06T23:05:17.639285Z","submitted_at":"2026-04-20T16:16:36Z","title":"Learning Invariant Modality Representation for Robust Multimodal Learning from a Causal Inference Perspective","version":1},"reference_index":281,"source":"arxiv_source","source_observed_at":"2026-05-10T04:32:29.428080Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2604.18460"},"observation_digest":"sha256:7cc2f26d07ca1837d6ad2d392651f22e4ebc513cdad077a12c45ad70aeed4a97","observation_id":"23330239-3260-46ab-bcb0-7c3a5a358b14","resolution":{"observed_at":"2026-05-11T11:51:03.196437Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2605.01278","last_updated":"2026-05-06T13:38:25Z","snapshot_observed_at":"2026-08-03T15:19:19.861810Z","submitted_at":"2026-05-02T06:25:48Z","title":"Valley3: Scaling Omni Foundation Models for E-commerce","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-09T14:53:55.160230Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2605.01278"},"observation_digest":"sha256:a7f3af592aa554924f3e6549f1e95590cb2db78c3e0c6d6facfd1122230bb8c8","observation_id":"1f256362-ffdb-4a6b-bfac-9af589abdda7","resolution":{"observed_at":"2026-05-11T16:51:05.976588Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2605.07593","last_updated":"2026-05-08T11:06:43Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T11:06:43Z","title":"TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T01:53:01.939765Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2605.07593"},"observation_digest":"sha256:dbe4685388b172fe91c58f39dd9180b5940dcdf4a37989e8425c3521de6a0e71","observation_id":"bea1c93c-b9e3-4145-bf8c-0242fa2c665f","resolution":{"observed_at":"2026-05-11T04:15:55.936975Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2605.13737","last_updated":"2026-05-13T16:14:44Z","snapshot_observed_at":"2026-08-08T08:09:04.636080Z","submitted_at":"2026-05-13T16:14:44Z","title":"Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T18:06:27.962891Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2605.13737"},"observation_digest":"sha256:66dcdc160741828c3b32c3f07abb101a94d5a9c386dcf6d0d41ea6e84de99970","observation_id":"576aaaa5-9692-4b5a-bcf5-e9d11540dc1b","resolution":{"observed_at":"2026-05-14T18:07:33.673297Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2605.18710","last_updated":"2026-05-18T17:44:29Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:44:29Z","title":"Mosaic: Towards Efficient Training of Multimodal Models with Spatial Resource Multiplexing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T07:53:11.761843Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2605.18710"},"observation_digest":"sha256:144ef0b4bb422cae5231f420aa389743df9f69b5aef3ea5a34690e4b4c83c400","observation_id":"e310f04a-6116-4a6b-a3ad-cf50d7278c41","resolution":{"observed_at":"2026-05-20T07:53:24.776257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2605.22907","last_updated":"2026-05-21T18:00:22Z","snapshot_observed_at":"2026-08-02T16:30:28.109405Z","submitted_at":"2026-05-21T18:00:22Z","title":"VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T05:51:49.390597Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2605.22907"},"observation_digest":"sha256:21646065c6e4d40835e82ed3225c4e9db7c27913375174893ab83361b81a361e","observation_id":"e046fc4b-1d3e-439a-8325-8d14bb80a7b7","resolution":{"observed_at":"2026-05-25T05:55:24.901284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2605.27918","last_updated":"2026-05-27T03:44:27Z","snapshot_observed_at":"2026-08-07T14:18:52.976120Z","submitted_at":"2026-05-27T03:44:27Z","title":"Addressing Variable Heterogeneity in Distributed Multimodal Training with Entrain","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T10:20:12.860927Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2605.27918"},"observation_digest":"sha256:6c212b92adceac51f6165d48a9c2df0b4e00752605b5b2128965b185c874dc82","observation_id":"3843e84b-bbca-4776-8646-153ed1d55dc8","resolution":{"observed_at":"2026-06-29T10:23:17.992169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:fb732cda8a216f5443985c2a9d3c491c46dec6035d01ccbc8f4fff93afd04ca1","observation_id":"1ed0ee24-4c98-4e50-97f0-f325d22baf69","resolution":{"observed_at":"2026-06-29T13:03:26.177260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:15048f89d46c53ba3a9fff35510584e5b26784e02c61b6ac90c30676ff97af63","observation_id":"65eca983-78dc-43d8-af42-ee4c9ea5a895","resolution":{"observed_at":"2026-07-01T23:06:21.391014Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2606.10147","last_updated":"2026-06-08T20:26:09Z","snapshot_observed_at":"2026-08-03T03:43:21.595942Z","submitted_at":"2026-06-08T20:26:09Z","title":"From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T16:12:53.387567Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2606.10147"},"observation_digest":"sha256:2d1a19dd34974467d56ec65b14309a6db42b66f8b0b1734e9a44bb0a2c81220a","observation_id":"0a3d6fd9-e5aa-4f55-851a-05d55517200a","resolution":{"observed_at":"2026-07-03T01:57:32.365632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2606.12018","last_updated":"2026-06-10T12:44:02Z","snapshot_observed_at":"2026-08-03T20:21:32.396120Z","submitted_at":"2026-06-10T12:44:02Z","title":"MODF-SIR: A Multi-agent Omni-modal Distilled Framework for Social Intelligence Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T09:43:56.299302Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2606.12018"},"observation_digest":"sha256:d2010f1fc4de41242b89dedb60f71d1843afcfaf700813edff3a4a9a90007471","observation_id":"ba0ac130-32b2-431e-a8a1-0f689da9c32a","resolution":{"observed_at":"2026-07-03T10:58:03.433035Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2606.20970","last_updated":"2026-06-18T22:17:18Z","snapshot_observed_at":"2026-08-01T20:10:55.070907Z","submitted_at":"2026-06-18T22:17:18Z","title":"CogniRoute: Learning to Route Social Evidence in Omni-Modal Models","version":1},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-06-26T17:37:11.371892Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2606.20970"},"observation_digest":"sha256:e2c85750922e89783e7df4455af8c0972fadafa7d88dc7da803f50ed0615edac","observation_id":"7c30ffa1-b114-4e1e-a1ce-e3adfb50705d","resolution":{"observed_at":"2026-07-04T03:49:30.386746Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2606.24286","last_updated":"2026-06-23T08:06:58Z","snapshot_observed_at":"2026-08-07T04:14:24.900720Z","submitted_at":"2026-06-23T08:06:58Z","title":"AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T00:16:56.174638Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2606.24286"},"observation_digest":"sha256:6b0e58ec577ee1e46764b5ef174d545959d8656e7d5a63e2399133b50254d8f2","observation_id":"ae2729d0-56ea-4491-963f-4bd682948047","resolution":{"observed_at":"2026-07-04T16:49:57.269489Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2606.26968","last_updated":"2026-06-25T12:40:39Z","snapshot_observed_at":"2026-07-31T01:20:28.481331Z","submitted_at":"2026-06-25T12:40:39Z","title":"RedVox: Safety and Fairness Gaps in Speech Models Across Languages","version":1},"reference_index":128,"source":"arxiv_source","source_observed_at":"2026-06-26T04:37:00.399470Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2606.26968"},"observation_digest":"sha256:25ecddcb766d92a77af1e981a74007ef6592491355717931eb7a6590addf5884","observation_id":"53305da3-9d94-4f90-9e0b-b2b6ea9cba5f","resolution":{"observed_at":"2026-07-04T13:59:52.872965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2502.04328 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:6bfb768f2aaaedcf1239967ccae81b3a7db297994c96140341ffae66548bf932","observation_id":"367c2df0-13f8-499a-b7d2-0f7a77a9917a","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-12T05:48:27.255331Z","title":"arXiv preprint arXiv:2502.04328 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02963","last_updated":"2026-07-03T05:13:19Z","snapshot_observed_at":"2026-08-09T08:34:06.125045Z","submitted_at":"2026-07-03T05:13:19Z","title":"Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T05:48:27.255331Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2607.02963"},"observation_digest":"sha256:adb27f53856e520327cdba7a76469e6547963db77cd4148d58029567854afd78","observation_id":"b27d6c40-0dd5-4988-85f7-3028d1c79fa7","resolution":{"observed_at":"2026-07-12T05:48:27.255331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-01T21:22:50.700260Z","title":"arXiv preprint arXiv:2502.04328 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16107","last_updated":"2026-07-17T16:41:15Z","snapshot_observed_at":"2026-08-06T12:38:24.456240Z","submitted_at":"2026-07-17T16:41:15Z","title":"Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-01T21:22:50.700260Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2607.16107"},"observation_digest":"sha256:8bd61a7f69bb6dc69fb0fe565170ceeeeb1cd453ec4e1f1a00f42724d1a37a72","observation_id":"66981f95-7734-4775-aed4-d246dfee7d91","resolution":{"observed_at":"2026-08-01T21:22:50.700260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04328/citation-record","integrity":"/paper/2502.04328/integrity","json":"/paper/2502.04328/citation-record.json","paper":"/paper/2502.04328"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-08T22:47:39.033803Z","title":"Musiclm: Generating music from text.arXiv preprint arXiv:2301.11325,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.033803Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:13920586ca2ee9875daca58366789c5bc6ca9ad2131f4876656191cf301065fc","observation_id":"36cc8bf1-f639-4d93-9b12-f766ef5737cc","resolution":{"observed_at":"2026-08-08T22:47:39.033803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-08T22:47:39.039633Z","title":"Pixtral 12b.arXiv preprint arXiv:2410.07073,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.039633Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:e840039f86709157c55baa57556747792ce627bc2a8442f85e784def319a1756","observation_id":"96c0d92a-1af9-4948-8e4b-d2c433f5928c","resolution":{"observed_at":"2026-08-08T22:47:39.039633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:39.044339Z","title":"Flamingo: a visual language model for few-shot learning.NeurIPS, 35: 23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.044339Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:4f5df5cb8f8b8ab305ef2122aa85472bd7e5f216ebb6098a22a2f9af95d4a5bc","observation_id":"e4eb3386-1687-4e99-a13f-255dd36cfdba","resolution":{"observed_at":"2026-08-08T22:47:39.044339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04160","last_updated":"2023-05-22T02:37:02Z","snapshot_observed_at":"2026-08-03T10:34:58.776935Z","submitted_at":"2023-05-07T02:25:42Z","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04160","snapshot_observed_at":"2026-08-08T22:47:39.048721Z","title":"X-llm: Bootstrapping advanced large language models by treating multi-modalities as foreign languages.arXiv preprint arXiv:2305.04160, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.048721Z"},"links":{"cited_paper":"/paper/2305.04160","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:19489cba28123a58103d5bbc8b16ce1ac84c9528529b5b8b3f592a330b6e888b","observation_id":"c298e9bf-9dda-47d5-b750-d6aa875e20e2","resolution":{"observed_at":"2026-08-08T22:47:39.048721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-09T08:32:43.969496Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-08T22:47:39.053243Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio.arXiv preprint arXiv:2106.06909, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.053243Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:5bf88ecf6d9ca49a4127e848448886090376e8007504813c6686b6444a2ca943","observation_id":"339dcc89-68b2-4e8b-ab24-4856fa4e70ca","resolution":{"observed_at":"2026-08-08T22:47:39.053243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-08T22:47:39.057732Z","title":"Are we on the right way for evaluating large vision- language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.057732Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:5d0e086ca3b37a1acc1cb25715a9bc35436d7d365df738ccdbc83962c1f0b896","observation_id":"1d05a51c-ac15-48bd-bfb8-255fc99a0ebd","resolution":{"observed_at":"2026-08-08T22:47:39.057732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-08T22:47:39.062734Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.062734Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:0b6658fc63570771d0a811e215bf941431eac9f71c2d25481fdabb69b8bb8ba8","observation_id":"84909031-5f6e-4f8d-8289-8991b2a172e7","resolution":{"observed_at":"2026-08-08T22:47:39.062734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.543453Z","title":"Beats: Audio pre- training with acoustic tokenizers","venue":null,"work_id":"0cda3410-d8be-4fd3-9114-8dd4d4e31384","year":2022},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.067887Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:57aedf75a74a6df2383e57035d6fb2d2a2ae3213f73a22f7f2edc40dd6369eb8","observation_id":"b69afcea-1c75-4a4f-8d2d-068d06171ca0","resolution":{"observed_at":"2026-08-08T22:47:40.548206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-08T22:47:39.073045Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.073045Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:fd31605e2280bf2a4edf63baea6b2ca96ca954f49ff8cad8674d37369e7cd53a","observation_id":"d3d61bf3-5cef-4116-b793-1bcec186b665","resolution":{"observed_at":"2026-08-08T22:47:39.073045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.529228Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"ff80cb84-a214-42d1-8cfa-4397ddcb492a","year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.077800Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:4b257452b33bc4a307d3aa4529703d187396abedfb9fd6d77ffbd7d959a0f8a6","observation_id":"aa5fd178-274f-479b-b61a-10d16037da86","resolution":{"observed_at":"2026-08-08T22:47:40.533798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-08T22:47:39.082294Z","title":"Qwen2-audio technical report.arXiv preprint arXiv:2407.10759, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.082294Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:982d0a71aa05badd694849521d28ccd7e45a1b5370d4bfe56507a2f6f28a7082","observation_id":"0d6deb94-f2a1-45f5-a16b-c5b2bd9df8e6","resolution":{"observed_at":"2026-08-08T22:47:39.082294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-08T22:47:39.087369Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multi- modal models.arXiv preprint arXiv:2409.17146, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.087369Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:4f97e6ca194a162318dcf637b41cc07c5d12e0e4cf8ca2112fa6957df64ca0e5","observation_id":"a8095656-7376-4254-90e7-aa126aa79d0f","resolution":{"observed_at":"2026-08-08T22:47:39.087369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-08T22:47:39.092001Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models.arXiv preprint arXiv:2411.14432, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.092001Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:59052554aefb9df768e34a162a1aeb78fd989ae6c16afda19d99bd2667146b3f","observation_id":"be010433-2ee2-4dd2-8caf-8680846187d5","resolution":{"observed_at":"2026-08-08T22:47:39.092001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.515006Z","title":"Clotho: An audio captioning dataset","venue":null,"work_id":"5a27ceb8-38fe-4121-9e6e-44bc1f0e39f4","year":2020},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.096858Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:347c593abc093e7da6c565d61c46562571e87c9449559724e6319baadd164c6b","observation_id":"c4ac83af-cfa6-4765-bf09-a7c46045218f","resolution":{"observed_at":"2026-08-08T22:47:40.519585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:39.101465Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.101465Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:1d3d67c80ca8d75971b39ec21c4285a0ab5366af1e2cf038e663df003daedf7d","observation_id":"b2c86b57-3462-43f1-a363-34c80cbe1f48","resolution":{"observed_at":"2026-08-08T22:47:39.101465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-08T22:47:39.105733Z","title":"Llama-omni: Seamless speech interaction with large language models.arXiv preprint arXiv:2409.06666, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.105733Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:d32c79f819de45d3db1818d70bb434681099481003540ad49eb88188f6fef019","observation_id":"7dc3286d-0748-4cc8-888e-601fe4d49c74","resolution":{"observed_at":"2026-08-08T22:47:39.105733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.490723Z","title":"Finevideo","venue":null,"work_id":"3cb35bca-aa3e-432c-ad46-e16cef17b0d9","year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.110748Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:83755f289f850d68b57269819798fa1657866e88c80fd8a72ee28c7b5b522b9f","observation_id":"9ec2ccbc-8a75-4cb3-9c5c-e8732075f457","resolution":{"observed_at":"2026-08-08T22:47:40.495231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.475987Z","title":"Prompting large language models with speech recognition abilities","venue":null,"work_id":"1d6baf3b-92df-4f4f-af05-14911e9dab93","year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.115161Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:9b87858b83e49c7c302336bf5c741cc9c37eb87233e4155f842d6a6f2611e21a","observation_id":"b6edf24a-58d0-40ea-83be-7dbb610912a8","resolution":{"observed_at":"2026-08-08T22:47:40.480758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-07T05:22:51.503928Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-08T22:47:39.119516Z","title":"Video-ccam: Enhancing video-language un- derstanding with causal cross-attention masks for short and long videos.arXiv preprint arXiv:2408.14023, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.119516Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:3fce83d5266746ad38565a4280d573bb9ba90cd4222946b442a1fe2b35d38043","observation_id":"748aef16-b096-4671-98f1-b15f73cda2a0","resolution":{"observed_at":"2026-08-08T22:47:39.119516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-08T22:47:39.124203Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.124203Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:f0d26bb44caf55ccc2bdb2bb43621e04beabde0eff8ba09d076d4985f8d160ab","observation_id":"b20dffb3-3b4d-48fb-95ed-2a4a6244f084","resolution":{"observed_at":"2026-08-08T22:47:39.124203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-07-06T18:58:56.504337Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-08T22:47:39.128649Z","title":"Vita: Towards open-source interactive omni multimodal llm.arXiv preprint arXiv:2408.05211, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.128649Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:368a501619837972e7a620b66de5fc7ef5d43442fed637194f17faab2ffe6edb","observation_id":"8cc93ee0-cec6-44eb-9cc5-923a6683089f","resolution":{"observed_at":"2026-08-08T22:47:39.128649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-08T22:47:39.133157Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction.arXiv preprint arXiv:2501.01957,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.133157Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:027d8453dbf45416195d3b3a01a60fb7730ca7e9e7dad4e748c3769d096bb929","observation_id":"284e8d0c-f632-4704-9b80-307f553280a2","resolution":{"observed_at":"2026-08-08T22:47:39.133157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-08T22:47:39.138130Z","title":"Gemini 1.5: Unlocking multimodal under- standing across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.138130Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:c3840ab3846df83fd18bf07dc50896d172aa77a25e73742407f380e720eccee1","observation_id":"9190eed9-e584-49e2-b687-6d0b3c4bd1f7","resolution":{"observed_at":"2026-08-08T22:47:39.138130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:39.142824Z","title":"Hallusionbench: an advanced diag- nostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.142824Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:33fdf7999a50176d3c2de7a26e90e0058d162294c4fa8164d38bdc9601359707","observation_id":"32799e57-afca-408e-97c5-16b96a1b73a1","resolution":{"observed_at":"2026-08-08T22:47:39.142824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-08T22:47:39.147822Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale.arXiv preprint arXiv:2412.05237,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.147822Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:277ea5950c283e0d4ecb947db4fde5f48f838fc0960e97fca6b358cd4fa817a5","observation_id":"f02c1b66-f08c-445d-a481-2881b210d20a","resolution":{"observed_at":"2026-08-08T22:47:39.147822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.452384Z","title":"3d-llm: Injecting the 3d world into large language models.NeurIPS, 36:20482– 20494, 2023","venue":null,"work_id":"9ba6ade1-a61b-4697-ada1-e80803f61853","year":2023},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.152244Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:c32f008a827b076fed8f0e21a6b60679bcaacbc700a9698a87653275bca61b84","observation_id":"68d3c0cc-b976-4704-b1ed-ae04ece4bc1e","resolution":{"observed_at":"2026-08-08T22:47:40.456893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.437411Z","title":"Audiogpt: Understanding and generating speech, music, sound, and talking head","venue":null,"work_id":"fbefb1eb-e046-4885-a412-4eb02291cc16","year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.156237Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:c5225960baff70af2a22cbe09a6175c4dba864e2aca7e538c26f5af56d36edc7","observation_id":"3286a960-6612-4779-9a7d-7be08835858f","resolution":{"observed_at":"2026-08-08T22:47:40.442436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.423428Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"5e0ac52d-5ab6-4ec7-a5aa-bccfbbb07d19","year":null},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.160152Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:f1c7bba89aaab20803d2b36582c974da896b37a8adbeb94d3c27d9beb8da7374","observation_id":"915809bb-967a-49ec-9b7b-587b34b1c388","resolution":{"observed_at":"2026-08-08T22:47:40.428020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.409258Z","title":"Audiocaps: Generating captions for audios in the wild","venue":null,"work_id":"44964674-8f99-47de-96e5-86ce4c616da7","year":2019},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.164136Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:d32eeaf408e308442968b04234ac327f0915463fd15f07cdb37b7a415cc082ca","observation_id":"cd595f54-6dfd-477a-be1f-5417575e5ac8","resolution":{"observed_at":"2026-08-08T22:47:40.413912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:39.168130Z","title":"What matters when building vision-language models?,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.168130Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:576e34da019fc16ca41e53dc16946bc60d54b053d91c93a8982691b7fe2a9474","observation_id":"094c9579-4d98-4f7c-ac56-95046e30840c","resolution":{"observed_at":"2026-08-08T22:47:39.168130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-08T22:47:39.172390Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.172390Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:ce44aac8eba5bdbb0c35615ac3abf999ef3b37a7e6847b66db175c8ae9c87508","observation_id":"2ccad04d-6854-46c4-9f16-3d646fad8786","resolution":{"observed_at":"2026-08-08T22:47:39.172390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.385773Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"b1214973-f50f-4d2f-b7f2-08099ebb3bdf","year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.176335Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:7be3e960e9c48141f78ed2dc27186e290a12a16cdf2e336544f818fb7103a692","observation_id":"c7a3cc94-b33c-4581-ab86-4b75029c9ab9","resolution":{"observed_at":"2026-08-08T22:47:40.390244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-08T22:47:39.180712Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models.arXiv preprint arXiv:2403.18814,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.180712Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:bc476b683c427371babdd987a0d051668ab3211ba5b1979a8205a615659fa362","observation_id":"e2c42e2c-b04c-4a94-8f70-42b3e1f71714","resolution":{"observed_at":"2026-08-08T22:47:39.180712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-08T22:47:39.185155Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.185155Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:04efb426a5e2256b1549db6aeed199e4f2ef7ca9693de15a6dfb6a582c1f6064","observation_id":"aa6285d0-f875-4fac-b0b9-9ac1cdc58209","resolution":{"observed_at":"2026-08-08T22:47:39.185155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.372051Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"ee953ec8-3861-40bc-9cf0-87ab7bad1850","year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.189638Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:4aa73e4219b543575afc61d5ea34d1c9fb7bc4a31e0abdfe6a92a99fa586960b","observation_id":"e1c9e7d7-3850-434b-b9d2-bda94cdf279d","resolution":{"observed_at":"2026-08-08T22:47:40.376428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.357831Z","title":"Visual instruction tuning.NeurIPS, 36, 2024","venue":null,"work_id":"4dec7cb2-0b1a-4b07-aa21-fcd7b95147e7","year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.193766Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:30e67b5c6bb6db04b7852ced8e0b44ddb0c81fc85d5eb881345846fe11ff9878","observation_id":"42a524a5-c017-416e-b7d9-00b89c4ce79c","resolution":{"observed_at":"2026-08-08T22:47:40.362427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-08T22:47:39.197952Z","title":"Mmbench: Is your multi-modal model an all-around player?arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.197952Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:f6b54ac7caf4a5d1cda5c1bd5348d96c8d883e8335a687877347f38942157bcd","observation_id":"6a7e792b-09d0-461e-8e87-0be6e8c963b9","resolution":{"observed_at":"2026-08-08T22:47:39.197952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-08T22:47:39.202509Z","title":"On the hidden mystery of ocr in large multimodal models.arXiv preprint arXiv:2305.07895, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.202509Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:5bf8a86784739f50800bd34b090c998cc1d753006ecf019f51b217dc1759ab9a","observation_id":"3f1ea753-738a-42b7-9dd4-3a7ad0fe66d2","resolution":{"observed_at":"2026-08-08T22:47:39.202509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-08T22:47:39.207697Z","title":"Oryx mllm: On-demand spatial- temporal understanding at arbitrary resolution.arXiv preprint arXiv:2409.12961, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.207697Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:f550a5d7233f9d00ff486d4f8aea224719d92fd77ffc76109d21de2e37624f50","observation_id":"0d28cb45-166f-4728-9025-ba01d2f44225","resolution":{"observed_at":"2026-08-08T22:47:39.207697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-08-08T22:47:39.212186Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models.arXiv preprint arXiv:2403.12966,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.212186Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:e299a28655f1922b6bdb40080b75b54e68108b92d1d0f0fa629c798f391bb392","observation_id":"12ae62c6-8899-485a-86ff-e0ce6deaca68","resolution":{"observed_at":"2026-08-08T22:47:39.212186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18121","last_updated":"2024-07-25T15:29:05Z","snapshot_observed_at":"2026-08-06T16:34:48.329762Z","submitted_at":"2024-07-25T15:29:05Z","title":"Efficient Inference of Vision Instruction-Following Models with Elastic Cache","version":1},"cited_work":{"arxiv_id":"2407.18121","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.18121","snapshot_observed_at":"2026-08-08T22:47:39.754876Z","title":"Efficient Inference of Vision Instruction-Following Models with Elastic Cache","venue":"cs.CV","work_id":"a8ec3383-f901-4544-8263-c0293dc7d812","year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.216914Z"},"links":{"cited_paper":"/paper/2407.18121","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:b6bff34825b7b78095d5c0c4ef08b3332370a03a59388da8349f786f47ad1268","observation_id":"2ef09257-3459-4409-ae06-ddae9877efd8","resolution":{"observed_at":"2026-08-08T22:47:39.762001Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-08T22:47:39.221310Z","title":"Deepseek-vl: towards real-world vision-language understanding.arXiv preprint arXiv:2403.05525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.221310Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:d20f8121d2e0843087da9f234fb71ae6a7da2e13d05d206b466c6fc80b46898d","observation_id":"285adbf9-99ec-436d-88a5-531da218938b","resolution":{"observed_at":"2026-08-08T22:47:39.221310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-08T22:47:39.225870Z","title":"Mathvista: Evaluating mathemati- cal reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.225870Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:06ad2e31238d17540dbc413a8082d8234200f77b9239d22039dc18e80c9e73d7","observation_id":"7bbe32ce-e38a-4d57-af59-e3947f23078f","resolution":{"observed_at":"2026-08-08T22:47:39.225870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-08T22:47:39.230344Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models.arXiv preprint arXiv:2306.05424, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.230344Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:38d19bc454bfbdf103a9c57d3aae94f3f821ddedd733e85dd757616c6708ec44","observation_id":"73c510a9-e742-4f9e-b557-48e913ef9a77","resolution":{"observed_at":"2026-08-08T22:47:39.230344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.343682Z","title":"The million song dataset challenge","venue":null,"work_id":"9e511943-9ce7-46e2-984a-16506e29b6c8","year":2012},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.234810Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:2f39f4e43e70aac9bc0edfc6a9b05d0d7820c981a51c989bcfa796aa8b5b41d0","observation_id":"c7000482-891b-43e8-9b24-80a146338ddc","resolution":{"observed_at":"2026-08-08T22:47:40.348049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.328857Z","title":"Wavcaps: A chatgpt-assisted weakly- labelled audio captioning dataset for audio-language multi- modal research.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2024","venue":null,"work_id":"778ba1b8-fa8c-4a69-96f7-f4f7c3fdd91e","year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.239231Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:2de2e225d9baec78f0c21aeae2abfe26336c1988df6dd323c391631a9563bd64","observation_id":"d33f4b2f-646c-4215-9fd7-429c655d951f","resolution":{"observed_at":"2026-08-08T22:47:40.333894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.314952Z","title":"Openai gpt-3.5 api.OpenAI API, 2023","venue":null,"work_id":"769e62d1-8cda-46c8-a0ac-250c416cf237","year":2023},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.243492Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:d60abe819ed55e682c191c397d089ee61a77cb70e887924a8e51bf68e98b9276","observation_id":"468d8b70-41a2-4d10-9a9e-cf29947a2a4f","resolution":{"observed_at":"2026-08-08T22:47:40.319172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.300260Z","title":"Gpt-4v(ision) system card.OpenAI Blog, 2023","venue":null,"work_id":"7f0e4579-461d-4b8a-a2a4-50a01b6ab071","year":2023},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.247874Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:1109a32ef9c3b437f506054b2fbd29d6083b18cb2b58400562b65dc47907c5dd","observation_id":"f5ac6ca2-80f7-4bab-b80c-c1ac36009b3b","resolution":{"observed_at":"2026-08-08T22:47:40.305194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T22:47:39.252511Z","title":"Gpt-4 technical report.ArXiv:abs/2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.252511Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:195b3f1baf01d92d7590b045a5936eaecb04a02e065d02e91afb87f1f49eeb07","observation_id":"b14035cc-a05b-41da-aa4a-11279cf1e9eb","resolution":{"observed_at":"2026-08-08T22:47:39.252511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.285063Z","title":"Hello gpt-4o — openai.OpenAI Blog, 2024","venue":null,"work_id":"17bf5dc2-9774-4436-a2c4-e6b29544a309","year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.257343Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:e813e3e034f8b5e5ce9af4b441ddd2a1c130c31083ce513547a708dc9526663e","observation_id":"f2a69b28-10c8-4593-8d99-0192b7704f5c","resolution":{"observed_at":"2026-08-08T22:47:40.289737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.269335Z","title":"Librispeech: an asr corpus based on public do- main audio books","venue":null,"work_id":"1940b524-0229-416a-89fb-6a90ae516d1a","year":null},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.261725Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:9c48e0c1d26bb8b021b0558efda9336fef25be6b0e7b47044f315aaaf80692e2","observation_id":"2d958a66-1976-49d6-a5c8-c63f236b158d","resolution":{"observed_at":"2026-08-08T22:47:40.273985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16009","last_updated":"2024-05-25T02:22:09Z","snapshot_observed_at":"2026-07-06T18:19:42.946629Z","submitted_at":"2024-05-25T02:22:09Z","title":"Streaming Long Video Understanding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16009","snapshot_observed_at":"2026-08-08T22:47:39.266066Z","title":"Streaming long video understanding with large language models.arXiv preprint arXiv:2405.16009, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.266066Z"},"links":{"cited_paper":"/paper/2405.16009","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:cb0ff677e007f8804977385dbcae0f63942d8911c6b0d304806f2dad26f8bb2c","observation_id":"ebde3cab-2cd6-4a00-bb8a-fb189d31bb3e","resolution":{"observed_at":"2026-08-08T22:47:39.266066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-08T22:47:39.270605Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.270605Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:45f1fa455f79bd3966836907a2b8d67d791c2937823b9f9d3b110fe602c6e1a2","observation_id":"e6e01e05-6c44-437d-b3ea-3e9c669289ca","resolution":{"observed_at":"2026-08-08T22:47:39.270605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.254204Z","title":"Qwen2-vl: To see the world more clearly.Wwen Blog, 2024","venue":null,"work_id":"3bf312a4-fdc7-47d3-ae63-522ed6f2d53c","year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.274734Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:c37f46fc4a8d8e95db93a6c409d7939fcc759c2f2f5ca5b8eaa90c2004a45060","observation_id":"dbf09d75-de8a-41a8-a55e-6ba4d5f982f0","resolution":{"observed_at":"2026-08-08T22:47:40.259014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.238619Z","title":"Robust speech recog- nition via large-scale weak supervision, 2022","venue":null,"work_id":"08e8ffbf-5cec-474e-8d5f-38d5744faff4","year":2022},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.278590Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:793595c282dbe9929073a72ec2cddedf1bfea138eebba59c98c6f2d42eaec19b","observation_id":"5135a1fb-ca51-431e-90c1-90af14ff915c","resolution":{"observed_at":"2026-08-08T22:47:40.243530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.223796Z","title":"Am-radio: Agglomerative vision foundation model reduce all domains into one","venue":null,"work_id":"a7914ce9-aae5-444f-a8e2-5a5195737946","year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.282567Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:2876fbbb9502308230eafcc4a0585b834f6bde06c7f60d06864e8c18a5709969","observation_id":"6bc40731-e56a-4617-ab74-3b1a1ff2a2bd","resolution":{"observed_at":"2026-08-08T22:47:40.228446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-07T17:42:30.374808Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-08T22:47:39.286819Z","title":"Cinepile: A long video question answering dataset and benchmark.arXiv preprint arXiv:2405.08813, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.286819Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:049782a1d0927e39ee1165345d6fb19d3f970b10966a03ed04cc57bf3ffe88c5","observation_id":"ba1cb269-c287-4983-b8a5-afd2497a9b36","resolution":{"observed_at":"2026-08-08T22:47:39.286819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-08T22:47:39.290979Z","title":"Audiopalm: A large language model that can speak and listen.arXiv preprint arXiv:2306.12925, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.290979Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:87f0ea9bdd41e7757febf785492cc541f7f53e3a1c2b3ba9a4a815ceb10b9a76","observation_id":"6a7c2c05-3021-4866-989e-068aa7196854","resolution":{"observed_at":"2026-08-08T22:47:39.290979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-07-06T19:39:23.839070Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-08T22:47:39.295397Z","title":"Mmau: A massive multi-task audio understanding and reasoning benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.295397Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:6984f8d87f7ef21a914e7a40eb227c83f54d54916ee475e07ec34af37f688e12","observation_id":"92bffe21-3310-495a-91bf-cb568b7dbb45","resolution":{"observed_at":"2026-08-08T22:47:39.295397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-08T22:47:39.299864Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.299864Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:b29e233e49aa965667452e06e14a3d3502f29a42104a2ada598d954c77928f5f","observation_id":"f4e70091-ef1b-4385-8c25-f8fa97886be9","resolution":{"observed_at":"2026-08-08T22:47:39.299864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-08T22:47:39.304398Z","title":"Salmonn: Towards generic hearing abilities for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.304398Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:6115ecdda83397dd4a4ebf2e66b3cb19369b2be9092a40dc66b7e4a5fdd71f37","observation_id":"b62ffc24-67a2-48c9-8536-aabd360bf92c","resolution":{"observed_at":"2026-08-08T22:47:39.304398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.208140Z","title":"Qwen2.5: A party of foundation models, 2024","venue":null,"work_id":"9fe0d4dc-92dc-4476-9492-86e658a403c4","year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.308845Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:267882fbaed67512506d258eab3d2a845f3c7e4b83f55a1da4804fc1258ff225","observation_id":"8f29f496-73dd-4629-a25a-71cfb294925d","resolution":{"observed_at":"2026-08-08T22:47:40.213910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:39.312940Z","title":"Qwen2.5-vl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.312940Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:b2e7c06756f2d77704593572cb3732fde28e91ac8c3f11dacadbbefb3f95f7f9","observation_id":"f02690d6-cb74-4241-99e1-3fd1f20758c7","resolution":{"observed_at":"2026-08-08T22:47:39.312940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.09827","last_updated":"2017-04-06T01:13:41Z","snapshot_observed_at":"2026-08-02T08:54:24.339847Z","submitted_at":"2016-11-29T20:26:00Z","title":"Learning Features of Music from Scratch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.09827","snapshot_observed_at":"2026-08-08T22:47:39.317222Z","title":"Learn- ing features of music from scratch.arXiv preprint arXiv:1611.09827, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.317222Z"},"links":{"cited_paper":"/paper/1611.09827","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:c735373d46c7c6e88788c63d6eb44e9cccec09899af723a1f6d5cf8162397109","observation_id":"9655bb93-6ecd-4ba6-a0df-4dc8aec363b0","resolution":{"observed_at":"2026-08-08T22:47:39.317222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-08T22:47:39.322045Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.arXiv preprint arXiv:2406.16860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.322045Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:a9f034ec4c4f3f11d6cbd4d93cc2a2534119499c36d6950c97e1c29629ffef86","observation_id":"dcf6dc59-a89d-43bf-9aa5-a1cf5dd525de","resolution":{"observed_at":"2026-08-08T22:47:39.322045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-08T22:47:39.326631Z","title":"Longvideobench: A benchmark for long-context inter- leaved video-language understanding.arXiv preprint arXiv:2407.15754, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.326631Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:04282bd171d29f7c298123c64ee37d75e7c7ec38edbf17d2852c662993a7523f","observation_id":"21dda9e6-26c1-4c46-ab0d-76e8d652c64f","resolution":{"observed_at":"2026-08-08T22:47:39.326631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.182265Z","title":"On decoder-only architecture for speech-to-text and large language model integration","venue":null,"work_id":"16d33162-e954-4168-9adb-e1e666c4e72e","year":2023},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.331408Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:22383a5c524ca02a823ba0cc29aa1ac10c6c1d18f2be1ee13303ab35822c1dea","observation_id":"b5dbb05a-f09a-4431-9b3f-2c114c7bc473","resolution":{"observed_at":"2026-08-08T22:47:40.186955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11190","last_updated":"2024-11-05T02:27:57Z","snapshot_observed_at":"2026-07-06T19:33:34.819837Z","submitted_at":"2024-10-15T02:10:45Z","title":"Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11190","snapshot_observed_at":"2026-08-08T22:47:39.335713Z","title":"Mini-omni2: Towards open- source gpt-4o model with vision, speech and duplex.arXiv preprint arXiv:2410.11190, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.335713Z"},"links":{"cited_paper":"/paper/2410.11190","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:6fb524b9c626b0dc3dd683270fce2223c79ae0cef2910e058d5cd2460aea4f46","observation_id":"e74f88dd-b47d-41e1-bc18-36eb5ea138e0","resolution":{"observed_at":"2026-08-08T22:47:39.335713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-08T22:47:39.340402Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.340402Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:40792c5b92d1cc2924503bd4539a126fc37711d88555ae1973728bfa50f5e83e","observation_id":"b9c0e938-8242-4b36-a5e8-c13da6e66357","resolution":{"observed_at":"2026-08-08T22:47:39.340402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07729","last_updated":"2024-07-26T06:30:47Z","snapshot_observed_at":"2026-08-06T03:59:19.956442Z","submitted_at":"2024-02-12T15:41:22Z","title":"AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07729","snapshot_observed_at":"2026-08-08T22:47:39.344979Z","title":"Air-bench: Benchmarking large audio- language models via generative comprehension.arXiv preprint arXiv:2402.07729, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.344979Z"},"links":{"cited_paper":"/paper/2402.07729","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:14e8e476e0c6723eadafb36acf20d98b0e1fd0c25c0d9d4703738f607f79669f","observation_id":"8d754839-e1c2-444b-b95f-24a45f959baa","resolution":{"observed_at":"2026-08-08T22:47:39.344979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-08T22:47:39.349659Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.349659Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:df5f3aec927eb42149be4d68e208816f497716f39425e2aa89a27ad1d2f78266","observation_id":"1e41759d-1964-4f45-a720-32c7192f653a","resolution":{"observed_at":"2026-08-08T22:47:39.349659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-08T22:47:39.354193Z","title":"Yi: Open foundation models by 01","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.354193Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:e3e8f6aa023ea9368de91841a658f9c9ed261a2dfb6890ad14a230ed5ee30cb0","observation_id":"4fa3a959-f049-4aa8-8f20-891d7b801c66","resolution":{"observed_at":"2026-08-08T22:47:39.354193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.167309Z","title":"Mmmu: A massive multi-discipline multi- modal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"d86ff6ba-3eed-4302-a765-abcefabbe8a9","year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.358992Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:3c4a2af7f686d97e05e4ef602f155da7e9c1a12877297b92486dc7efd5044dbe","observation_id":"8b956f44-8267-4cab-af4c-f303836b5dbb","resolution":{"observed_at":"2026-08-08T22:47:40.172036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-08T22:47:39.363415Z","title":"Libritts: A corpus derived from librispeech for text-to-speech.arXiv preprint arXiv:1904.02882, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.363415Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:49d1e320e69479e75d44f1b67adcace1c05bfd2bf90cea69f911207a64b2f719","observation_id":"4024c18d-223e-408b-bbd8-b86158815af2","resolution":{"observed_at":"2026-08-08T22:47:39.363415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.152394Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"cb4d86d5-bb66-4ea8-96ff-396827a039b0","year":2023},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.368080Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:945b4bca62b0f6015779e27fadc15a247466393ad8f282fddd7b6d90759cfa70","observation_id":"15082f6f-e3ea-42c3-b2b2-4273c8c5f284","resolution":{"observed_at":"2026-08-08T22:47:40.156938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-07T10:56:05.622094Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-08T22:47:39.372296Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities.arXiv preprint arXiv:2305.11000, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.372296Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:a42b4a0553ab87ed82d4f570fc6b7e31295828584d09c849fd2805c527b3833b","observation_id":"a5d9ac97-e599-4e74-ab34-e903bb88d8a9","resolution":{"observed_at":"2026-08-08T22:47:39.372296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09596","last_updated":"2024-12-12T18:58:30Z","snapshot_observed_at":"2026-08-04T06:52:46.954992Z","submitted_at":"2024-12-12T18:58:30Z","title":"InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09596","snapshot_observed_at":"2026-08-08T22:47:39.376946Z","title":"Internlm-xcomposer2.5-omnilive: A comprehensive multimodal system for long-term streaming video and audio interactions.arXiv preprint arXiv:2412.09596, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.376946Z"},"links":{"cited_paper":"/paper/2412.09596","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:98c760377318790fb2b7dec05ac3f66cf182976373497d0d3c468969e214f15d","observation_id":"c4b67586-0fda-4dfd-a13e-849b0c11f5c8","resolution":{"observed_at":"2026-08-08T22:47:39.376946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-08T06:22:53.769876Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-08T22:47:39.381215Z","title":"Direct preference optimiza- tion of video large multimodal models from language model reward.arXiv preprint arXiv:2404.01258, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.381215Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:31257fd185b342048e84b21c57aa262917e736fe746b390ddef752cf7afe2dfd","observation_id":"005b69e8-1a87-462e-a221-1724ddd9ccd9","resolution":{"observed_at":"2026-08-08T22:47:39.381215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.137490Z","title":"Llava- next: A strong zero-shot video understanding model, 2024","venue":null,"work_id":"56671d1b-df8e-4851-a747-4c477359a6cc","year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.385607Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:aaca3d52460da6b4cfc7eda9f39fbdf284b5fc57628c676a15583982ce133f57","observation_id":"e7907262-478e-44d1-b798-74a35c42a3f6","resolution":{"observed_at":"2026-08-08T22:47:40.142589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:47:40.121977Z","title":"Video instruction tuning with synthetic data, 2024","venue":null,"work_id":"65764784-234b-4ebd-a53f-ba4835d2ac6a","year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.389717Z"},"links":{"citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:227faa184a8f34b122d499b4feb16364df22cea5eab69e45e5d0af2ba0f87914","observation_id":"77d877b2-5f39-43b3-9717-b46f71729b2a","resolution":{"observed_at":"2026-08-08T22:47:40.126837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 33 inbound Pith citation observations for arXiv:2502.04328."}