{"as_of":"2026-08-09T15:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a7081d8cedb63dbe8526f2d548f92639ba2f87da569fc81f95decfd8a11a0e1c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":49,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:08:55.016786Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:49:39.565893Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2411.18279","last_updated":"2025-05-06T15:08:00Z","snapshot_observed_at":"2026-07-06T19:57:55.925634Z","submitted_at":"2024-11-27T12:13:39Z","title":"Large Language Model-Brained GUI Agents: A Survey","version":12},"reference_index":220,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:27.472508Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2411.18279"},"observation_digest":"sha256:ecbadf7600cd495cabfb4926509adf1818568d593de6b2ae8f05eb336cfdbd96","observation_id":"63d04862-f1a2-4fe4-9032-23211b9dec67","resolution":{"observed_at":"2026-05-19T11:08:27.787101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T10:09:21.542356Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2412.10302"},"observation_digest":"sha256:fdc94c45ac3f0954d2c44c4dc22b2696451c64087db1d0056d0f4f5dae954610","observation_id":"6ae4961c-ef96-458c-9340-fd90ed497a19","resolution":{"observed_at":"2026-05-11T10:09:23.665883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2501.02955","last_updated":"2026-05-12T15:02:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-06T11:57:38Z","title":"MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T05:44:31.546843Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2501.02955"},"observation_digest":"sha256:94aeea3a0bd0f3e96d6a52ce7ada7075c8ffa3fdb5178eb1d3af92d862c195b4","observation_id":"7f7d654c-d3c0-4c4c-a437-1618750f0f72","resolution":{"observed_at":"2026-05-23T05:45:28.351105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-08T01:58:42.644918Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T11:39:22.340737Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2501.04001"},"observation_digest":"sha256:1fdb1ada8408a3f8081389b0a070531662fcf36310c357c862503bc23296729d","observation_id":"760a6262-90f3-4eb9-8b22-62e863cfc59e","resolution":{"observed_at":"2026-05-16T11:39:22.513505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T00:32:41.059558Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2501.13826"},"observation_digest":"sha256:624c63b484844c8d0713056ac3b05aa58dd880b9cbad614d318cb7c79af3f3c7","observation_id":"c5f32c4e-ddd6-47aa-8090-8408a836f07f","resolution":{"observed_at":"2026-05-14T00:32:41.254763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-08T14:25:55.720298Z","title":"Aria: An open multimodal native mixture- of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.720298Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:a9abf8c6bd184a0b61f2ba8c16d3c10ed277742e86d00292760b19fecefd7a22","observation_id":"8659e668-aea5-46f6-af9e-87a2a11fa040","resolution":{"observed_at":"2026-08-08T14:25:55.720298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T14:46:15.480907Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17629","last_updated":"2025-05-27T07:41:51Z","snapshot_observed_at":"2026-08-08T14:46:10.484801Z","submitted_at":"2025-05-23T08:39:06Z","title":"TransBench: Breaking Barriers for Transferable Graphical User Interface Agents in Dynamic Digital Environments","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:46:15.480907Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2505.17629"},"observation_digest":"sha256:8227457f9fbeab532e17e0bbc4d74ab30c6020a387f834f097423804dccec3d1","observation_id":"8821343c-b7a2-4f6e-811a-0b539bf251f3","resolution":{"observed_at":"2026-08-07T14:46:15.480907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T12:48:02.870434Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-09T05:32:01.732887Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:02.870434Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:5bcbe6936662e62ae3f28c31f3aeff40d6e9fca1b341de4de52997dbb40117c9","observation_id":"7e7399e0-866e-4842-a160-4c0336e41f05","resolution":{"observed_at":"2026-08-07T12:48:02.870434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T11:59:07.178112Z","title":"Aria: An open multimodal native mixture-of-experts model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:07.178112Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:1732f7e89dfab3edc3781f437e69508ef6d40ed587f6414b42c732783d80d14c","observation_id":"21cc2dfd-dfd4-44a1-b1c5-5e5e52635d85","resolution":{"observed_at":"2026-08-07T11:59:07.178112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T10:56:05.321429Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.321429Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:90a6b227c77d2cef32fbacd36e3d7acbf41e98b42ac2e22f1b982f36f52feccf","observation_id":"264fb417-cc39-45a4-a218-e19a0cc9fa8d","resolution":{"observed_at":"2026-08-07T10:56:05.321429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T10:55:14.699207Z","title":"Aria: An open multimodal native mixture-of-experts model.arXiv preprint arXiv:2410.05993, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04034","last_updated":"2025-06-04T14:56:57Z","snapshot_observed_at":"2026-08-07T10:46:30.489099Z","submitted_at":"2025-06-04T14:56:57Z","title":"Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:14.699207Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.04034"},"observation_digest":"sha256:84382f0dfc56e22a408fcc5010d673d61eb16c290053551c791d6fd513e8cb89","observation_id":"956df445-02d3-43c9-ba84-4aa92a14787f","resolution":{"observed_at":"2026-08-07T10:55:14.699207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T10:25:36.269793Z","title":"Aria: An open multimodal native mixture-of-experts model.arXiv preprint arXiv:2410.05993, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05349","last_updated":"2025-06-24T07:36:56Z","snapshot_observed_at":"2026-08-07T23:48:12.277994Z","submitted_at":"2025-06-05T17:59:58Z","title":"VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:36.269793Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.05349"},"observation_digest":"sha256:e8d1a75205bf3d978ead0a94873c8dc528b107bee93d53849ad72f7abb3a6e3b","observation_id":"5aa974a3-aacc-4d02-a416-d2cbbb1fc859","resolution":{"observed_at":"2026-08-07T10:25:36.269793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T06:00:56.895831Z","title":"Aria: An open multimodal native mixture-of-experts model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06275","last_updated":"2025-06-06T17:58:36Z","snapshot_observed_at":"2026-08-07T21:48:03.079145Z","submitted_at":"2025-06-06T17:58:36Z","title":"Movie Facts and Fibs (MF$^2$): A Benchmark for Long Movie Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T06:00:56.895831Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.06275"},"observation_digest":"sha256:a0a54cf8ecee09bbdf9d7f49684cd1ae725706eff90854bf037c4e62dfb58d01","observation_id":"61a95390-c468-4b95-992e-c6f6636ede24","resolution":{"observed_at":"2026-08-07T06:00:56.895831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T06:07:18.685096Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06406","last_updated":"2025-06-25T12:36:55Z","snapshot_observed_at":"2026-08-07T11:49:17.219924Z","submitted_at":"2025-06-06T12:47:29Z","title":"SMAR: Soft Modality-Aware Routing Strategy for MoE-based Multimodal Large Language Models Preserving Language Capabilities","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:18.685096Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.06406"},"observation_digest":"sha256:8d4051296ca69cf476989934fb23ad61f5edd18546648f5c192436189e8de174","observation_id":"f1bce6f4-2bd2-43e1-b54c-0a8033a0e85c","resolution":{"observed_at":"2026-08-07T06:07:18.685096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T05:26:47.142398Z","title":"Aria: An open multimodal native mixture-of-experts model.arXiv preprint arXiv:2410.05993, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.142398Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:6e7b8980bb2ec122966d29ce6498ce13b8db34a5399fba9cd59de33f6c604af2","observation_id":"b92b4578-1639-44c9-8c4e-488ab0c0a9d5","resolution":{"observed_at":"2026-08-07T05:26:47.142398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T04:22:55.888224Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-08T13:30:57.844783Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.888224Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:e116842eff79358bbcd91a8a75844f88a5fe1e86ee230a9f502721ab47afdfe1","observation_id":"bdeedada-c8a1-4732-8f62-8830251ce4c6","resolution":{"observed_at":"2026-08-07T04:22:55.888224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T00:45:03.582120Z","title":"Aria: An open multi- modal native mixture-of-experts model.arXiv preprint arXiv:2410.05993, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:03.582120Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:ec30ddd1f19a7126ce67f85f89b069e107228020ed7c38a15b00a896f2e42f87","observation_id":"03a9cf9c-51af-453e-893c-cbad769da65f","resolution":{"observed_at":"2026-08-07T00:45:03.582120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T00:34:03.076564Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:03.076564Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:fd63aee3f6f7c3ac57fdb4bf741f4fe969d8494d1cc04bbdad827e58d7bbe9b7","observation_id":"d45607f7-0eeb-4f4a-9271-0dce9d0007ae","resolution":{"observed_at":"2026-08-07T00:34:03.076564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T15:27:04.228144Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.20670"},"observation_digest":"sha256:59cf7cb8ba5960784d766fa1bdcd9709dfa1c04809a8f039b34bc9297fb872e6","observation_id":"e9d3eefd-96c8-4e8b-ad0a-a00b44db0101","resolution":{"observed_at":"2026-05-16T15:27:04.381238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T21:52:18.651138Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.651138Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:cca305a22575c12cb4c33652397c5333d7f989c2730c2512749540431eaba5cb","observation_id":"84e3669f-09fa-4e89-bf38-aecdd5b59f7a","resolution":{"observed_at":"2026-08-06T21:52:18.651138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T21:12:03.532425Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.532425Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:aa45d0d70476fbb4601955662412d79f0724fa910912d1785cbc4b074a325a72","observation_id":"eead32a8-c627-48ac-b545-2cbbaea125dc","resolution":{"observed_at":"2026-08-06T21:12:03.532425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T20:53:20.062315Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.062315Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:1ac7b0b7a0c57fdee2083e1d290d4065f17f51d4a10c4004e1ba700105d36093","observation_id":"81842245-3584-42af-815f-d44d8e3626c9","resolution":{"observed_at":"2026-08-06T20:53:20.062315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T20:29:51.704165Z","title":"Aria: An open multimodal native mixture- of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-07T06:17:01.457380Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:51.704165Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:a47200e66ee00037e10076fdeb913d40f3cd58e378b62bb898cca6c0febe8aa4","observation_id":"67cf1236-7fa1-4118-8cbe-6711b0775924","resolution":{"observed_at":"2026-08-06T20:29:51.704165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T23:12:00.379646Z","title":", Liu, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02904","last_updated":"2025-06-24T06:08:35Z","snapshot_observed_at":"2026-08-09T05:24:12.166075Z","submitted_at":"2025-06-24T06:08:35Z","title":"Enhancing Sports Strategy with Video Analytics and Data Mining: Assessing the effectiveness of Multimodal LLMs in tennis video analysis","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T23:12:00.379646Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.02904"},"observation_digest":"sha256:45578cb3c7212d04ec8f79e41ac1c47441d47d8f9aba57ed722bd3210feccfa9","observation_id":"9e98d311-ebb1-4b89-86f5-713a3c31b6e6","resolution":{"observed_at":"2026-08-06T23:12:00.379646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T18:16:28.576320Z","title":"Aria: An open multimodal native mixture-of-experts model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08982","last_updated":"2025-07-11T19:34:01Z","snapshot_observed_at":"2026-08-09T05:23:12.933526Z","submitted_at":"2025-07-11T19:34:01Z","title":"VIP: Visual Information Protection through Adversarial Attacks on Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:28.576320Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.08982"},"observation_digest":"sha256:7ec4c0d7284633ac5a412cc12cc41f90d934c1004738b49982bd80eda8c093aa","observation_id":"a3e25417-5864-4888-a920-35b88ceee824","resolution":{"observed_at":"2026-08-06T18:16:28.576320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T16:49:59.827141Z","title":"Aria: An open multimodal native mixture-of- experts model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-09T09:38:10.605452Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.827141Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:451fe7ecaea41469fea0e94002298a43aefa76e03ee284f3efc6e088a3a01e8c","observation_id":"5512c647-879c-48fd-b611-5cd6e6d1ced4","resolution":{"observed_at":"2026-08-06T16:49:59.827141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T05:30:35.065340Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.065340Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:89d55567da6cc6af3a8a3744763ad14984314b9190fa90163ba001f2b35e5027","observation_id":"25639214-899c-434e-956e-1357c905573c","resolution":{"observed_at":"2026-08-06T05:30:35.065340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T05:15:42.093183Z","title":"Aria: An open multimodal native mixture- of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02094","last_updated":"2025-08-04T06:05:36Z","snapshot_observed_at":"2026-08-08T15:06:07.047501Z","submitted_at":"2025-08-04T06:05:36Z","title":"\"Harmless to You, Hurtful to Me!\": Investigating the Detection of Toxic Languages Grounded in the Perspective of Youth","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T05:15:42.093183Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2508.02094"},"observation_digest":"sha256:8ddb83f60e9998e69b91bb69eaf368f59aa97f1ebea8152e7cf2ecd38dd4a129","observation_id":"27fc9e3e-772a-4fb5-8274-f53805fd91b9","resolution":{"observed_at":"2026-08-06T05:15:42.093183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T05:12:35.830990Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:35.830990Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:ed5a9c3bee8ffc317fcfef999c88811b10586d333254c98369b344f388601995","observation_id":"967cacbc-4c71-454c-96d2-8db4b59de9d3","resolution":{"observed_at":"2026-08-06T05:12:35.830990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-05T19:03:10.590321Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13692","last_updated":"2025-08-19T09:52:04Z","snapshot_observed_at":"2026-08-09T03:24:13.317916Z","submitted_at":"2025-08-19T09:52:04Z","title":"HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:10.590321Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2508.13692"},"observation_digest":"sha256:0cd1c497f6e6e87de183b5911151c07e070251db7b1b76df724511d95b39bcab","observation_id":"525d0f11-90c8-43dc-9609-5537117c5b0f","resolution":{"observed_at":"2026-08-05T19:03:10.590321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-05T12:44:46.702453Z","title":"Aria: An open multimodal native mixture-of-experts model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01341","last_updated":"2025-09-01T10:23:48Z","snapshot_observed_at":"2026-08-07T06:46:34.681356Z","submitted_at":"2025-09-01T10:23:48Z","title":"Street-Level Geolocalization Using Multimodal Large Language Models and Retrieval-Augmented Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T12:44:46.702453Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2509.01341"},"observation_digest":"sha256:b2cb447465cbece956deab163cce92465847ba67b464c95bb01faa438aab2f94","observation_id":"748abe4c-ecc3-4ce2-9b2c-bce63cc6da9b","resolution":{"observed_at":"2026-08-05T12:44:46.702453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2509.07969","last_updated":"2025-09-09T17:54:21Z","snapshot_observed_at":"2026-07-30T05:21:39.737665Z","submitted_at":"2025-09-09T17:54:21Z","title":"Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T01:17:55.500268Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2509.07969"},"observation_digest":"sha256:87b10dc3be44aa46e6d3553a1d754d0eff9d704ee2b0e0ce08e597a9a335dcb8","observation_id":"4decabbf-88ca-4b45-9f26-4fc0e6e38fec","resolution":{"observed_at":"2026-05-18T01:17:55.677423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-04T20:32:56.586319Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.586319Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:570328d3a6b9e2444bc59bb1153eb17b3cc1f280e1505511d31084660de7e83c","observation_id":"a133ce72-f350-4e46-b0ab-30c9f0976478","resolution":{"observed_at":"2026-08-04T20:32:56.586319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-04T17:46:56.236585Z","title":"ARIA: An Open Multimodal Native Mixture-of- Experts Model.arXiv preprint arXiv:2410.05993, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12263","last_updated":"2026-05-31T19:40:08Z","snapshot_observed_at":"2026-08-08T05:36:41.231494Z","submitted_at":"2025-09-12T20:07:12Z","title":"InPhyRe Discovers: Large Multimodal Models Struggle in Inductive Physical Reasoning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T17:46:56.236585Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2509.12263"},"observation_digest":"sha256:754cccf1c68f0bbab2cdd5083e50b42637d987193df8b10aded53b8542f1d241","observation_id":"f84a2837-f958-4a6f-b14a-661a3cf0974f","resolution":{"observed_at":"2026-08-04T17:46:56.236585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2602.20913","last_updated":"2026-04-15T16:09:22Z","snapshot_observed_at":"2026-08-02T12:38:41.181077Z","submitted_at":"2026-02-24T13:49:47Z","title":"LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T20:01:31.129959Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2602.20913"},"observation_digest":"sha256:3ea6503995e5b8cc8a2c430cdf3b46aa0eb4b57a6ca5f64bc80f80dbe67921e2","observation_id":"6a12fce7-745b-41bb-aa36-4dfe8bc923bf","resolution":{"observed_at":"2026-05-15T20:01:33.431023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2604.05418","last_updated":"2026-04-16T09:51:53Z","snapshot_observed_at":"2026-08-03T01:38:19.340462Z","submitted_at":"2026-04-07T04:26:59Z","title":"VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T19:15:02.124035Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2604.05418"},"observation_digest":"sha256:cd4e4b6571a5314fee416d8f70f82ed1fc0dc0120ccaed283d8430a31b4efeb9","observation_id":"20fe5682-f600-44dc-a371-8c6b83588456","resolution":{"observed_at":"2026-05-10T23:15:50.236502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2604.19264","last_updated":"2026-04-21T09:28:34Z","snapshot_observed_at":"2026-07-31T12:03:21.545054Z","submitted_at":"2026-04-21T09:28:34Z","title":"DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-10T03:21:30.732925Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2604.19264"},"observation_digest":"sha256:96c0cf20010916f1ae149a9e911571fb708d564bc5479cbdebb14674edf6499c","observation_id":"cf2041fa-7470-46f5-a5cf-576a911d4d48","resolution":{"observed_at":"2026-05-11T12:31:08.078362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2604.20486","last_updated":"2026-04-22T12:20:46Z","snapshot_observed_at":"2026-08-06T20:38:43.258492Z","submitted_at":"2026-04-22T12:20:46Z","title":"ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T01:12:17.469552Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2604.20486"},"observation_digest":"sha256:bb45fe736bd4b9a9bb493a48e6cc7454e6319937e1941b79fadee8f8d4287cbe","observation_id":"207c8141-ec26-4d31-a20d-2de2f3daa16c","resolution":{"observed_at":"2026-05-11T13:41:10.087841Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2605.17283","last_updated":"2026-05-17T06:39:05Z","snapshot_observed_at":"2026-08-08T15:14:20.631028Z","submitted_at":"2026-05-17T06:39:05Z","title":"OProver: A Unified Framework for Agentic Formal Theorem Proving","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-20T14:43:46.517807Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2605.17283"},"observation_digest":"sha256:70904e867e00a500658e358a7685f0dd31288eb0fab63170f739f7f9e83c6cd7","observation_id":"8c1a6100-ea69-4415-b286-51f3fb6d7d16","resolution":{"observed_at":"2026-05-20T14:48:23.469466Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2605.25979","last_updated":"2026-05-25T15:54:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T15:54:04Z","title":"LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T22:12:05.365596Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2605.25979"},"observation_digest":"sha256:bd7a7e6277a7ab689a50e8383ab5fdcdcbf4b2d3667d543c21468dadd8d29b7e","observation_id":"f31884c4-788a-4c9a-a17b-e330fee1ded4","resolution":{"observed_at":"2026-06-29T22:13:59.644704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2605.27358","last_updated":"2026-05-26T17:58:24Z","snapshot_observed_at":"2026-07-06T23:37:02.891611Z","submitted_at":"2026-05-26T17:58:24Z","title":"MobileMoE: Scaling On-Device Mixture of Experts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T18:48:50.656971Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2605.27358"},"observation_digest":"sha256:0329685709959e153de0c1500319c72b775ad19c065f854527c25f9a5b8f425e","observation_id":"75332c6c-2cce-4d14-97c2-1754d2c6854d","resolution":{"observed_at":"2026-06-29T18:53:51.431424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2606.00275","last_updated":"2026-05-29T19:08:20Z","snapshot_observed_at":"2026-08-08T17:56:30.968996Z","submitted_at":"2026-05-29T19:08:20Z","title":"Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T22:43:33.929871Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2606.00275"},"observation_digest":"sha256:2ad8405068f705f8f16ecf15bdcb00c0058b8b66119c30ff01e99026606700a3","observation_id":"36825118-971b-4ca7-b7a7-0ee70fab0eb3","resolution":{"observed_at":"2026-07-01T19:26:00.060381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":291,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:803d46bcf9e7a9992f70e16af38f77fb01ab1711329f09eb2f163c80b066ddc8","observation_id":"78e9bca3-f6e7-40d1-9b2c-92288425112e","resolution":{"observed_at":"2026-07-03T14:28:32.081900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2606.20970","last_updated":"2026-06-18T22:17:18Z","snapshot_observed_at":"2026-08-01T20:10:55.070907Z","submitted_at":"2026-06-18T22:17:18Z","title":"CogniRoute: Learning to Route Social Evidence in Omni-Modal Models","version":1},"reference_index":150,"source":"arxiv_source","source_observed_at":"2026-06-26T17:37:11.371892Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2606.20970"},"observation_digest":"sha256:b360ce8e2e99870f740d075656f173d4ab6b082d10baead59afcbc5c8b9a2e49","observation_id":"c308a88b-ff1d-4416-a119-d94f25a1d378","resolution":{"observed_at":"2026-07-04T03:49:30.343170Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:1d1826e12f3627f17ee3afadfd819026e6d6ea68af61e400282bf35bd8885f59","observation_id":"11cbdc20-f013-4cad-adfc-486ee162293d","resolution":{"observed_at":"2026-07-04T06:39:37.708094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":"2410.05993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-07-04T07:49:39.565893Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":"8ed8984e-244e-4c69-9fd5-c0cef9869673","year":2025},"citing_paper":{"arxiv_id":"2606.21868","last_updated":"2026-06-20T04:10:34Z","snapshot_observed_at":"2026-08-06T05:17:32.033245Z","submitted_at":"2026-06-20T04:10:34Z","title":"WiSP: A Working-Set View of Mixture-of-Experts Serving on Extremely Low-Resource Hardware","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T12:40:53.103233Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2606.21868"},"observation_digest":"sha256:52279c7b56db00f87dd5e946cfeea74dfd3f36758d2f532be4079ec60219735a","observation_id":"834e8346-8de0-4ee5-8cd5-66661c36e10b","resolution":{"observed_at":"2026-07-04T07:49:39.567377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T23:51:36.918993Z","title":"2024 , eprint =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04454","last_updated":"2026-08-05T05:09:20Z","snapshot_observed_at":"2026-08-09T05:23:13.316163Z","submitted_at":"2026-08-05T05:09:20Z","title":"Beyond Global Routing Aggregation: Phase-Aware Expert Merging for MoE Vision-Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T23:51:36.918993Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2608.04454"},"observation_digest":"sha256:77f44fc4ccdea1268e8b682773609760d49ce905b92c695ab59334117ee144e5","observation_id":"af36094b-e3bd-4a0e-94ea-65fee3fc4322","resolution":{"observed_at":"2026-08-06T23:51:36.918993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T11:55:27.943328Z","title":"Aria: An open multimodal native mixture-of-experts model.arXiv preprint arXiv:2410.05993, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T14:11:54.236098Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:27.943328Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:26ccfa799a864cca2c5eabdcb2238a7aae417f620c634b56127d9b8258adfbaf","observation_id":"73900df1-0d7c-4843-b1c9-72d742d9c704","resolution":{"observed_at":"2026-08-06T11:55:27.943328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-08T17:08:55.016786Z","title":"Aria: An open multimodal native mixture-of-experts model.arXiv preprint arXiv:2410.05993, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T14:11:54.236098Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T17:08:55.016786Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:93ef9e6302020a0cb2d5502528ddf1216f7c748b9354058b2aa67e90b609e8bd","observation_id":"81818fbe-04cf-4da4-b587-3226a56f54e5","resolution":{"observed_at":"2026-08-08T17:08:55.016786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.05993/citation-record","integrity":"/paper/2410.05993/integrity","json":"/paper/2410.05993/citation-record.json","paper":"/paper/2410.05993"},"outbound":[],"paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 49 inbound Pith citation observations for arXiv:2410.05993."}