{"as_of":"2026-08-23T16:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5bfb27e7d76fdbb69997c78abca3c464b27355cae29b4aec800ada9c9370296c","coverage":[{"denominator":131,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T02:55:58.018234Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:30:35.609389Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T04:16:48.701434Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"cited_work":{"arxiv_id":"2607.07675","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.07675","snapshot_observed_at":"2026-07-10T04:16:48.701434Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","venue":"cs.CV","work_id":"0360ece0-b5b7-409b-802d-e47d5670dbb9","year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-10T04:12:29.153764Z"},"links":{"cited_paper":"/paper/2607.07675","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:90d0c85f4d869022b96427fdb28122915694dbb7ae9ef6f97de3fe87997e4052","observation_id":"8aa0e333-3d98-4862-baff-6907f5db724c","resolution":{"observed_at":"2026-07-10T04:16:48.702844Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07675","snapshot_observed_at":"2026-08-02T07:53:39.262642Z","title":"Scaling mixture-of-experts video pretraining for embodied intelligence.arXiv preprint arXiv:2607.07675, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:39.262642Z"},"links":{"cited_paper":"/paper/2607.07675","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:11fe79686ebcc2a98af526c9744909f136561687c6367b940e54cfb36baabaf9","observation_id":"a760df59-1c6b-4b7a-b322-088f2b59a3c9","resolution":{"observed_at":"2026-08-02T07:53:39.262642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07675","snapshot_observed_at":"2026-08-01T07:09:07.343135Z","title":"Scaling mixture-of-experts video pretraining for embodied intelligence.arXiv preprint arXiv:2607.07675, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-21T14:54:34.651282Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:07.343135Z"},"links":{"cited_paper":"/paper/2607.07675","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:09a6b2609f42f4df10c46501fd0fe12092412eb47ecde5fa5bd366b8808a9e56","observation_id":"2119e194-4fbd-4a60-b3f8-fc2cb5f98de2","resolution":{"observed_at":"2026-08-01T07:09:07.343135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07675","snapshot_observed_at":"2026-07-30T12:42:18.533960Z","title":"Scaling mixture-of-experts video pretraining for embodied intelligence","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23783","last_updated":"2026-07-26T17:58:53Z","snapshot_observed_at":"2026-08-18T02:45:51.962830Z","submitted_at":"2026-07-26T17:58:53Z","title":"$N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-30T12:42:18.533960Z"},"links":{"cited_paper":"/paper/2607.07675","citing_paper":"/paper/2607.23783"},"observation_digest":"sha256:2daad1e80df1b45d819ff2acc21f436229a04ae8daf8ed6c43a2458131f01766","observation_id":"1c80363e-6ece-424e-95f9-5f98349c3f9f","resolution":{"observed_at":"2026-07-30T12:42:18.533960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07675","snapshot_observed_at":"2026-08-15T14:30:35.609389Z","title":"Shuailei Ma, Jiaqi Liao, Xinyang Wang, Jingjing Wang, Chaoran Feng, Zijing Hu, Chong Bao, Zichen Xi, Yuqi Gan, Weisen Wang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13205","last_updated":"2026-08-13T13:08:27Z","snapshot_observed_at":"2026-08-19T19:04:44.185233Z","submitted_at":"2026-08-13T13:08:27Z","title":"HPSD: Hybrid-Policy Self-Distillation for Text-Image-to-Video Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T14:30:35.609389Z"},"links":{"cited_paper":"/paper/2607.07675","citing_paper":"/paper/2608.13205"},"observation_digest":"sha256:cece26aa661a6c9f737f8c4090eea1c55199e4a9a8f24cecc6b9d62e3766013c","observation_id":"b43191d0-f640-4671-94c1-d33cf4a3ce39","resolution":{"observed_at":"2026-08-15T14:30:35.609389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.07675/citation-record","integrity":"/paper/2607.07675/integrity","json":"/paper/2607.07675/citation-record.json","paper":"/paper/2607.07675"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:ff3811fa1ca439c5c67687304d9be18d59effde1f8efcffc0c43463eadcde7b6","observation_id":"70853329-5a65-4852-a42a-03772111d8dd","resolution":{"observed_at":"2026-07-09T03:05:55.225604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:f30f9a5b39f5f6db75dddc390af35f9e63a0650bd2c5f7a65c56df5cdba581d8","observation_id":"ad2ace2e-2a21-4fd2-b5d8-120e307a1492","resolution":{"observed_at":"2026-07-09T03:05:55.157813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.725119Z","title":"Pytorch 2: Faster machine learning through dynamic python bytecode transformation and graph compilation","venue":null,"work_id":"4b95e9e3-1502-4c16-8f9e-c8bf24b0937e","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:496a3138cfe1c8407e2e16042b5835909def97fe4163314c8b36af9cf9087ccf","observation_id":"00c84fef-d6df-4237-8229-0a35e6d9ae50","resolution":{"observed_at":"2026-07-09T03:05:55.727547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-08-15T13:40:01.739055Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":"2506.09985","doi":"10.48550/arxiv.2506.09985","metadata_source":"pith","pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","venue":"cs.AI","work_id":"a9c28401-f16a-4933-89f0-788e2f94e52b","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:3c4054a81c6b692c693badbc651a9d0cc4f685fedb6969cc6902e242496541b8","observation_id":"96a0c4da-5074-4812-965a-8512c139310b","resolution":{"observed_at":"2026-07-09T03:05:55.138662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T03:38:08.150702+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T03:38:08.150702+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-20T15:31:01.041088Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:217838e1f7aa858fb5f33d8e925fb2c02d38ad01914679e06dfb8301f19d3559","observation_id":"790734dc-2f3f-40e6-9758-20a24e3e9b82","resolution":{"observed_at":"2026-07-09T03:05:55.345416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:14.101106+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:14.101106+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:dc256eef03ca3ece9f35a8f129d15c9e3d8846f15b3b4c36a234192256ae2f0f","observation_id":"b2073d22-0f88-49c7-9e87-21da66fe9cdd","resolution":{"observed_at":"2026-07-09T03:05:55.250167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.708984Z","title":"Lumiere: A space-time diffusion model for video generation","venue":null,"work_id":"f6abe88d-7f0c-49a9-aa0b-1f09e1926d6e","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:508eee56334775c61e0385aa6a972cc00c39136ca8fe1a16f7784405e3276960","observation_id":"81243553-b743-49d7-bb9a-3133304947e3","resolution":{"observed_at":"2026-07-09T03:05:55.764181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-14T19:47:04.330126Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":"2401.02954","doi":"10.48550/arxiv.2401.02954","metadata_source":"pith","pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","venue":"cs.CL","work_id":"01b10587-025b-499d-8ba3-7a538d24c2d6","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:3cef88ae4b953c30da6787d026700032dbc773ae70e59941348f044c0670e258","observation_id":"78e0aa2b-8e95-4a3e-af79-48401eafa4b4","resolution":{"observed_at":"2026-07-09T03:05:55.314557Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-20T09:39:07.545813Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:6aa4bb4526d673739399be16f4e9028875dbfe84264e7c22bcec69619752a98f","observation_id":"a2a0244b-024c-42ad-a3ed-ae2f800a8981","resolution":{"observed_at":"2026-07-09T03:05:55.206327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.688891Z","title":"Genie: Generative interactive environments","venue":null,"work_id":"64855e37-e78b-4d7c-88d0-f0efe9dfe0c0","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:7a3e49a96edfff1fe801799009993f0e47ab623d2de95a7aa3ce14c447fd8b43","observation_id":"8f3ac1ac-3e91-4896-8cb6-3417118b3c05","resolution":{"observed_at":"2026-07-09T03:05:55.690954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-21T19:37:26.080420Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:b63ac7524b18b4be38462f007c1ff506350eb77dffec511b25d2a450ca84954d","observation_id":"95ef248b-fb5e-48f7-91f7-c950704d2ed8","resolution":{"observed_at":"2026-07-09T03:05:55.311053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-15T14:08:11.489191+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T14:08:11.489191+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.22200","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.030379Z","title":"Longcat-video technical report.arXiv preprint arXiv:2510.22200","venue":null,"work_id":"b1a745e0-8d8e-4399-8d09-047d761f349d","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:9c458fdc8caa31409d66343e0d24d62e4ccd259b664032f586e689dd3974b32a","observation_id":"d4c12d5c-89ba-4ff0-a00e-4c9cee1c9fce","resolution":{"observed_at":"2026-07-09T03:05:55.255582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.868146Z","title":"Pixart- alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":"5a518211-760e-40f5-9e88-c6aafe84f2d9","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:556026244901126a2a05f38cab936da5cf4b0e81f08805e0b45ac4e939bd8a55","observation_id":"b94d3e9f-2e63-40d2-827b-f1cfcb88fb3b","resolution":{"observed_at":"2026-07-09T03:05:55.869506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-14T14:33:36.303679Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":"1604.06174","doi":"10.48550/arxiv.1604.06174","metadata_source":"pith","pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Deep Nets with Sublinear Memory Cost","venue":"cs.LG","work_id":"f2c5c287-a500-40e4-a136-e7e3172db1d7","year":2016},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:93488f0e93d3e2388c9a2d3b9789f8ec7d855d9b4c32e86971c741b621fb273b","observation_id":"31900569-fe83-41c8-9184-883a84f9f380","resolution":{"observed_at":"2026-07-09T03:05:55.263611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:33.666045+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:33.666045+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.252330Z","title":"Realdpo: Real or not real, that is the preference","venue":null,"work_id":"9d39eeb7-0ae7-4088-a0d8-1af284d6fdbd","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:a6e5b42537243b40e19a64df2f53002462bbdc78f153a3ff4b17e60d4d143575","observation_id":"3a7e8a4e-fd38-4800-9a60-48a79854cdf1","resolution":{"observed_at":"2026-07-09T03:05:55.255294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.870042Z","title":"Local all-pair correspondence for point tracking","venue":null,"work_id":"5f9bef65-d16f-46cb-a44a-bcb3c0118137","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:701c0fa450102f86ac4c945bd1725a1ff568b5014c7bd5c8c95f5457eb2c6e40","observation_id":"3d6dec75-acb6-4329-bfd9-ab782929c6f7","resolution":{"observed_at":"2026-07-09T03:05:55.871387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.857932Z","title":"Palm: Scaling language modeling with pathways.Journal of machine learning research, 24(240):1–113","venue":null,"work_id":"0bb8865e-bcb7-46c4-ac90-63714fc6b1ca","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:552a9b7239478697fe5354e34441b415f6a00a7c6a174b46eaec26c7799aa7a4","observation_id":"39e2ad2d-15b6-4305-b0b0-c84e6e515996","resolution":{"observed_at":"2026-07-09T03:05:55.859303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.852150Z","title":"Deepseekmoe: Towards ultimate expert specialization in mixture-of-experts language models","venue":null,"work_id":"bce26321-e20c-4288-bd57-a7f2b1d4fdcb","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:e8b03aab3a387301e905a233e40f704c75bf1badcb7e6f20e6c368e20b4aeaf7","observation_id":"b7ae041d-9c39-407a-a9fe-696665c95d96","resolution":{"observed_at":"2026-07-09T03:05:55.854259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.855148Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":"60bc23ba-92e3-47cd-8688-6bc2bff27a81","year":2022},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:8b1c826deb75adb376bfbc06b1c7e5fe389202438537ef7d0a8666f156703ef2","observation_id":"2cff44b4-ed21-4aaa-8474-9e300a5d59af","resolution":{"observed_at":"2026-07-09T03:05:55.857277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.859895Z","title":"Deepep: An efficient expert-parallel communication library","venue":null,"work_id":"527f3b20-f64d-4f38-8f48-6b540fc38fc1","year":null},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:ee9aafde7cd923fe8eead05a478755280c7cd0f3bbe6f6fd41fe8b39cda2f8e6","observation_id":"361bc574-79af-4a30-a5ca-63a06608670f","resolution":{"observed_at":"2026-07-09T03:05:55.861339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.871944Z","title":null,"venue":null,"work_id":"3bfd6e78-becf-4dbe-b5cd-7ef1ca7e1db5","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:038b0cd3aa56a81aaf6d2b452ba683e839c4a919f0e6f0fe42c815ddd738c6d4","observation_id":"84b6211c-a79b-4471-a909-5d5e15156e8e","resolution":{"observed_at":"2026-07-09T03:05:55.873149Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.875508Z","title":"Scaling vision transformers to 22 billion parameters","venue":null,"work_id":"213c7811-947b-4b53-83ad-b920f3f66e6e","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:04994b34ceddd258f9a3998fb71ff88ab02c406700631ef26715d138f34f5c13","observation_id":"3f10346e-3d51-4593-a139-84fc97169474","resolution":{"observed_at":"2026-07-09T03:05:55.876791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.847399Z","title":"Rethinking video generation model for the embodied world","venue":null,"work_id":"f89db3a8-7d61-41c3-8e3a-09ed97cb60e1","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:cd2d7b0bd6f5e3a4e2bb55fcd4bce65039ef6ca328ab3e2f3b8e92d7b035d18f","observation_id":"ff20bb95-561d-4a7e-8693-9672bdf59099","resolution":{"observed_at":"2026-07-09T03:05:55.849007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.837586Z","title":"Structure and content- guided video synthesis with diffusion models","venue":null,"work_id":"e8fe18a7-4355-4c38-b513-474e1746fe45","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:6beaefc58ef14aaa6f51feaa0b515d5eceb84e1d5e23cbba6bd89706e27c7b0f","observation_id":"751852de-e464-4e8b-ac62-1b7b76841d70","resolution":{"observed_at":"2026-07-09T03:05:55.839376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.834941Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"b82ba02d-0058-4bd2-960f-ddba9d16df00","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:aba49734f512e2718881b10e2f38d3265c0967867465472da378fd6bc7356bf4","observation_id":"0b9319d0-9ca9-4227-8d00-6f52d6408626","resolution":{"observed_at":"2026-07-09T03:05:55.836466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:57:14.638286Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learning Research, 23(120):1–39","venue":null,"work_id":"34699817-8561-4043-bbe1-445a0c93266b","year":2022},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:ff6c146547691b153d01c4f421a9aa018f68082a8c58256ce69025813e3cb383","observation_id":"24c48c8d-ee24-4d31-9fe7-7aee347baa19","resolution":{"observed_at":"2026-07-09T03:05:55.836894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2602.06949","doi":"10.48550/arxiv.2602.06949","metadata_source":"pith","pith_arxiv_id":"2602.06949","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","venue":"cs.RO","work_id":"95f2f415-c659-4084-a008-39303bea8638","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2602.06949","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:7c065ff7147013fec7a3feb630c2235e304e5b5140770a034d93e94485487915","observation_id":"e55f2f81-05ef-4fe7-8e12-5e194e8ba58e","resolution":{"observed_at":"2026-07-09T03:05:55.287932Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.14375","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.272428Z","title":"The pulse of motion: Measuring physical frame rate from visual dynamics","venue":null,"work_id":"9bdc4b07-d0bc-40ce-afb8-93bf879bbdc9","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:edc7bb90f90f4c9ee218793436cada129582bb7738871d8544d7d969e5a0a1f4","observation_id":"8d650eef-2cf5-4fd0-812c-1f61edeaa5a8","resolution":{"observed_at":"2026-07-09T03:05:55.274549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.12063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.346934Z","title":"Vlaw: Iterative co-improvement of vision-language-action policy and world model","venue":null,"work_id":"4438adfc-2ac0-4c22-878a-0d937a02c83e","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:5c26ec3c6c0b7bead6ef0b7f8aeaf5fda1858ffbef45e12f15aa5ecdf3986680","observation_id":"9fb154c2-6d77-4b74-b654-2aa890816496","resolution":{"observed_at":"2026-07-09T03:05:55.348812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10125","last_updated":"2026-03-01T08:24:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-11T09:13:10Z","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","version":3},"cited_work":{"arxiv_id":"2510.10125","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.10125","snapshot_observed_at":"2026-07-09T03:05:55.293884Z","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","venue":"cs.RO","work_id":"60c6a353-4bc6-4c87-8c39-372fcddd6ac0","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2510.10125","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:39389f16efcf8f737474c2566bebb48065a6d80106a44dae41d06f45b588b15b","observation_id":"0bdb0a86-22fd-478f-96a3-5836865a55e5","resolution":{"observed_at":"2026-07-09T03:05:55.295756Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.08423","last_updated":"2026-07-20T08:31:09Z","snapshot_observed_at":"2026-08-10T18:57:41.616541Z","submitted_at":"2025-11-11T16:33:49Z","title":"OmniAID: Decoupling Semantics and Artifacts for Universal AI-Generated Image Detection in the Wild","version":4},"cited_work":{"arxiv_id":"2511.08423","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.08423","snapshot_observed_at":"2026-07-09T03:05:55.359747Z","title":"OmniAID: Decoupling Semantic and Artifacts for Universal AI-Generated Image Detection in the Wild","venue":"cs.CV","work_id":"d7f5ad2c-8b98-4728-89b8-eb1bfc5131ca","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2511.08423","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:d275b802468fd218a81fae7ed8a83fe8e1ad409d5e0f930af47aceee2db1c481","observation_id":"5acb3f5d-73af-468a-af59-ce45d6b02848","resolution":{"observed_at":"2026-07-09T03:05:55.361324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.805244Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":"8fb80cc8-fd83-4fdc-b228-452735e15574","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:866b9daa09408769ef2b3b613c7d5a110659dc294b91f5403fb34ea349d9731f","observation_id":"41247c9b-e748-4939-9afe-8a5c203df4ef","resolution":{"observed_at":"2026-07-09T03:05:55.807674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.802390Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":"f8da8613-c021-49da-be7f-bff238b45f84","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:cc449ab20cb8fff03a7291afc750d783a8c9886e3293cb6abca2922f41280bdc","observation_id":"b4dbe36b-8ed4-4402-bbd1-d37a5fccfdce","resolution":{"observed_at":"2026-07-09T03:05:55.804135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.06876","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.268531Z","title":"Generating an image from 1,000 words: Enhancing text-to-image with structured captions","venue":null,"work_id":"18689fc3-927f-4561-98f3-7dcc4c1cdb13","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:9d7d246b7802b863302070acb907b018c70372ad94b335665faf98224f402149","observation_id":"75f559d0-8341-45aa-a9a8-0e1b63c88c6a","resolution":{"observed_at":"2026-07-09T03:05:55.270798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15980","last_updated":"2026-06-16T09:11:40Z","snapshot_observed_at":"2026-08-13T04:44:34.161405Z","submitted_at":"2026-05-15T14:13:39Z","title":"Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization","version":3},"cited_work":{"arxiv_id":"2605.15980","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.15980","snapshot_observed_at":"2026-07-09T03:05:55.293895Z","title":"Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization","venue":"cs.CV","work_id":"6035b3ae-dd0c-4375-9948-c047a30b8ddd","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2605.15980","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:cfde38c9d1ddcae71d9ef6c0d34f4ea9d3f8f3148432ff1ba740a4399d164f15","observation_id":"81e1d7e4-80b8-425c-88b0-5c90c330cae9","resolution":{"observed_at":"2026-07-09T03:05:55.295529Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04324","last_updated":"2025-10-15T06:35:29Z","snapshot_observed_at":"2026-08-16T13:24:28.207284Z","submitted_at":"2025-08-06T11:10:39Z","title":"TempFlow-GRPO: When Timing Matters for GRPO in Flow Models","version":4},"cited_work":{"arxiv_id":"2508.04324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.04324","snapshot_observed_at":"2026-07-09T03:05:55.312048Z","title":"TempFlow-GRPO: When Timing Matters for GRPO in Flow Models","venue":"cs.CV","work_id":"fecc731c-f8a2-4f00-ab1b-51b87a133726","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2508.04324","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:3ae302592b644a6e56c36059dc583d5fe7e385f31295384b34ea9c9c36bd36f1","observation_id":"88fd76ff-7fe0-4edb-839d-93ac2586b840","resolution":{"observed_at":"2026-07-09T03:05:55.314045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-08-21T17:27:27.238302Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2210.02303","doi":"10.48550/arxiv.2210.02303","metadata_source":"pith","pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","venue":"cs.CV","work_id":"bb20d241-dc6f-4b0a-b071-fd43a2cbd57f","year":2022},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:6cccd74c4fe7c1849629d5e123757d891bd4c24dc9181efc35f635161775cc94","observation_id":"bc549c17-ce48-4bf8-b2aa-111d831738f1","resolution":{"observed_at":"2026-07-09T03:05:55.336407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.828784Z","title":"Video diffusion models.Advances in neural information processing systems, 35:8633–8646","venue":null,"work_id":"1f8f79e2-ab6d-4144-b8df-c93b5880020a","year":2022},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:6d5f7fb1292343c32c32dec773f0719ddea2dab109633ef7001e2b2d60bcd1cd","observation_id":"689ba7c5-0767-467f-a07d-7ea3db82e036","resolution":{"observed_at":"2026-07-09T03:05:55.831622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.849872Z","title":"Rae, Oriol Vinyals, and Laurent Sifre","venue":null,"work_id":"1ea5abaa-f628-42b2-8a09-62148b7ce985","year":2022},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:527b8d8bfeb46e15fd04cb9926ee073381222d46753e7d557fdd0bf925892b24","observation_id":"57e26a9b-e1f4-4288-9a4f-621ca83404ab","resolution":{"observed_at":"2026-07-09T03:05:55.851486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.842620Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":"6e336c6f-9dc0-4115-add9-8f8d02224ad4","year":2022},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:924ab3c85ddeca5e6db12e282d8ac10c2c783527fc6a15ff55f40c7c1b4a5ed7","observation_id":"9dd81e01-b8af-4197-81d7-3f8557cb4add","resolution":{"observed_at":"2026-07-09T03:05:55.844301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-08-21T13:23:40.871665Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":"2405.11143","doi":"10.48550/arxiv.2405.11143","metadata_source":"pith","pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","venue":"cs.AI","work_id":"70fa48c9-2f84-49f6-9aca-37476e021fc3","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:f52a4bf455432074f549f603b6775913b9e519a658b3d973572ea7abadfb769d","observation_id":"56cc5ead-2d39-44be-9093-e4e9708f1749","resolution":{"observed_at":"2026-07-09T03:05:55.340810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.879575Z","title":"Tutel: Adaptive mixture-of-experts at scale","venue":null,"work_id":"313e479c-6f46-4e15-8f8c-c64e5f5f74f5","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:0bea205f64c95d3dfe08e6e5195e3e00fafab789be31f2c1a4fec34a0c445b6d","observation_id":"11127d1f-bc22-4b80-9969-5c438155834d","resolution":{"observed_at":"2026-07-09T03:05:55.880891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.783101Z","title":"Jacobs, Michael I","venue":null,"work_id":"84c0c41f-a9a8-4277-bbea-e04b4e5fa41b","year":1991},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:9c03f997ffbb90055b4df38a62fa889bfcfb6732103712ca73339e111a62ecaa","observation_id":"9f6d8b17-da7d-412c-80d6-a3ab8ef9d57a","resolution":{"observed_at":"2026-07-09T03:05:55.784513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-20T06:29:44.483696Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":"2309.14509","doi":"10.48550/arxiv.2309.14509","metadata_source":"pith","pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","venue":"cs.LG","work_id":"bb119d0b-c7f0-412a-a426-f74bd6949a51","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:1ceca816d67f8245586bf91e6d94b2eba7e6e833ce4152b53887f5d44c5c0dac","observation_id":"2cbc8996-b7ae-432a-acea-528bc3fff068","resolution":{"observed_at":"2026-07-09T03:05:55.170422Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.13977","last_updated":"2026-06-27T16:11:05Z","snapshot_observed_at":"2026-08-20T00:59:59.548831Z","submitted_at":"2026-02-15T03:48:20Z","title":"WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL","version":2},"cited_work":{"arxiv_id":"2602.13977","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.13977","snapshot_observed_at":"2026-07-09T03:05:55.345856Z","title":"Wovr: World models as reliable simulators for post-training vla policies with rl","venue":"cs.RO","work_id":"17804900-10e7-4323-9584-388ff825c14a","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2602.13977","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:644a3130d9fb5467a324748a30fe0f609e2cf1f15618d7b650f96618b4e40f0a","observation_id":"4fc0cfcb-86c5-456e-805f-1171b3c1e9a9","resolution":{"observed_at":"2026-07-09T03:05:55.347531Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.754464Z","title":"Hierarchical mixtures of experts and the em algorithm.Neural computation, 6(2):181– 214, 1994","venue":null,"work_id":"20ba4a53-c21e-44b9-8693-a70886a9c45c","year":1994},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:7e58775681e7dd3d8e93e3249867eb2bbab3be598ffe0f5f11f80c86c9d3061a","observation_id":"0ce3b01e-01ee-406c-8090-fcf3a2469eac","resolution":{"observed_at":"2026-07-09T03:05:55.756750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:868fe61d4738bb02172216cdfde12275f686b1b963088038b8cb279eb31b1b8f","observation_id":"92a09cda-2931-4fa5-9a7e-aaa0f977994c","resolution":{"observed_at":"2026-07-09T03:05:55.200980Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.757899Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation.Advances in neural information processing systems, 36:36652–36663","venue":null,"work_id":"00e2bd13-9259-4c19-8ac6-cfe745a0da17","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:340830df3528047475abda13f739f1c3a0845b220f57a1dbffd3e247393f5c03","observation_id":"394d93db-e316-430d-b94a-dc8a9f3e1955","resolution":{"observed_at":"2026-07-09T03:05:55.761087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.772617Z","title":"Reducing activation recomputation in large transformer models","venue":null,"work_id":"5cb4e8f9-9840-4977-9ed6-e35994c40ab3","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:48fe153e90f49acc2f6bb341eb2126da80a9214a7d2c031656b6ce670050daa4","observation_id":"fb7231a6-0d13-4315-b6a0-535134fd160d","resolution":{"observed_at":"2026-07-09T03:05:55.775761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.02027","last_updated":"2022-10-05T20:14:52Z","snapshot_observed_at":"2026-08-17T03:10:15.141603Z","submitted_at":"2021-06-29T04:37:23Z","title":"Efficient Sequence Packing without Cross-contamination: Accelerating Large Language Models without Impacting Performance","version":2},"cited_work":{"arxiv_id":"2107.02027","doi":"10.48550/arxiv.2107.02027","metadata_source":"pith","pith_arxiv_id":"2107.02027","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kosec, S","venue":"cs.CL","work_id":"168014c6-0f97-4394-a665-a80a203ae40c","year":2021},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2107.02027","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:acf4003a714fc64cbc42318d03a627856fdd10fb33937c57ad8915a5a21340f5","observation_id":"31adb489-bf50-4f65-b85c-c432ba8c3717","resolution":{"observed_at":"2026-07-09T03:05:55.225351Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.789787Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":"01add923-a3d4-4438-91d0-b63fab2be6a8","year":2021},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:1db071ddec1f15dccfc8d4f294e392e070260b16147c6eb40f882766fe8f61c8","observation_id":"6a38081c-64f9-42e9-939b-50f0f509036c","resolution":{"observed_at":"2026-07-09T03:05:55.791386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-15T05:27:54.901099Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:7672a3b48b95fa6fda94524d011c1009014ca015da313b7159366b06b74dff2c","observation_id":"eeef1473-3eaf-4837-88a0-1ef8999344ec","resolution":{"observed_at":"2026-07-09T03:05:55.325140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":"2601.21998","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-07-10T12:47:05.502321Z","title":"Causal World Modeling for Robot Control","venue":"cs.CV","work_id":"a33c4ee0-db06-4f9a-8852-c62e3a72fc27","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:e10281bd13a73cf45df6430a151446cf8e2f1174b31beb406c6d44a4ee2e9fb6","observation_id":"c7c95d25-a18b-41a9-9f97-59a0d7a6139b","resolution":{"observed_at":"2026-07-09T03:05:55.339484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.793280Z","title":"Pytorch distributed: Experiences on accelerating data parallel training.Proceedings of the VLDB Endowment, 13(12):3005–3018, 2020","venue":null,"work_id":"ed0b0f47-0088-4233-9304-226fd8c93c5f","year":2020},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:50b4be993958a5c9623195c93ba14bb0e8e61dbae646bab9bddeab2192b70953","observation_id":"c4cbe177-a852-4d45-9eca-d3a27456b067","resolution":{"observed_at":"2026-07-09T03:05:55.794858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.737034Z","title":"Torchtitan: One-stop pytorch native solution for production ready LLM pretraining","venue":null,"work_id":"ed35fa8b-95cf-4a70-a9eb-b8cb23a3616f","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:d674d061ac78596e7310b197e63148890c7dc404ac42943955ea67860c76b911","observation_id":"40d7770b-4240-4ce4-a229-93bb23617050","resolution":{"observed_at":"2026-07-09T03:05:55.738988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-08-14T13:55:25.823113Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"2508.05635","doi":"10.48550/arxiv.2508.05635","metadata_source":"pith","pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","venue":"cs.RO","work_id":"440ad435-44ba-4acd-9aeb-21dd3ee04835","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:8345f0f2e8137e7357363679e9d5e91765bba89f59123fea76088b3b0df7113c","observation_id":"473c2d7a-4c49-488f-80d6-8945664f9613","resolution":{"observed_at":"2026-07-09T03:05:55.333017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.733800Z","title":"Flow matching for generative modeling","venue":null,"work_id":"3a03358e-c47d-482c-ba26-532e599baea6","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:1531a0fd85f7a40dca48a796a6024f32ab352b04e05d6f5203db4605bec41bf9","observation_id":"464c14f7-12a4-4a2f-9696-f95fba431445","resolution":{"observed_at":"2026-07-09T03:05:55.736148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:045d5e431351bd8b98299b3a8d2294a334cfa0d28e81c01c2bd6d30e28c72f21","observation_id":"d6ff8eda-bb2f-446a-ac7b-fe0605904ecf","resolution":{"observed_at":"2026-07-09T03:05:55.318622Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.731419Z","title":"Flow-grpo: Training flow matching models via online rl","venue":null,"work_id":"ef97262e-f9d3-40c8-af71-e2661ae41920","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:a0808910306ddcbe37776b5b1f9df8496ea20e12ac0a4540c145f41c6b94cdd0","observation_id":"fcb022fb-6e5d-4feb-9d85-acc5e2a9d5d4","resolution":{"observed_at":"2026-07-09T03:05:55.732991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:b51b700c89cabc9f9424735c62c11395de8dd45780e5ad2b5aceadbf9ba05bb2","observation_id":"11334e03-e355-4ae6-924e-e86d06c2c4c8","resolution":{"observed_at":"2026-07-09T03:05:55.271067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.887789Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":"bdb5050d-b8df-4f75-b331-b56549ac25f8","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:08ceac2f2a26d16c660786e7e7377271f2391502c7a77c5d4665199b52032b41","observation_id":"52239194-9700-4306-9bd4-5cc0c812d290","resolution":{"observed_at":"2026-07-09T03:05:55.889150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02317","last_updated":"2025-08-07T10:31:09Z","snapshot_observed_at":"2026-08-17T13:05:42.674389Z","submitted_at":"2025-08-04T11:33:04Z","title":"VeOmni: Scaling Any Modality Model Training with Model-Centric Distributed Recipe Zoo","version":3},"cited_work":{"arxiv_id":"2508.02317","doi":"10.48550/arxiv.2508.02317","metadata_source":"pith","pith_arxiv_id":"2508.02317","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Veomni: Scaling any modality model training with model-centric distributed recipe zoo","venue":"cs.CL","work_id":"98e8be4a-3e49-42c6-a20b-0106ca5b2488","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2508.02317","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:73efa06de1ca7493dffdd8d049319ec0e064aa2142188093f1b00e10a30fa9bf","observation_id":"e232313d-ae74-41ba-85ca-1aa9ac3cfe1e","resolution":{"observed_at":"2026-07-09T03:05:55.350703Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.721547Z","title":"Hpsv3: Towards wide-spectrum human preference score","venue":null,"work_id":"625faa9b-3cb8-4c7f-b9ca-37a9ed6daaee","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:8204e22b360463399d91500bf166203ef21b28e1767f988a39f331b13c2e92be","observation_id":"9c5523d9-31bb-45bc-a636-bb086c6a3f6a","resolution":{"observed_at":"2026-07-09T03:05:55.724491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.725347Z","title":"Real: Efficient rlhf training of large language models with parameter reallocation","venue":null,"work_id":"4eef4df3-3a2c-430a-b1fe-da1e68369e01","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:64a7f40089b2546ccd8c986534eea41ad3baa0f9b196f9b4d4b93fc498b6eb23","observation_id":"d4824ef0-bd1d-40e3-849c-37499dde4a93","resolution":{"observed_at":"2026-07-09T03:05:55.727250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.748168Z","title":"Ray: A distributed framework for emerging {AI} applications","venue":null,"work_id":"738f77eb-e487-4bad-be86-d59d0bb307b3","year":2018},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:3384ab9e5256d197ac70295cb0856715ae9a2c66d48d29dfd90a563b0c83cb5c","observation_id":"f58a3575-7986-45ba-91bf-c53d208e01e2","resolution":{"observed_at":"2026-07-09T03:05:55.750194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.714542Z","title":"Do generative video models understand physical principles? InProceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026","venue":null,"work_id":"c3c5f4b0-c314-4bd6-92e5-d6a9d952f234","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:6da5a7290a4f8683f95df283c2e27a2e675ced27683fbc9882263c4a2fd492d9","observation_id":"bc37b517-4919-4e5d-9f5f-d77b863bd67a","resolution":{"observed_at":"2026-07-09T03:05:55.717244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.850400Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":"2968c0ed-729d-4e89-8c81-ccc2516c9203","year":2021},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:f9cd8b2f15566e8cd9665905756974463e5b049ca11b88cf3b9d9122f145e42d","observation_id":"968dffcc-9434-4bda-8baf-a5f669c945b4","resolution":{"observed_at":"2026-07-09T03:05:55.851883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.815574Z","title":"Nowlan and Geoffrey E","venue":null,"work_id":"0b54cf01-bd8e-4c2e-9c4b-8efde159153b","year":1990},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:d61b8f9ae1be26ce27f883f38ee511804c6e379072f9590ba15f392017618838","observation_id":"09dac93e-8f76-4794-8acf-32225fee767f","resolution":{"observed_at":"2026-07-09T03:05:55.816957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.739609Z","title":"The pagerank citation ranking : Bringing order to the web","venue":null,"work_id":"319ad061-d78a-4bb7-a00d-e1ea491e259a","year":1999},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:593aa3b5f714824af081cd3d301478507c8cb9e80657bded72983c387f9bf40b","observation_id":"aec767cb-602e-4f70-90bc-7685a2c7220f","resolution":{"observed_at":"2026-07-09T03:05:55.741486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.791062Z","title":"Switch diffusion transformer: Synergizing denoising tasks with sparse mixture-of-experts","venue":null,"work_id":"bb5fe434-0ba1-4cd0-aaed-c428dfd4f7f7","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:0286ed058c80b726ce9eeb54fd60125e645494a84902dea5fa2a89e41f8b4847","observation_id":"d1773c59-9cad-413b-9689-f6e09ad96be3","resolution":{"observed_at":"2026-07-09T03:05:55.792609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.881505Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"a7d9a278-99a4-4909-8368-42b21df3c6fb","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:d6b1bbfbe4a1bbb3ea168a4908e9878bdfaaa70af7b8e63f1b0301923e610640","observation_id":"2be8db7f-9845-4cdf-9b24-72d192a2f82e","resolution":{"observed_at":"2026-07-09T03:05:55.882836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.844985Z","title":"Lumina- image 2.0: A unified and efficient image generative framework","venue":null,"work_id":"7c96d0a7-ff12-4bcf-9dee-dac30a18f1c5","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:d25ea735a5b9646d2c0fa343b5d631b196432f7dc95c58c99f5c42facd4693cf","observation_id":"84511f17-e38c-46c3-a1ff-6e671e40ce22","resolution":{"observed_at":"2026-07-09T03:05:55.846711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.827330Z","title":"Qwen3.6-27B: Flagship-level coding in a 27B dense model","venue":null,"work_id":"f03c5d18-7a22-491e-a8c7-642cfc181268","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:00b300f47c1c8a3f2cf32a117d16f6c72e10813caa7611d4f659af4d94795b63","observation_id":"6ad04e81-d91d-4b06-9c47-5dca10302cd9","resolution":{"observed_at":"2026-07-09T03:05:55.830705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.18943","last_updated":"2026-06-17T11:23:52Z","snapshot_observed_at":"2026-08-14T13:14:09.722964Z","submitted_at":"2026-06-17T11:23:52Z","title":"Physics-IQ Verified","version":1},"cited_work":{"arxiv_id":"2606.18943","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.18943","snapshot_observed_at":"2026-07-09T03:05:55.353604Z","title":"Physics-IQ Verified","venue":"cs.CV","work_id":"9896d19d-204b-4911-99ba-5e4a786ca41c","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2606.18943","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:4210f24412d2c1b0cfc8f8927434662831048963d420da564d9e6e2dbf88f3ca","observation_id":"4bc46d9b-1a6d-4bcd-bc14-32014c801094","resolution":{"observed_at":"2026-07-09T03:05:55.354852Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.808622Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":"bee1955a-46ae-4c60-aa78-128f83d572d7","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:6284d7e02fd85ea0d843490365124bfc2c7fb1dcfd7cc5b767b3a21416a37801","observation_id":"da621f34-97d6-409b-b817-23bb2e5dcb2e","resolution":{"observed_at":"2026-07-09T03:05:55.810864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.811827Z","title":"Deepspeed-moe: Advancing mixture-of-experts inference and training to power next-generation ai scale","venue":null,"work_id":"c92fe309-f854-4926-bc3f-6506bdb34e5a","year":2022},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:4be129e82e650bb7b74cf007e43b1907300fe7d7a9410513d1ee7de5eed2bfc6","observation_id":"038b75f1-3de7-44e6-8e8c-3777eaf8cbf2","resolution":{"observed_at":"2026-07-09T03:05:55.814087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.815058Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":"02980d6f-ccc4-4d1f-b583-471afa83a57f","year":2020},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:20256768e9fc5d909dc701caf51d43340a2e11dfb16fe4138a6f0a847e7ecb59","observation_id":"919fc223-ef0e-4f77-af59-e31f86ed8a71","resolution":{"observed_at":"2026-07-09T03:05:55.817163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09042","last_updated":"2025-06-18T17:37:28Z","snapshot_observed_at":"2026-08-18T03:37:37.984355Z","submitted_at":"2025-06-10T17:58:17Z","title":"Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models","version":3},"cited_work":{"arxiv_id":"2506.09042","doi":"10.48550/arxiv.2506.09042","metadata_source":"pith","pith_arxiv_id":"2506.09042","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, and Björn Ommer","venue":"cs.CV","work_id":"af51168b-8b82-45d2-bf85-e3d07f99492b","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2506.09042","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:2e14c0be13c5440a4ab5021a981a5a6ff6a99e87cb0941df1264fd4ee60a23fa","observation_id":"dae434a5-f7d6-44e8-9344-81cd38555028","resolution":{"observed_at":"2026-07-09T03:05:55.168574Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20523","last_updated":"2025-03-26T13:11:35Z","snapshot_observed_at":"2026-08-12T12:54:06.280248Z","submitted_at":"2025-03-26T13:11:35Z","title":"GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2503.20523","doi":"10.48550/arxiv.2511.09057","metadata_source":"pith","pith_arxiv_id":"2503.20523","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving","venue":"cs.CV","work_id":"1339e674-d09b-48b4-8e6f-efe55dcab22e","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2503.20523","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:6e0bf2d0d36473ad0c616dca96941e363710db3369b08ee27f51fa31da336051","observation_id":"a650b96b-0a8a-4a9f-8ab7-24366bf6f934","resolution":{"observed_at":"2026-07-09T03:05:55.259747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.804878Z","title":"Image super-resolution via iterative refinement.IEEE transactions on pattern analysis and machine intelligence, 45(4):4713–4726, 2022","venue":null,"work_id":"6fa73d83-de6f-4bbc-b90e-6cdb1aee0f95","year":2022},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:a161af514f4c21f2a41914eaa795d5d661aff00fb8c3b1ea2e621664b950d24b","observation_id":"97ea944d-6de3-4aa4-9a62-14759002b823","resolution":{"observed_at":"2026-07-09T03:05:55.806491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:99ca18f739512d147c69779e072ccfa7394cfd32de45406e6d5bd1f01db0f07f","observation_id":"38a07966-514c-4155-a6e7-fe155d515dfa","resolution":{"observed_at":"2026-07-09T03:05:55.322189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-08-19T04:53:25.142828Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":"2604.14148","doi":"10.48550/arxiv.2604.14148","metadata_source":"pith","pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","venue":"cs.CV","work_id":"ceac4ea4-1ca6-4fe9-8324-880c07aec27d","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:d216d15baff1d3a378dffc554d73af362c4baffc1e066ae96a2a70ea471b3180","observation_id":"c47deaf5-7d9f-4e98-973e-5430389a9be2","resolution":{"observed_at":"2026-07-09T03:05:55.356921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19378","last_updated":"2026-05-12T17:57:13Z","snapshot_observed_at":"2026-08-17T20:46:52.903258Z","submitted_at":"2026-05-12T17:57:13Z","title":"Sparse Mixture-of-Experts Routing in Visual Diffusion Transformers:Diagnosis, Boundary Calibration and Evolutionary Roadmap from Routing Collapse to Selective Deadlock","version":1},"cited_work":{"arxiv_id":"2605.19378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.19378","snapshot_observed_at":"2026-07-09T03:05:55.350217Z","title":"Sparse Mixture-of-Experts Routing in Visual Diffusion Transformers:Diagnosis, Boundary Calibration and Evolutionary Roadmap from Routing Collapse to Selective Deadlock","venue":"cs.CV","work_id":"28b293a3-1fdb-4d74-b415-30948cc3dfe6","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2605.19378","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:7b2b5820418b4aea0319e3a3fffb42d982f293c94a8572841d15cc045f148716","observation_id":"5d982b03-7d9b-4c05-8e04-0c63c9ced34f","resolution":{"observed_at":"2026-07-09T03:05:55.352039Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:84039d9d702c53837d35b11503016467a4fcdd8593c7d4481f9f3b936345fe6f","observation_id":"835da1a1-d149-49c7-a65f-865026b1d31b","resolution":{"observed_at":"2026-07-09T03:05:55.353715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":"2002.05202","doi":"10.48550/arxiv.2002.05202","metadata_source":"pith","pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLU Variants Improve Transformer","venue":"cs.LG","work_id":"17d0763c-1016-41ab-a478-478e890765eb","year":2020},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:b7838060070b943b56a715d567adfb0c6072fe2d35edfc83837472c7f3e9f539","observation_id":"2a2a4251-64d1-4448-869e-7ab78b2c0bc5","resolution":{"observed_at":"2026-07-09T03:05:55.184581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.869102Z","title":"Mesh-tensorflow: Deep learning for supercomputers","venue":null,"work_id":"95e86962-bbb6-4ac3-b77b-2558b6ebfa47","year":2018},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:2a20aada0fca3ca442e7eb6f3ee88d60a19c346bf7eda135f13884665ec7d001","observation_id":"fb08d893-8931-4f43-89d8-362c3c877578","resolution":{"observed_at":"2026-07-09T03:05:55.870274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.863470Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"696ed560-cbac-4847-9355-4f8b9e59f848","year":2017},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:6d9e16cb0ad8627a74e7e47110e53c2a40d89e2eb226338b19584d1b1e0df3ff","observation_id":"32ae3d71-85b3-4adf-a9a1-8d7689e95057","resolution":{"observed_at":"2026-07-09T03:05:55.864664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:07:26.477602Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":"3581d50d-6da4-452f-b4c2-9b9de8ade38a","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:6264b5ead57144119dbc5871f518a088e84c315e58290b51b1be92c2bbf15cda","observation_id":"1e44ba84-e90d-490b-a7b2-88690518180c","resolution":{"observed_at":"2026-07-09T03:05:55.884832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:af229db9d6141a33d1790a8c0c13366afd8b5989dcfe0775b99e196f938b341c","observation_id":"6d976b50-22dc-484d-a0af-becea7fd26c9","resolution":{"observed_at":"2026-07-09T03:05:55.328143Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.867370Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":"a46c3c42-604a-462a-bf69-9d26f926f053","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:b744f15ba0ea2b1c3db985eb1cb250ee4371712937296177b18d9d62bc1ac496","observation_id":"1d797439-c349-460b-898b-43d24b56e346","resolution":{"observed_at":"2026-07-09T03:05:55.868532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.874564Z","title":"Denoising diffusion implicit models","venue":null,"work_id":"c9e23da9-2102-46dc-9b23-78dc77a7614b","year":2021},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:3997c57fc1b437ccd90c669ffc6751a88f963e668c4f24d32445f86b8d77f4f1","observation_id":"8cf65560-843c-4178-95a5-a23029179f14","resolution":{"observed_at":"2026-07-09T03:05:55.875666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.861721Z","title":"Transnet v2: An effective deep network architecture for fast shot transition detection","venue":null,"work_id":"a49515c2-2c87-410f-8da0-57f514155068","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:a637b7c33c918066968f6553be30b967aad892efb9e9fde826857999b3bbe854","observation_id":"d6d45c22-70df-4efe-bd4e-c9ed7ebb22cf","resolution":{"observed_at":"2026-07-09T03:05:55.862914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14614","last_updated":"2026-06-09T16:18:08Z","snapshot_observed_at":"2026-08-23T13:53:00.658514Z","submitted_at":"2025-12-16T17:22:46Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","version":2},"cited_work":{"arxiv_id":"2512.14614","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.14614","snapshot_observed_at":"2026-07-09T07:56:04.709254Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","venue":"cs.CV","work_id":"48231e12-6c15-4f28-8c51-092766c59f93","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2512.14614","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:64147697271bb5f64f50d9d27c142592ed2048c787d6b9186f9e22142a1df992","observation_id":"0755ce10-6287-42c9-857e-670fedd53d33","resolution":{"observed_at":"2026-07-09T03:05:55.236141Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.855866Z","title":"Enhancing spatial understanding in image generation via reward modeling","venue":null,"work_id":"0e4a2556-dbe9-44c8-b5fb-4531716c27b7","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:f8f8ab3b62aae9e7781814969c934e582c905e03d91abbab07661b56ac473a5c","observation_id":"160d8aa8-d12f-43e4-a359-51c79c75ad8d","resolution":{"observed_at":"2026-07-09T03:05:55.857468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:abeab9b8a2f4c3f1eeade5b12c5af5463949b4d17c45ed5f3b38037373caac44","observation_id":"fcc3de0e-a0fe-440d-96e2-fab7e393983c","resolution":{"observed_at":"2026-07-09T03:05:55.328674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.10675","doi":"10.48550/arxiv.2512.10675","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Gemini Robotics Policies in a Veo World Simulator","venue":"ArXiv.org","work_id":"4c5c257d-41d7-459c-b2b8-ec7b082b9d94","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:cbcb36be4c004a89a6a4cb05d11e3434b408020742d5eb254107d81ff9b3aca2","observation_id":"f74cdbbd-8267-4731-a1ee-2b41c2990fad","resolution":{"observed_at":"2026-07-09T03:05:55.344354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:30.970172+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:30.970172+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20540","last_updated":"2026-01-28T12:37:01Z","snapshot_observed_at":"2026-08-13T17:45:09.123419Z","submitted_at":"2026-01-28T12:37:01Z","title":"Advancing Open-source World Models","version":1},"cited_work":{"arxiv_id":"2601.20540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.20540","snapshot_observed_at":"2026-07-10T08:36:59.816756Z","title":"Advancing Open-source World Models","venue":"cs.CV","work_id":"3446760e-6460-429e-82f6-6a5133ce4c8a","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2601.20540","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:940fdf41836e2f6f27ad7013c46725030bb8379c42f23f94c51fc02c2921f999","observation_id":"29b8e9b5-aa8a-4167-ad5f-f5db53fff0b4","resolution":{"observed_at":"2026-07-09T03:05:55.240536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.858089Z","title":"slime: An LLM post-training framework for reinforcement learning at scale","venue":null,"work_id":"7cfddd68-375f-4232-9d01-d8e3fd558402","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:cdc5c1ba0c1d4a58bf8f3252cb7dcc96cccb18508548f9ed6c7fb5cf4a4c421e","observation_id":"5eef6e33-39c3-4207-9b22-36a51d5beee7","resolution":{"observed_at":"2026-07-09T03:05:55.859462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.845797Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport.Transactions on Machine Learning Research, 2024","venue":null,"work_id":"4fd85efe-811e-438a-b639-bb6c48cd486d","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:57987eccbe7f773081fb29b631d16d77a7029ebc406b37e2c2030f484b5dbde3","observation_id":"6ee41ac9-c8d5-49ce-bebb-de466474b3b1","resolution":{"observed_at":"2026-07-09T03:05:55.847540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:c1cbfc32c159053547ba3889f9642a1b9e0a29a41977d2bc240ab73ffad81e6e","observation_id":"f36e0406-9dc6-46d4-9573-787d6d1d8b00","resolution":{"observed_at":"2026-07-09T03:05:55.285108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T05:10:11.940999Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":1,"unresolved":0,"verified_exact":42,"verified_fuzzy":54},"total_outbound_references":131},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 100 of 131 outbound references and 5 inbound Pith citation observations for arXiv:2607.07675."}