{"as_of":"2026-08-10T08:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:84be0615936582a6cd713c4cc998d60f2f199c3502bc47d2f10d64183b6a6ee2","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:48:37.632916Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03741/citation-record","integrity":"/paper/2608.03741/integrity","json":"/paper/2608.03741/citation-record.json","paper":"/paper/2608.03741"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:41.935853Z","title":"Inside NVIDIA Groq 3 LPX: The Low- Latency Inference Accelerator for the NVIDIA Vera Rubin Platform,","venue":null,"work_id":"5eac6e51-d0be-49b5-8fda-360e10568a36","year":2026},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:34.637417Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:25e2ebecd7f30ffeb41fc6a92bf12dc2abe34710af862db90a16bc88ec266683","observation_id":"5b1323bf-6dc8-4b82-8327-b798dc56b6a0","resolution":{"observed_at":"2026-08-05T13:48:42.015889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:41.774095Z","title":"Web agents with world models: Learning and leveraging environment dynamics in web navigation,","venue":null,"work_id":"54b0db77-36a2-4dfa-a869-1c8589b3246e","year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:34.696373Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:4f2148e93bc50d516d613042efda75f58f57b9255e7df97f5716d0cccdc8d9bc","observation_id":"4917b56c-8c02-4fbf-aceb-270e8b77fd89","resolution":{"observed_at":"2026-08-05T13:48:41.841775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:41.655384Z","title":"Llmservingsim 2.0: A unified simulator for heterogeneous and disaggregated llm serving infrastructure,","venue":null,"work_id":"bbec2567-c585-4deb-a1c6-004a3135df88","year":2026},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:34.768955Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:5df0ba3e851cb79fab17977d994653d6e4e0681930f9de611840abc8835377f9","observation_id":"4bc64967-f6e2-4e7b-9463-98dfd1d95a08","resolution":{"observed_at":"2026-08-05T13:48:41.709830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T13:48:34.861373Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:34.861373Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:4b6db908321235ca1a1dc1781bd6c7fa800986100748aff9884b57d8fdc2421d","observation_id":"e94c5b14-61c8-495c-b5ae-0e421252978b","resolution":{"observed_at":"2026-08-05T13:48:34.861373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:41.500136Z","title":"Deepseek-v4 technical report,","venue":null,"work_id":"18124a0d-895c-48a3-9eed-e522628de9b3","year":2026},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:34.943084Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:ff2584b29ca83992ac1ffc57f61ff8679baf98a58d7f0d07cc04df54e31893b4","observation_id":"5e24d336-76dc-4180-af7c-f5f96195ddcb","resolution":{"observed_at":"2026-08-05T13:48:41.594627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:41.313070Z","title":"Coral npu: A full-stack platform for edge ai,","venue":null,"work_id":"ee9a0cf2-a5bb-4432-ae77-634ce6bb7605","year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.017260Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:60004f629767d28b63df68b070e5359dbf5c5cbeb9b94bb30fbeb885aa32b664","observation_id":"4a8b2a17-e09e-4ba0-935c-11cbfd20c0b9","resolution":{"observed_at":"2026-08-05T13:48:41.414349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:41.134446Z","title":"The llama 3 herd of models,","venue":null,"work_id":"35461275-1876-47b2-a366-d873d5504ed4","year":null},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.075757Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:527a37f5ce454ab73c06986a453ae5614581302007efade8210ad497f4404b2d","observation_id":"8e296dde-dde5-46b4-948d-f2c40e5f3a5f","resolution":{"observed_at":"2026-08-05T13:48:41.208892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:40.982023Z","title":"Webvoyager: Building an end-to-end web agent with large multimodal models,","venue":null,"work_id":"be55c529-d8e9-443c-bec6-3331885b84b2","year":2024},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.263768Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:1636bc48c983d93cd27acd1e9fc9a59933068e2470330cde58fc3326f3bd3666","observation_id":"039c93ab-396d-410f-9505-dad9ac140e02","resolution":{"observed_at":"2026-08-05T13:48:41.052218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.13358","last_updated":"2026-05-05T10:21:59Z","snapshot_observed_at":"2026-08-02T12:32:31.923333Z","submitted_at":"2026-03-09T06:11:23Z","title":"Not All Prefills Are Equal: PPD Disaggregation for Multi-turn LLM Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.13358","snapshot_observed_at":"2026-08-05T13:48:35.375376Z","title":"Not all prefills are equal: Ppd disaggregation for multi-turn llm serving,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.375376Z"},"links":{"cited_paper":"/paper/2603.13358","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:b134a1efc2e9a2d4276ac0a0be9a21dfd12db2969f0fcb52f151da47f567db76","observation_id":"72d5d76a-1401-4d01-b148-785036f11671","resolution":{"observed_at":"2026-08-05T13:48:35.375376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:40.761279Z","title":"The llama 4 herd: The beginning of a new era of natively mul- timodal ai innovation,","venue":null,"work_id":"567eb90b-4a08-47e0-ba4f-92a423edda7e","year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.481168Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:ab8dfbef2adae7004cc1329131d022af4a7cfcd5bcdb4bd83b1ccdd2dffd28b3","observation_id":"c3ef4ac6-1b75-4ca8-8f78-0a64a8dca847","resolution":{"observed_at":"2026-08-05T13:48:40.843456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.08721","last_updated":"2026-05-29T10:02:49Z","snapshot_observed_at":"2026-08-09T22:16:22.909265Z","submitted_at":"2026-02-10T14:52:02Z","title":"KernelCraft: Benchmarking for Agentic Close-to-Metal Kernel Generation on Emerging Hardware","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.08721","snapshot_observed_at":"2026-08-05T13:48:35.603804Z","title":"Kernelcraft: Benchmarking for agentic close-to-metal kernel generation on emerging hardware,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.603804Z"},"links":{"cited_paper":"/paper/2603.08721","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:3b45f333d263123dc2199eb33158bd7355e6c43774209b2ae1ed932d695fd01a","observation_id":"45a99a89-d9d7-410d-a84a-0c2143f6064b","resolution":{"observed_at":"2026-08-05T13:48:35.603804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:40.556944Z","title":"NVLink and NVLink switch,","venue":null,"work_id":"36b84c98-3791-4a89-8dfc-d8446c5d5c45","year":2026},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.697972Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:0ebddea6711f46eeea3a112b666dd583d7e66e85db89437e358b42b1614b4ad6","observation_id":"c4f9b2ba-9676-4e35-8bee-371649d18d97","resolution":{"observed_at":"2026-08-05T13:48:40.625721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-05T13:48:35.787007Z","title":"gpt-oss-120b & gpt-oss-20b model card,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.787007Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:e0ff451aed67834e5764b0c889a75a34d17855c0a4d62d0c6966dd2165cc4fb8","observation_id":"cfd5190e-6086-4fda-ac4a-a9ae272a20e7","resolution":{"observed_at":"2026-08-05T13:48:35.787007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18677","last_updated":"2024-05-20T15:37:36Z","snapshot_observed_at":"2026-08-06T12:06:11.068182Z","submitted_at":"2023-11-30T16:24:42Z","title":"Splitwise: Efficient generative LLM inference using phase splitting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18677","snapshot_observed_at":"2026-08-05T13:48:35.895560Z","title":"Splitwise: Efficient generative LLM inference using phase splitting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.895560Z"},"links":{"cited_paper":"/paper/2311.18677","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:009b8f08358da354058ab4fea1e2f41f6a7b29b44d44ff08c6dcd8ada7cc5ec9","observation_id":"f32fe468-4421-4c07-8a26-922c78e6c6a7","resolution":{"observed_at":"2026-08-05T13:48:35.895560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:40.360125Z","title":"The berkeley function calling leaderboard (bfcl): From tool use to agentic evaluation of large language models,","venue":null,"work_id":"5c12d205-db78-4f66-ac8e-ea9c9f0e14af","year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.036808Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:0aa76e247f2c7ca37014610a67aaa2324359ebcb713c6e9d9803efdacf4d36e6","observation_id":"7fc07b3d-4afd-49c6-8169-881cabb7c74f","resolution":{"observed_at":"2026-08-05T13:48:40.441203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:40.059255Z","title":"Mooncake: Trading more storage for less computation — a KVCache-centric architecture for serving LLM chatbot,","venue":null,"work_id":"b2cf789b-e2f2-4847-a8bc-d44d3046b557","year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.174144Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:564da10b0588528383d89dd91fc9979818cde21137a6d54ded4d27dd3b4e4e0b","observation_id":"a4f6c8e8-3abf-4dce-9528-1ad848211172","resolution":{"observed_at":"2026-08-05T13:48:40.200944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T13:48:36.285131Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.285131Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:0d1e638099f360b7c66a7aa3301a5cbc2cb775cba07cae78b067b4bee09c15e3","observation_id":"4a368799-2552-4418-82cb-4f0159ef359d","resolution":{"observed_at":"2026-08-05T13:48:36.285131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:39.864428Z","title":"Microscopiq: Acceler- ating foundational models through outlier-aware microscaling quantiza- 12 tion,","venue":null,"work_id":"c27c4e24-689f-4b5e-aa32-8cc13f5fa6e5","year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.379847Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:289da91efcd4c4017b6875f02e0d3bfd441641ede2877601fe5ca23e71b124c5","observation_id":"8f3e952b-eed5-4671-94d6-7026ca733b78","resolution":{"observed_at":"2026-08-05T13:48:39.974689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:39.713462Z","title":"Longcodebench: Evaluating coding LLMs at 1m context windows,","venue":null,"work_id":"072d6859-cffa-4ed7-9e5e-f9714eeff884","year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.454068Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:02eb36a6cbbb518fa51cee2ac79b30b88553e27ad23e79b61070b9a0efb10672","observation_id":"94a5c529-7c54-4469-ac12-baa9df6dbcda","resolution":{"observed_at":"2026-08-05T13:48:39.785628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-08-08T01:04:32.134805Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-05T13:48:36.545613Z","title":"Microscaling data formats for deep learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.545613Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:3a921ce7e16d8b6ffec0dfb8b76330b98d4faf64bdab14499835425ad6865fd1","observation_id":"4833d5a2-b500-44c4-a4c2-19fff570c7ee","resolution":{"observed_at":"2026-08-05T13:48:36.545613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:36.629024Z","title":"Step-3 is large yet affordable: Model-system co-design for cost-effective decoding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.629024Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:66326e6e0ca64a730c056fab020474678e7c504e132fc02fbe82ce1b9f4e64d9","observation_id":"2d7092fc-aef3-42df-b48d-c8be21df4baa","resolution":{"observed_at":"2026-08-05T13:48:36.629024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:39.528548Z","title":"Attention is all you need,","venue":null,"work_id":"0a938bce-b82b-40e9-a213-425f5567279d","year":2017},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.693499Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:4e1b14d3eaae07f41f62f52322d70bc44c3683da5e9b73376f8ae409bcd796b9","observation_id":"8fdd8148-cabc-4dca-ba8c-bd36b470d259","resolution":{"observed_at":"2026-08-05T13:48:39.608902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16007","last_updated":"2026-04-17T12:29:54Z","snapshot_observed_at":"2026-07-06T23:03:26.308324Z","submitted_at":"2026-04-17T12:29:54Z","title":"MemExplorer: Navigating the Heterogeneous Memory Design Space for Agentic Inference NPUs","version":1},"cited_work":{"arxiv_id":"2604.16007","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.16007","snapshot_observed_at":"2026-08-05T13:48:37.920686Z","title":"MemExplorer: Navigating the Heterogeneous Memory Design Space for Agentic Inference NPUs","venue":"cs.AR","work_id":"2cafb8bd-8fbc-43a4-840a-5661c4f57fad","year":2026},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.799912Z"},"links":{"cited_paper":"/paper/2604.16007","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:855695d953c24f8464a681959a028b33ed85ca4a75f752294d9327e816ce02c3","observation_id":"825ce3a6-33d0-4c3d-abf2-746d907971ec","resolution":{"observed_at":"2026-08-05T13:48:38.002161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09505","last_updated":"2026-04-12T10:29:26Z","snapshot_observed_at":"2026-07-06T22:28:48.082201Z","submitted_at":"2025-09-11T14:49:50Z","title":"Combating the Memory Walls: Optimization Pathways for Long-Context Agentic LLM Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09505","snapshot_observed_at":"2026-08-05T13:48:36.864717Z","title":"Combating the memory walls: Optimization pathways for long-context agentic llm inference,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.864717Z"},"links":{"cited_paper":"/paper/2509.09505","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:179a3375ea16bb1c25e116cf77980348c9afded54aa0648faf8dce2a1129c565","observation_id":"35cc6f7d-513c-4d5d-af3b-4658d545bf61","resolution":{"observed_at":"2026-08-05T13:48:36.864717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:39.311292Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments,","venue":null,"work_id":"72720d81-a619-4978-a033-48d84b67c122","year":2024},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:36.964339Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:e6c57b4c9af45d1b6efb603ed037210c5f2c33b40996845ba681877232a9ff1a","observation_id":"470641ae-f7fd-491a-a5df-906aa9c61427","resolution":{"observed_at":"2026-08-05T13:48:39.434810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03868","last_updated":"2024-01-09T06:47:46Z","snapshot_observed_at":"2026-07-06T17:12:47.723473Z","submitted_at":"2024-01-08T13:00:53Z","title":"FlightLLM: Efficient Large Language Model Inference with a Complete Mapping Flow on FPGAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03868","snapshot_observed_at":"2026-08-05T13:48:37.037252Z","title":"Flightllm: Efficient large language model inference with a complete mapping flow on fpgas,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:37.037252Z"},"links":{"cited_paper":"/paper/2401.03868","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:afa9d8e0b38904c37c1f6fd9091ccfa94d0d5596e50bc26bb68e37ffdf51870f","observation_id":"42076615-39d6-4aac-b043-0079714b0cd1","resolution":{"observed_at":"2026-08-05T13:48:37.037252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:39.197279Z","title":"MR-GSM8K: A meta- reasoning benchmark for large language model evaluation,","venue":null,"work_id":"93d6c28c-8fdb-4568-bade-cd63f1d95317","year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:37.140810Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:88e5b14bc2bcb4080c21eb3023a47d0c59c75d71d35b868a3cd0d4661fdcc55d","observation_id":"c2eee7e2-fdca-4fa4-97a4-7e46e8059e95","resolution":{"observed_at":"2026-08-05T13:48:39.257272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:39.012593Z","title":"Mase: An efficient represen- tation for software-defined ml hardware system exploration","venue":null,"work_id":"83791bb2-05c7-4507-99bd-81fbd9a4dcbf","year":null},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:37.250129Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:5cf0590171c9fe1182fd4715ede6768b8a3e99d64491455e41bad7c63c7d02f5","observation_id":"0bdc0f63-0938-462b-b470-c30d5c262fbf","resolution":{"observed_at":"2026-08-05T13:48:39.102770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:37.345909Z","title":"Llmcompass: Enabling efficient hardware design for large language model inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:37.345909Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:3b7af4ae9f136e7c87e8c29e8ea40509b2660c030142ecf740eb4e9dd81bbd2b","observation_id":"7cb9be3a-f18e-4d21-9ba3-f2f09ae1db76","resolution":{"observed_at":"2026-08-05T13:48:37.345909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:38.736649Z","title":"Glm-4.6,","venue":null,"work_id":"5dc96a5f-295a-48b4-87e9-6545ae3590eb","year":2025},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:37.397127Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:43fa8205da6cc755a51ac63d8d811f076f8e22b7c1b1d88a7fbaf6ee570ef1c1","observation_id":"25e468c8-ab4a-4e0c-8ff8-116626317461","resolution":{"observed_at":"2026-08-05T13:48:38.921208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:38.549422Z","title":"Distserve: disaggregating prefill and decoding for goodput-optimized large language model serving,","venue":null,"work_id":"18d27154-9990-45e3-9fca-7564c4f41938","year":2024},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:37.535768Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:242e327bb1925357e88d7ba211484e5d56ec744f04f073094c375173951ecd04","observation_id":"0024333a-9f93-4412-914d-fe1da8eb7ba8","resolution":{"observed_at":"2026-08-05T13:48:38.671433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:48:38.298744Z","title":"Distserve: Disaggregating prefill and decoding for goodput-optimized large language model serving,","venue":null,"work_id":"f7219329-d43b-4654-8f62-e839eea81ce8","year":2024},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:37.632916Z"},"links":{"citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:e4d0d1c23d92a5b007c5663c9809d8832ff3711d96c31bfdb92b6491410e5a9c","observation_id":"008bf376-6b11-4ac8-af99-73d24bd3d643","resolution":{"observed_at":"2026-08-05T13:48:38.421954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T13:48:35.172321Z","title":"Available: https://arxiv.org/abs/2407.21783","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T13:48:35.172321Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.03741"},"observation_digest":"sha256:3257641eda5bc97b90497d828fd74a0e8a9e7cd3afb22847de7ce3c65b1489cc","observation_id":"1bec9d0f-f8b6-4ec7-8115-65790dc4223e","resolution":{"observed_at":"2026-08-05T13:48:35.172321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03741","last_updated":"2026-08-04T14:35:25Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-10T01:46:34.664054Z","submitted_at":"2026-08-04T14:35:25Z","title":"When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2608.03741."}