{"as_of":"2026-08-18T00:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:37ca7f5f7618af6e7933e88d11c923cb7e71b3761303978de71bf361b9d7990c","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:55:48.493810Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06723/citation-record","integrity":"/paper/2608.06723/integrity","json":"/paper/2608.06723/citation-record.json","paper":"/paper/2608.06723"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.276350Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.276350Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:a33701ce58e6414330287e597b386b0dc123f7a46842fcd7a9ddabe78eb2c4ef","observation_id":"d25f992d-3c65-413f-b9c1-95b04e444e06","resolution":{"observed_at":"2026-08-10T21:55:48.276350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.283790Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learning Research, 23(120):1–39, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.283790Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:0f26b15e8722ea13fb1187880249243b0e4a0699afbe95fdf1d7ef68b2e2d5c4","observation_id":"bedc714b-9ed4-4219-8c6e-0dbda069735e","resolution":{"observed_at":"2026-08-10T21:55:48.283790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:49.141577Z","title":"Smith, and Oren Etzioni","venue":null,"work_id":"251760f0-0a6e-4a10-bb92-bcf763c0e2f8","year":2019},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.293331Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:df85926ecd4634ac679193abac13142fb4c73958c36223b90af56e8f02ea60e4","observation_id":"d581aae6-f8ed-4056-8065-6397958fc59e","resolution":{"observed_at":"2026-08-10T21:55:49.150205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:49.115117Z","title":"Power hungry processing: Watts driving the cost of AI deployment? InProceedings of the 2024 ACM Conference on Fairness, Accountability, and Transparency, pages 85–99, 2024","venue":null,"work_id":"be3af1fe-8a56-4e9b-b7c7-2c772fef5dcb","year":2024},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.300384Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:17fa958efdca4ddb64175bac5e8ea0af70b4efba293de1a67f59a1c0dcd90c9a","observation_id":"49e275f2-effb-42ec-a47a-64c69e97e445","resolution":{"observed_at":"2026-08-10T21:55:49.122233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10350","last_updated":"2021-04-23T14:26:29Z","snapshot_observed_at":"2026-08-16T05:11:57.545339Z","submitted_at":"2021-04-21T04:44:25Z","title":"Carbon Emissions and Large Neural Network Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10350","snapshot_observed_at":"2026-08-10T21:55:48.307652Z","title":"Le, Chen Liang, Lluis-Miquel Munguia, Daniel Rothchild, David So, Maud Texier, and Jeff Dean","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.307652Z"},"links":{"cited_paper":"/paper/2104.10350","citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:3aeb95f2c72036148d453b5f0bd394de94bbad83b47d4fba8713f9d99f71b074","observation_id":"1182a046-79b7-4855-8bb6-d99d7b6d7ffa","resolution":{"observed_at":"2026-08-10T21:55:48.307652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.315728Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.315728Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:8df6e28aff3ffd963f65c36b2595fd331c9df9393461d138dc975e1490a05600","observation_id":"2a7631d3-f6e2-46b1-902e-93e0e9d0716c","resolution":{"observed_at":"2026-08-10T21:55:48.315728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:49.067138Z","title":"Integration of oscillator-based feature extraction for energy- efficient convolutional neural networks.Journal of Applied Physics, 139(23), 2026","venue":null,"work_id":"c1b4c409-987d-4d41-af6b-ce50e66d564d","year":2026},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.322459Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:4ae566f45326b4ac66e3aa78db2442929bf19fd8fa9fe77aed614c85de43cfd2","observation_id":"19ba2726-6f04-4f4f-9638-b08edcbe4528","resolution":{"observed_at":"2026-08-10T21:55:49.073652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:49.047817Z","title":"Data driven control of defect formation in solution de- posited sb2se3 thin films.Advanced Materials Interfaces, 12(24):e00798, 2025","venue":null,"work_id":"e845240d-7911-4390-b11e-8eb7051e2f5f","year":2025},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.328580Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:294066fca388d22877bf2424897dafc1fb9bc4d0e848b69e9a4ef0e5eb8393a0","observation_id":"ad959678-1965-4a4d-b039-df042717a60b","resolution":{"observed_at":"2026-08-10T21:55:49.054519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:49.028722Z","title":"GPTQ: Ac- curate post-training quantization for generative pre-trained transformers","venue":null,"work_id":"00150609-3f1d-4f8f-98c2-b196badfabad","year":2023},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.334436Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:2ea57df924ee0bf9cf455a50652d7e5486406e6757aea206cf817c6351f18ae6","observation_id":"0271c185-c395-4d19-9cf4-dd99f410a93d","resolution":{"observed_at":"2026-08-10T21:55:49.035818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.339845Z","title":"LLM.int8(): 8-bit matrix multiplication for transformers at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.339845Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:630d47deea9921ab47d2e9da4b8f26eaf76a8f267a2a8328165ecbe08c991c7c","observation_id":"e5770bac-4ffd-44f2-b4d8-20cf6fbe4342","resolution":{"observed_at":"2026-08-10T21:55:48.339845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.996514Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":"447f494d-0fc0-41d7-ae91-9e1bdd7f2102","year":2022},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.346081Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:6afc4733bfc9c0047ce450ef034afc926e2c4f04da8af6cb120a1ce6db3d0d12","observation_id":"539686e9-0dec-484f-a644-6506b4bebff5","resolution":{"observed_at":"2026-08-10T21:55:49.003153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.352798Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.352798Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:a7892de15da52aee9e606aca6b6dfeac9ac9202db7df1ee3080c625ae70a5717","observation_id":"7235a63f-ce18-4dcb-a52d-bc3263e48180","resolution":{"observed_at":"2026-08-10T21:55:48.352798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.359844Z","title":"SparseGPT: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.359844Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:d5a6373ff3cc24a030f7a3cf6bbe35e8b7309c8859f54d24b7e2a088f680814f","observation_id":"3ff61b44-86db-4b0a-9dda-aa6e5788c45d","resolution":{"observed_at":"2026-08-10T21:55:48.359844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.955704Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"3527bc5e-2e92-4bf3-8f96-10a8d151f124","year":2023},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.365325Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:c5f9913d91a51ae53187b48106682ecf4dce2380c1ffe02a8c7919319eb48661","observation_id":"a0ff47b5-a20e-4b5a-b114-c4ae9cefd71a","resolution":{"observed_at":"2026-08-10T21:55:48.960925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-10T21:55:48.371368Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.371368Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:74b08780b4b39bea905bee5115d453a2a9de372b7e69c3620dcaab6903348e33","observation_id":"e087a867-8253-4e48-a848-4a50a59d95de","resolution":{"observed_at":"2026-08-10T21:55:48.371368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.936098Z","title":"Unified LLM model for power, performance, and area prediction from hardware code","venue":null,"work_id":"4308e6be-4c79-42d9-8b9c-e8070971ebc1","year":2026},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.379381Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:188c8f0f14eaf49887a75c441559092d97164534a103df9a73e6a716bf59a1c0","observation_id":"67ad2f9c-e9c1-43a3-8e00-9d5ccb9db0e6","resolution":{"observed_at":"2026-08-10T21:55:48.941937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.916490Z","title":"Hdlforge: A two-stage multi-agent framework for efficient verilog code generation with adaptive model escalation, 2026","venue":null,"work_id":"85082627-500e-4434-8fee-8879362e8ea6","year":2026},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.385547Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:9e252e945ca179bad1230fc2ff781ee5f691a0d8b509fd9657ea69c03e6ae728","observation_id":"a4489553-44fb-415c-8949-25819517fd91","resolution":{"observed_at":"2026-08-10T21:55:48.922765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.895065Z","title":"Semi-supervised gan with hybrid regulariza- tion and evolutionary hyperparameter tuning for accurate melanoma detection","venue":null,"work_id":"927e4501-6a84-4e7e-aa56-22e34ea93b5d","year":2025},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.394871Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:bf1273fcbb99aef5a7bab5e91418bd58d8900004140e925cf0565a36abdc9cbd","observation_id":"f61b530f-6bb9-4b97-97ce-fd433a0df49d","resolution":{"observed_at":"2026-08-10T21:55:48.901008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30641","last_updated":"2026-05-28T22:52:15Z","snapshot_observed_at":"2026-08-05T08:21:43.719498Z","submitted_at":"2026-05-28T22:52:15Z","title":"COFT: Counterfactual-Conformal Decoding for Fair Chain-of-Thought Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2605.30641","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.30641","snapshot_observed_at":"2026-08-10T21:55:48.618816Z","title":"COFT: Counterfactual-Conformal Decoding for Fair Chain-of-Thought Reasoning in Large Language Models","venue":"cs.CL","work_id":"1f2b7938-49cb-46f1-af74-9f01f8facd68","year":2026},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.404298Z"},"links":{"cited_paper":"/paper/2605.30641","citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:8b2cad763200595498ce18a21697b4513aee106fd546d6b96917c11bd5b3bfa3","observation_id":"66836d24-3adf-4bd3-80ee-525f32db6151","resolution":{"observed_at":"2026-08-10T21:55:48.626709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00951","last_updated":"2025-05-02T01:54:08Z","snapshot_observed_at":"2026-08-16T22:29:18.822754Z","submitted_at":"2025-05-02T01:54:08Z","title":"Preserving Privacy and Utility in LLM-Based Product Recommendations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00951","snapshot_observed_at":"2026-08-10T21:55:48.410902Z","title":"Preserving privacy and utility in llm-based product recommendations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.410902Z"},"links":{"cited_paper":"/paper/2505.00951","citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:b99a82b262763409d1684e80b55eb8a461133d1d58dd76420e1519d896a499fa","observation_id":"6d9ace1f-2c38-49e5-84cd-54596a1314d0","resolution":{"observed_at":"2026-08-10T21:55:48.410902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.873684Z","title":"Large language models encode clinical knowledge.Nature, 620:172–180, 2023","venue":null,"work_id":"ed8a8bfd-0377-4e7e-9f2c-2947122cc7fb","year":2023},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.417808Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:df33d2634ee1b780fb6fdd420d4f32d05e1c59c17e01097d08f1d6a9584817d3","observation_id":"37f2cc4e-dea6-401e-8c36-8e8194038412","resolution":{"observed_at":"2026-08-10T21:55:48.881243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-08-14T12:54:48.492396Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17564","snapshot_observed_at":"2026-08-10T21:55:48.424579Z","title":"BloombergGPT: A large language model for finance.arXiv preprint arXiv:2303.17564, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.424579Z"},"links":{"cited_paper":"/paper/2303.17564","citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:b4ad358d97f85eb9b177a587d7cd4810cc56f01019afc44a86a73c309a7be796","observation_id":"2fa91b8b-09d4-4cc5-b194-e1a99f7f442b","resolution":{"observed_at":"2026-08-10T21:55:48.424579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.852885Z","title":"Ho, et al","venue":null,"work_id":"4505ec62-7b2d-4d81-803b-b7f4ce2f23b4","year":2023},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.430383Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:3a52641664926e575a5982d6ffdcba2130ef6d8981c4c9371db97855f5223595","observation_id":"3f06cbb6-3fff-43ea-8b2c-fa495e7745a5","resolution":{"observed_at":"2026-08-10T21:55:48.859838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.833069Z","title":"ChatGPT for good? on opportunities and challenges of large language models for education.Learning and Individual Differences, 103:102274, 2023","venue":null,"work_id":"7fd0fef1-c3fd-4f21-b21c-00e2f9d614ce","year":2023},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.435759Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:466580b14676d22a67caed0ca435ef017d03e7601a5dbcc986683907ac12b585","observation_id":"277eaeee-82c1-43d5-9cc3-b25962a6f15b","resolution":{"observed_at":"2026-08-10T21:55:48.838600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.813859Z","title":"Amali: An analytical model for accurately modeling llm inference on modern gpus","venue":null,"work_id":"c0178ea7-96c5-4a25-9c20-8bb26e52cd2d","year":2025},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.441341Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:4529e4d83ca3c7b9a8e1816b0c04102138dee018ffae7b51609c239f9aa94caf","observation_id":"44e1ef65-39b5-48cb-b131-428e2b0e6da3","resolution":{"observed_at":"2026-08-10T21:55:48.819507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.794760Z","title":"Forecasting llm inference performance via hardware-agnostic analytical modeling, 2025","venue":null,"work_id":"4b28e78a-b870-4a54-b81a-43bea163302d","year":2025},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.447081Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:7503cfc96a3f16bcc2016af8a68090c674acd66b9df9f97df33fc2bbeaf70780","observation_id":"8565f46f-5830-46cf-82d8-4e1cebcd6469","resolution":{"observed_at":"2026-08-10T21:55:48.800498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.773005Z","title":"Espos- ito, Francesco Antici, Daniele Cesarini, Zeynep Kiziltan, and Andrea Bartolini","venue":null,"work_id":"72f54777-a1f5-4c19-96e4-70ee070b394c","year":2026},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.452597Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:49312d23f7d53c27bb1f613c7d937bd4a9aef5153c562ec1b1dc47444c0e7dd8","observation_id":"27be3ffc-20aa-4e44-a17b-6a11649a923b","resolution":{"observed_at":"2026-08-10T21:55:48.779514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.751462Z","title":"Calatrava-Nicolas, Vishal Banwari, Paul Lukowicz, and Jakob Karolus","venue":null,"work_id":"742ed8f8-8c26-42a7-8afe-25b3caefbac7","year":2026},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.458797Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:3c3f01aa7c8890c265690aa49b273e14b57e91e5b0a544d2abfb1a1614c42e16","observation_id":"db55f68a-7683-4311-8828-9eca87e9b6ad","resolution":{"observed_at":"2026-08-10T21:55:48.757684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.464091Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.464091Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:660230f88bfe8f223263c2307f731b35ecf96267f5af46cfdfaa222541a08354","observation_id":"16e34616-3b26-4edd-9898-7c3859bc3efa","resolution":{"observed_at":"2026-08-10T21:55:48.464091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.720026Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":"b47c57ae-c8fa-40c8-8c79-1fe34d192f55","year":2022},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.469652Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:1e16cc3cd86aa627101f668efedfe21c38a04a5a045e19f0b79ea45396a3da48","observation_id":"650a7d9c-d339-495f-8d31-b00621072fa9","resolution":{"observed_at":"2026-08-10T21:55:48.726504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.475775Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.475775Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:d674e6c165c1764ad93eaae2d47fbdacdbd6ec633b52cc8a91827a0bad9b3c16","observation_id":"e73cb766-957f-44cc-96af-b48e7728d4b0","resolution":{"observed_at":"2026-08-10T21:55:48.475775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T21:55:48.482798Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.482798Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:7a96307a988807fa2fca0d5b31881005d9b2c4632e08aac70b910e613c78ed8d","observation_id":"935ca345-8cd5-4676-b1c7-9afaff076b2e","resolution":{"observed_at":"2026-08-10T21:55:48.482798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:55:48.683093Z","title":null,"venue":null,"work_id":"3348fb58-712d-4f57-bb0d-7a743f740370","year":2023},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.488301Z"},"links":{"citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:35038dfa2950fed2d0b623698c46b262bcac3321238becf7294f899111dd2340","observation_id":"c017cb6b-07b3-43a2-aeee-428ded8fd10d","resolution":{"observed_at":"2026-08-10T21:55:48.690843Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-10T21:55:48.493810Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:48.493810Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2608.06723"},"observation_digest":"sha256:46491e62914e2b425bf7441b28cf4ada7b08c38faa0390f1b9c5f7ea53999716","observation_id":"d0bc9ebd-b97a-45da-a5f0-74bed6e1952f","resolution":{"observed_at":"2026-08-10T21:55:48.493810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06723","last_updated":"2026-08-07T02:37:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T19:19:40.615179Z","submitted_at":"2026-08-07T02:37:02Z","title":"Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2608.06723."}